GPT-6 아스트라, IKEA 가구 조립 실수를 정확히 찾아낸다
Epoch AI의 가구 조립 벤치마크(FAB)에서 OpenAI의 GPT-6 Astra가 80%의 오류 탐지 정확도를 기록하며 2025년 11월 최고 모델(28%) 대비 큰 폭으로 발전했습니다. 실시간 조립 도우미로는 아직 느리지만, 자동차 수리나 가전 제품 수리 등 시각 기반 실무 지원 기술로 확장될 가능성이 있습니다.
Epoch AI의 가구 조립 벤치마크(FAB)에서 OpenAI의 GPT-6 Astra가 80%의 오류 탐지 정확도를 기록하며 2025년 11월 최고 모델(28%) 대비 큰 폭으로 발전했습니다. 실시간 조립 도우미로는 아직 느리지만, 자동차 수리나 가전 제품 수리 등 시각 기반 실무 지원 기술로 확장될 가능성이 있습니다.
예측연구소(FRI)의 중간 보고서에 따르면, 상위 대학 교수와 최다 피인용 연구자를 포함한 AI 전문가들이 최근 AI의 벤치마크 성과와 상용화 지표를 상당히 과소평가해 왔습니다. AI는 국제수학올림피아드 금메달 등 주요 마일스톤을 전망보다 수년 앞서 달성했으며, 경제 전망 역시 지나치게 보수적이었습니다. 이에 FRI는 빠른 AI 발전 속도에 맞춰 지속 갱신되는 LLM 예측 등 더 신속한 예측 방법을 도입할 계획입니다.
연구기관 Epoch AI는 특정 벤치마크 점수에 도달하는 비용이 분기당 평균 47%, 연간 약 13배씩 떨어지고 있다고 분석했습니다. 그러나 MIT 연구진은 하드웨어 저렴화와 경쟁 요인을 제거하면 순수 알고리즘 효율 개선은 연간 약 3배에 그친다고 지적합니다. 이는 가격 하락이 전부 실질적 기술 진보를 반영하는 것은 아니며, 모델 선택 시 벤치마크 점수만으로 판단할 수 없음을 시사합니다.
Artificial Analysis의 무료 데이터 API를 GitHub Actions 크론으로 매일 자동 수집해, 가격 대비 성능이 가장 뛰어난 '가치 프론티어(Value Frontier)' LLM을 예산별로 정리한 대시보드입니다. 사용자는 자신의 예산(100만 토큰당 비용)에 맞는 최적 모델과 차선 모델을 표에서 바로 찾을 수 있습니다. 코드와 데이터는 github.com/terryds/bestvaluemodel에서 공개되어 있습니다.
Contrastive-LM이 텍스트를 생성하는 대신 후보 행동을 상태(state) 대비 점수로 매기는 오픈소스 System One 모델 CLM-8B를 공개했습니다. 고정된 Qwen3-8B 인코더에 작은 프로젝션 헤드 2개를 추가해 InfoNCE 대비 학습으로 훈련했으며, 제로샷 테스트에서 TypeSafe의 Jev보다 최대 9배 빠릅니다. 미세조정된 헤드를 검증기(verifier)로 사용할 경우 DeepSWE 유출 테스트에서 81.6%, Terminal-Bench 2.1 유출 테스트에서 87.6%의 성능을 달성했습니다.
해커뉴스에 올라온 자율주행 리더보드에서 GPT-6 Astra(Codex·medium)가 3회 시도 중 2회째에 100% 코스 완주(5분 22초)를 달성하며 최상위를 기록했습니다. Claude Fable 5.1은 최고 45%, Grok 4.6은 11%, GPT-5.6 Sol은 6%에 그쳐 모델 간 실물 차량 제어 능력 격차가 뚜렷하게 드러났습니다.
AI 연구자 네이선 램버트가 미 의회에 제출한 증언을 확장한 글로, 미중 경쟁 관점에서 오픈 웨이트 모델의 현황을 진단합니다. 2025년 4월 이후 중국 기업들이 오픈 웨이트 모델 분야에서 명확히 앞서고 있으며, 허깅페이스 다운로드 수 기준으로 중국이 미국의 2배를 기록하고 있다고 지적합니다.
Anthropic이 2026년 9월 출시한 독점 모델 Claude Opus 5.5(적응형 추론, 최대 노력)이 Artificial Analysis 지능 지수 58점으로 동급 모델 중 1위를 차지했습니다. 다만 가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 중앙값보다 비싸고, 평가 중 2억 6천만 토큰을 생성해 상당히 장황한 편입니다. 텍스트와 이미지 입력을 지원하며 컨텍스트 창은 100만 토큰입니다.
안스로픽이 코딩·지식 작업 성능에서 새로운 최고 수준을 기록한 오퍼스 5.5를 출시했습니다. 더 큰 규모의 페이블 모델을 여러 벤치마크에서 능가하면서도 출력 토큰 가격이 mTok당 25달러에서 20달러로 인하되고 속도도 빨라졌습니다. 다리오 아모데이 CEO의 '프런티어 속도 조절' 선언 이후 첫 모델 출시로, 생물학·사이버보안 능력이 높아 페이블과 동일한 안전장치가 적용됩니다.
저자는 Claude Opus 4.5 같은 에이전트형 LLM에 적절한 가드레일과 제약 조건을 주고 반복적으로 최적화를 요청하면, 기존 최고 수준 구현보다 2~20배 빠른 러스트(Rust) 코드를 작성할 수 있음을 검증했습니다. PyO3로 파이썬과 연동하고 criterion 벤치마크 도구를 활용해 UMAP 차원 축소 알고리즘을 최소 의존성으로 처음부터 구현하는 실험을 진행했으며, unsafe 코드 금지 원칙을 지켰습니다.
Hacker News에 타입 기반 결정 모델을 평가하는 재현 가능한 벤치마크 'JevBench'가 소개되었습니다. 이 벤치마크가 classifier.dev를 측정한 결과, 이 서비스는 자체 모델이 아니라 TypeSafe의 Jev 모델에 가격 층과 저신뢰도 에스컬레이션(모델 캐스케이드)을 얹은 것으로 확인되었습니다. 자기 모델끼리 순위를 매기는 문제 때문에 v1.2.4부터 명예 언급으로 분류된다는 점이 흥미롭습니다.
일론 머스크의 xAI가 코딩·지식 작업용 최신 모델 Grok 4.7을 출시했습니다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 서방 최첨단 모델보다 중국 모델에 가까운 파격적 가격이지만, 종합 벤치마크에서는 Claude Fable 5.1과 GPT-6에 큰 격차로 뒤처지고 에이전트 코딩 벤치마크에서는 저가 DeepSeek 모델보다도 낮은 성적을 기록했습니다.
실리콘밸리의 대표적 초기 투자사 벤치마크(Benchmark)의 현직 제너럴 파트너 5인이 처음으로 테크크런치 디스럽트 2026 무대에 함께 올라 VC 시장의 향후 방향과 다음 세대 스타트업이 어디서 나올지 논의합니다. 2025년 AI 기업이 글로벌 VC 투자의 61%(2,587억 달러)를 차지한 가운데, 자본은 넘치지만 확신은 부족한 시장에서 무엇이 투자 대상이 되는지 다섯 명의 중진 투자자가 나누는 자리입니다.
MarkTechPost가 10초짜리 음성 샘플을 7개 음성 복제 API 플랫폼에 복제해 성능을 비교했습니다. 평가 기준은 참조 오디오 요구 사항, 화자 유사도, 동의(Consent) 검증, 라이선스 정책, 그리고 100만 자당 가격입니다. 음성 합성 서비스 도입을 검토하는 실무자에게 유용한 벤치마크 자료입니다.
예일대 등 물리학 전문가 50여 명이 최신 프런티어 언어 모델을 6대 물리학 벤치마크에서 재평가한 결과, 기존 저조한 점수의 상당수가 모델의 오류가 아니라 채점 오류·잘못된 정답·모호한 문제 등 벤치마크 자체의 결함 때문이었다. 전문가가 오류를 수정한 결과 GPT-5.6-Sol은 HLE-Physics 47.3%→78.7%, CMT-Benchmark 61.0%→87.2%로 상승했으며, 폐쇄형 과제에서는 거의 포화 상태에 도달했다. 이는 현재 벤치마크가 AI의 실제 물리학 능력을 과소평가하고 있으며, 더 어렵고 전문가 검증된 평가의 필요성을 시사한다.
코드 리뷰 벤치마크에서 저가형 GPT-5.6 Luna는 GPT-6 Astra 대비 3.6% 비용으로 75% 수준의 검증된 버그를 찾아냈지만, 보안 버그 탐지율이 크게 뒤떨어지고 오탐률도 4배 이상 높았습니다. 일상적인 정확성 버그에는 Luna로 충분하지만, 인증·권한 코드 리뷰에는 단독 사용이 권장되지 않는다는 결론입니다.
안돈 랩스(Andon Labs)가 자판기, 매장, 카페 등 실제 사업체를 AI가 자율적으로 운영하기 위해 만든 플랫폼 '피온(Pion)'을 외부에 개방했다. 이는 원래 위험한 AI 역량 평가 도구로 시작된 '벤딩-벤치(Vending-Bench)' 시뮬레이션의 연장선으로, AI가 실제 세계에서 자율적으로 자원을 획득할 수 있는지 측정하기 위한 것이다. 피온은 AI의 자율 사업 운영 능력과 한계를 실험할 수 있는 기회를 제공하며, 정렬되지 않은 AI가 사업으로 자금을 모을 위험을 평가하는 안전 연구의 의미도 갖는다.
교과서 이론과 달리 ML 벤치마크를 반복 평가하며 개선해도 과적합(overfitting)이 잘 일어나지 않는 이유를 설명한 연구입니다. 핵심은 성공적인 에이전트의 전략이 압축 가능한 형태로 표현될 수 있어 데이터를 암기할 여지가 없다는 점이며, 압축 테스트가 과적합 여부를 판별하는 진단 도구로 활용될 수 있습니다. 이는 LLM이 방대한 세계 지식을 바탕으로 간결한 지시만으로도 완성된 ML 파이프라인을 재구성하는 강력한 '압축 디코더'라는 관점도 제공합니다.
스탠퍼드 등 연구진이 로컬 AI 추론의 성능과 전력 효율을 함께 측정하는 '와트당 지능(IPW)' 지표를 제안했습니다. 2023~2025년 분석 결과 로컬 모델의 IPW가 5.3배 향상되었으며, 실제 쿼리의 88.7%를 로컬 모델이 성공적으로 처리할 수 있는 것으로 나타났습니다. 로컬 가속기는 동일 모델 기준 클라우드보다 최소 1.4배 높은 전력 효율을 보여, 클라우드 중심 AI 인프라의 수요 분산 가능성을 제시합니다.
중국 연구소 AllSpark가 350억과 3,970억 파라미터의 오픈 소스 검색 에이전트 Iris-mini와 Iris-pro를 전체 학습 레시피와 함께 공개했습니다. 두 모델은 웹 링크 구조에서 역설계된 다단계 질문과 2단계 필터링, 강화학습으로 학습되어 동급 오픈 소스 검색 에이전트 중 최고 성능을 기록했습니다. 학습되지 않은 일반 도구 사용·사무 작업에서도 성능이 향상되었다는 점과 컨텍스트 관리가 벤치마크 결과에 미치는 영향을 분석한 점이 주목할 만합니다.
안돈 랩스(Andon Labs)의 에이전트 벤치마크에서 GPT-6 Astra가 자판기 사업 시뮬레이션에서 Claude Fable 5.1보다 약 3배 높은 최종 잔액을 기록했습니다. 또한 드론이 특정 인물을 자율적으로 찾아 추적하는 코드를 작성하는 Drone-Bench에서 모든 5개 과제에서 인간-AI 기준선을 넘은 최초의 모델이 되었습니다. 다만 성공률이 아직 불안정하다는 점은 유의해야 합니다.
Real-SWE는 실제 기업으로부터 라이선스를 받은 비공개 운영 코드베이스에서 최신 AI 모델을 평가하는 새로운 벤치마크입니다. 과금, 세금 계산, 고객 마이그레이션 같은 실제 비즈니스 결과가 걸린 작업을 다루며, 기업 고유의 코딩 관례와 복잡한 맥락을 이해해야 합니다. 공개 인터넷에 존재하지 않는 독점 시스템에서 에이전트가 실제 소프트웨어 엔지니어의 업무를 수행할 수 있는지를 검증한다는 점에서 주목받습니다.
ModelRift이 Claude Opus 5 에이전트를 이용해 코드 기반 CAD 도구인 OpenSCAD와 CadQuery를 통제된 조건에서 비교한 벤치마크 결과다. 여섯 에이전트가 세 가지 과제(선반 브래킷, 스냅핏 케이스, 나사산 호스 어댑터)를 수행한 결과 모두 출력 가능한 부품을 만들었으며, 순수 성능 차이보다는 '실패 방식'에서 두 도구가 뚜렷이 갈렸다. CadQuery는 기하학 재계산에 최대 2초가 걸리는 등 느렸고, OpenSCAD는 잘못된 기하학을 조용히 생성하는 경우가 더 많았다.
바이댄스 시드(ByteDance Seed)와 SUTD, 조지아텍 등이 모델이 내놓는 답변이 아닌, 모델이 직접 구축한 실행 가능한 하니스(harness)를 평가하는 벤치마크 'HarnessDev'를 발표했습니다. 6개 생성 LLM이 0점의 시드에서 출발해 5개 벤치마크와 2,207개 과제에 대해 하니스를 구축하고 실행 피드백으로 개선했는데, 자체 구축 하니스는 글쓰기와 ML 실험에서 인간 수준에 도달했으나 코딩과 검색에서는 뒤떨어졌습니다. 특히 64개의 개선 변경 중 34개만 홀드아웃 과제에서도 같은 방향으로 일반화되어, LLM의 자기 개선 능력의 한계를 보여준다는 점이 주목됩니다.
OpenAI의 GPT-6 Astra가 미해결 수학 문제 벤치마크 ErdosBench에서 1위를 차지했으나, 수석 과학자 Jakub Pachocki는 수학 최적화를 의도적으로 우선하지 않았다고 밝혔다. 이는 AI 능력이 최적화하는 영역에서만 집중적으로 성장하는 '뾰족한(spiky)' 발전 경향을 시사하며, OpenAI는 재귀적 자기개선(RSI)과 자동 정렬 연구에 자원을 쏟고 있다.
Sebastian Raschka가 OpenAI의 새 모델 GPT-6 아스트라(Astra)의 성능을 리뷰하고, 루프 트랜스포머(Looped Transformer, 순환 깊이) 구조와 추론 과정(chain of thought)을 숨긴다는 소문이 실제로 어떤 관계가 있는지 분석합니다. 아스트라는 특히 3D 렌더링·애니메이션에서 압도적이며 ARC-AGI-3에서 99.9%를 달성했지만, 코딩 에이전트 벤치마크에서는 독립 평가 기준에 따라 성능이 다소 낮게 측정될 수 있다는 점도 짚습니다.
메타 FAIR이 옥스퍼드대·UCL과 함께 AI 연구 선호 모델(RPM)을 발표했습니다. RPM은 고정된 LLM 심판 역할을 하여 아직 실행하지 않은 15개 실험 후보를 평가·순위화하고 그중 하나만 실제로 실행합니다. AIRS-Bench에서 평균 정규화 점수가 0.684에서 0.729로 상승했고, 기존 24시간 걸리던 결과가 약 15시간 만에 도달해 비용 효율적인 자동 AI 연구에 중요한 진전입니다.
UC버클리 주도 연구팀이 컴퓨터 사용 에이전트(Computer-Use Agent) 훈련과 벤치마킹에 필요한 에이전트, 환경, 트레이스, 평가·훈련 프레임워크를 하나의 행동 공간과 데이터 스키마로 통합한 오픈소스 플랫폼 CUA-Lite를 공개했습니다. OSWorld의 작업별 가상머신 방식 대신 일반 Docker 컨테이너를 사용해 용량도 4.1GB에서 0.9GB로 대폭 줄였다는 점이 핵심입니다.
OpenAI의 GPT-6 Astra를 로봇 팔(YAM 암)에 적용해 Claude Fable 5/5.1과 동일한 두 가지 조작 과제로 비교한 벤치마크 결과다. 블록을 그릇에 넣는 과제에서 Astra는 20회 중 19회 성공(95%)하며 Fable 5.1(8회)을 크게 앞섰고, 회당 비용도 약 절반($0.94 vs $2.12), 소요 시간도 2.5분으로 훨씬 빨랐다. 반면 퍼즐 조각 끼우기 과제에서는 두 모델 모두 20회 중 2회에 그치며 마지막 삽입 단계에서 같은 지점에 막히는 한계를 보였다.
OpenAI의 GPT-6 Astra는 벤치마크 평가 기관마다 상반된 평가를 받고 있다. Epoch AI는 169점으로 1위로 꼽았지만 Artificial Analysis는 이전 모델과 동급인 61점에 그쳤다. 그러나 ARC-AGI-3에서 처음으로 평균 인간보다 효율적으로 과제를 수행하면서 ARC Prize의 프랑수아 촐레(François Chollet)는 예상보다 2배 빠른 진전이라며 AGI 도래 전망을 앞당겼다.