메뉴

#벤치마크

TD
The Decoder • 1일 전
IMP 7

최고 AI 전문가들도 AI 발전 속도를 크게 과소평가했다

예측연구소(FRI)의 중간 보고서에 따르면, 상위 대학 교수와 최다 피인용 연구자를 포함한 AI 전문가들이 최근 AI의 벤치마크 성과와 상용화 지표를 상당히 과소평가해 왔습니다. AI는 국제수학올림피아드 금메달 등 주요 마일스톤을 전망보다 수년 앞서 달성했으며, 경제 전망 역시 지나치게 보수적이었습니다. 이에 FRI는 빠른 AI 발전 속도에 맞춰 지속 갱신되는 LLM 예측 등 더 신속한 예측 방법을 도입할 계획입니다.

AI 예측 AI 전망 벤치마크
TD
The Decoder • 1일 전
IMP 7

AI 성능 비용, 역대 어떤 기술보다 빠르게 하락

연구기관 Epoch AI는 특정 벤치마크 점수에 도달하는 비용이 분기당 평균 47%, 연간 약 13배씩 떨어지고 있다고 분석했습니다. 그러나 MIT 연구진은 하드웨어 저렴화와 경쟁 요인을 제거하면 순수 알고리즘 효율 개선은 연간 약 3배에 그친다고 지적합니다. 이는 가격 하락이 전부 실질적 기술 진보를 반영하는 것은 아니며, 모델 선택 시 벤치마크 점수만으로 판단할 수 없음을 시사합니다.

AI 비용 벤치마크 Epoch AI
HN
Hacker News • 1일 전
IMP 6

예산별 최고의 LLM, 매일 업데이트

Artificial Analysis의 무료 데이터 API를 GitHub Actions 크론으로 매일 자동 수집해, 가격 대비 성능이 가장 뛰어난 '가치 프론티어(Value Frontier)' LLM을 예산별로 정리한 대시보드입니다. 사용자는 자신의 예산(100만 토큰당 비용)에 맞는 최적 모델과 차선 모델을 표에서 바로 찾을 수 있습니다. 코드와 데이터는 github.com/terryds/bestvaluemodel에서 공개되어 있습니다.

LLM 가격 대비 성능 벤치마크
MP
MarkTechPost • 2일 전
IMP 6

컨트라스티브-LM, CLM-8B 공개…제브 대비 최대 9배 빠른 에이전트 행동 평가

Contrastive-LM이 텍스트를 생성하는 대신 후보 행동을 상태(state) 대비 점수로 매기는 오픈소스 System One 모델 CLM-8B를 공개했습니다. 고정된 Qwen3-8B 인코더에 작은 프로젝션 헤드 2개를 추가해 InfoNCE 대비 학습으로 훈련했으며, 제로샷 테스트에서 TypeSafe의 Jev보다 최대 9배 빠릅니다. 미세조정된 헤드를 검증기(verifier)로 사용할 경우 DeepSWE 유출 테스트에서 81.6%, Terminal-Bench 2.1 유출 테스트에서 87.6%의 성능을 달성했습니다.

에이전트 오픈소스 대조학습
HN
Hacker News • 2일 전
IMP 8

GPT-6 Astra, 자동차 주행 능력 획득

해커뉴스에 올라온 자율주행 리더보드에서 GPT-6 Astra(Codex·medium)가 3회 시도 중 2회째에 100% 코스 완주(5분 22초)를 달성하며 최상위를 기록했습니다. Claude Fable 5.1은 최고 45%, Grok 4.6은 11%, GPT-5.6 Sol은 6%에 그쳐 모델 간 실물 차량 제어 능력 격차가 뚜렷하게 드러났습니다.

GPT-6 자율주행 에이전트
HN
Hacker News • 3일 전
IMP 8

오픈 모델 세계의 현재 주도권 구도

AI 연구자 네이선 램버트가 미 의회에 제출한 증언을 확장한 글로, 미중 경쟁 관점에서 오픈 웨이트 모델의 현황을 진단합니다. 2025년 4월 이후 중국 기업들이 오픈 웨이트 모델 분야에서 명확히 앞서고 있으며, 허깅페이스 다운로드 수 기준으로 중국이 미국의 2배를 기록하고 있다고 지적합니다.

오픈소스 오픈웨이트모델 미중AI경쟁
HN
Hacker News • 3일 전
IMP 8

Claude Opus 5.5 지능·성능·가격 분석

Anthropic이 2026년 9월 출시한 독점 모델 Claude Opus 5.5(적응형 추론, 최대 노력)이 Artificial Analysis 지능 지수 58점으로 동급 모델 중 1위를 차지했습니다. 다만 가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 중앙값보다 비싸고, 평가 중 2억 6천만 토큰을 생성해 상당히 장황한 편입니다. 텍스트와 이미지 입력을 지원하며 컨텍스트 창은 100만 토큰입니다.

Claude Anthropic 벤치마크
TC
TechCrunch AI • 3일 전
IMP 8

안스로픽, 가격 인하된 오퍼스 5.5 출시…페이블급 성능

안스로픽이 코딩·지식 작업 성능에서 새로운 최고 수준을 기록한 오퍼스 5.5를 출시했습니다. 더 큰 규모의 페이블 모델을 여러 벤치마크에서 능가하면서도 출력 토큰 가격이 mTok당 25달러에서 20달러로 인하되고 속도도 빨라졌습니다. 다리오 아모데이 CEO의 '프런티어 속도 조절' 선언 이후 첫 모델 출시로, 생물학·사이버보안 능력이 높아 페이블과 동일한 안전장치가 적용됩니다.

안스로픽 오퍼스-5.5 가격-인하
HN
Hacker News • 3일 전
IMP 7

AI 에이전트에게 '더 빠르게' 요청해 러스트 코드 최적화하기

저자는 Claude Opus 4.5 같은 에이전트형 LLM에 적절한 가드레일과 제약 조건을 주고 반복적으로 최적화를 요청하면, 기존 최고 수준 구현보다 2~20배 빠른 러스트(Rust) 코드를 작성할 수 있음을 검증했습니다. PyO3로 파이썬과 연동하고 criterion 벤치마크 도구를 활용해 UMAP 차원 축소 알고리즘을 최소 의존성으로 처음부터 구현하는 실험을 진행했으며, unsafe 코드 금지 원칙을 지켰습니다.

러스트 코드-최적화 LLM-코딩
HN
Hacker News • 3일 전
IMP 5

JevBench — 타입 안전 결정 모델을 위한 재현 가능한 벤치마크 공개

Hacker News에 타입 기반 결정 모델을 평가하는 재현 가능한 벤치마크 'JevBench'가 소개되었습니다. 이 벤치마크가 classifier.dev를 측정한 결과, 이 서비스는 자체 모델이 아니라 TypeSafe의 Jev 모델에 가격 층과 저신뢰도 에스컬레이션(모델 캐스케이드)을 얹은 것으로 확인되었습니다. 자기 모델끼리 순위를 매기는 문제 때문에 v1.2.4부터 명예 언급으로 분류된다는 점이 흥미롭습니다.

벤치마크 결정 모델 모델 캐스케이드
TD
The Decoder • 4일 전
IMP 6

xAI, 저렴한 가격의 Grok 4.7 출시…벤치마크는 경쟁사에 크게 뒤져

일론 머스크의 xAI가 코딩·지식 작업용 최신 모델 Grok 4.7을 출시했습니다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 서방 최첨단 모델보다 중국 모델에 가까운 파격적 가격이지만, 종합 벤치마크에서는 Claude Fable 5.1과 GPT-6에 큰 격차로 뒤처지고 에이전트 코딩 벤치마크에서는 저가 DeepSeek 모델보다도 낮은 성적을 기록했습니다.

xAI Grok 벤치마크
TC
TechCrunch AI • 4일 전
IMP 5

벤치마크 파트너 5인, 테크크런치 디스럽트 2026서 '다음 히트 스타트업' 전망

실리콘밸리의 대표적 초기 투자사 벤치마크(Benchmark)의 현직 제너럴 파트너 5인이 처음으로 테크크런치 디스럽트 2026 무대에 함께 올라 VC 시장의 향후 방향과 다음 세대 스타트업이 어디서 나올지 논의합니다. 2025년 AI 기업이 글로벌 VC 투자의 61%(2,587억 달러)를 차지한 가운데, 자본은 넘치지만 확신은 부족한 시장에서 무엇이 투자 대상이 되는지 다섯 명의 중진 투자자가 나누는 자리입니다.

벤처캐피탈 벤치마크 테크크런치디스럽트
MP
MarkTechPost • 5일 전
IMP 6

2026년 최고의 음성 복제 API 비교

MarkTechPost가 10초짜리 음성 샘플을 7개 음성 복제 API 플랫폼에 복제해 성능을 비교했습니다. 평가 기준은 참조 오디오 요구 사항, 화자 유사도, 동의(Consent) 검증, 라이선스 정책, 그리고 100만 자당 가격입니다. 음성 합성 서비스 도입을 검토하는 실무자에게 유용한 벤치마크 자료입니다.

음성복제 음성합성 API
HN
Hacker News • 9일 전
IMP 8

최신 AI 모델, 물리학 벤치마크 재채점 결과 '거의 포화'

예일대 등 물리학 전문가 50여 명이 최신 프런티어 언어 모델을 6대 물리학 벤치마크에서 재평가한 결과, 기존 저조한 점수의 상당수가 모델의 오류가 아니라 채점 오류·잘못된 정답·모호한 문제 등 벤치마크 자체의 결함 때문이었다. 전문가가 오류를 수정한 결과 GPT-5.6-Sol은 HLE-Physics 47.3%→78.7%, CMT-Benchmark 61.0%→87.2%로 상승했으며, 폐쇄형 과제에서는 거의 포화 상태에 도달했다. 이는 현재 벤치마크가 AI의 실제 물리학 능력을 과소평가하고 있으며, 더 어렵고 전문가 검증된 평가의 필요성을 시사한다.

벤치마크 평가방법론 물리학
HN
Hacker News • 11일 전
IMP 6

GPT-5.6 루나 vs GPT-6 아스트라: 1.2달러 모델로 코드 리뷰가 가능할까?

코드 리뷰 벤치마크에서 저가형 GPT-5.6 Luna는 GPT-6 Astra 대비 3.6% 비용으로 75% 수준의 검증된 버그를 찾아냈지만, 보안 버그 탐지율이 크게 뒤떨어지고 오탐률도 4배 이상 높았습니다. 일상적인 정확성 버그에는 Luna로 충분하지만, 인증·권한 코드 리뷰에는 단독 사용이 권장되지 않는다는 결론입니다.

코드 리뷰 GPT-6 GPT-5.6
HN
Hacker News • 11일 전
IMP 7

안돈랩스, 기업을 완전 자율 운영하는 AI 에이전트 '피온(Pion)' 공개

안돈 랩스(Andon Labs)가 자판기, 매장, 카페 등 실제 사업체를 AI가 자율적으로 운영하기 위해 만든 플랫폼 '피온(Pion)'을 외부에 개방했다. 이는 원래 위험한 AI 역량 평가 도구로 시작된 '벤딩-벤치(Vending-Bench)' 시뮬레이션의 연장선으로, AI가 실제 세계에서 자율적으로 자원을 획득할 수 있는지 측정하기 위한 것이다. 피온은 AI의 자율 사업 운영 능력과 한계를 실험할 수 있는 기회를 제공하며, 정렬되지 않은 AI가 사업으로 자금을 모을 위험을 평가하는 안전 연구의 의미도 갖는다.

AI 에이전트 자율 운영 안돈 랩스
HN
Hacker News • 11일 전
IMP 7

머신러닝 리서치 에이전트는 왜 과적합되지 않을까?

교과서 이론과 달리 ML 벤치마크를 반복 평가하며 개선해도 과적합(overfitting)이 잘 일어나지 않는 이유를 설명한 연구입니다. 핵심은 성공적인 에이전트의 전략이 압축 가능한 형태로 표현될 수 있어 데이터를 암기할 여지가 없다는 점이며, 압축 테스트가 과적합 여부를 판별하는 진단 도구로 활용될 수 있습니다. 이는 LLM이 방대한 세계 지식을 바탕으로 간결한 지시만으로도 완성된 ML 파이프라인을 재구성하는 강력한 '압축 디코더'라는 관점도 제공합니다.

머신러닝 과적합 AI에이전트
HN
Hacker News • 12일 전
IMP 8

와트당 지능: 로컬 AI의 지능 효율성 측정

스탠퍼드 등 연구진이 로컬 AI 추론의 성능과 전력 효율을 함께 측정하는 '와트당 지능(IPW)' 지표를 제안했습니다. 2023~2025년 분석 결과 로컬 모델의 IPW가 5.3배 향상되었으며, 실제 쿼리의 88.7%를 로컬 모델이 성공적으로 처리할 수 있는 것으로 나타났습니다. 로컬 가속기는 동일 모델 기준 클라우드보다 최소 1.4배 높은 전력 효율을 보여, 클라우드 중심 AI 인프라의 수요 분산 가능성을 제시합니다.

로컬 AI LLM 추론 전력 효율
TD
The Decoder • 12일 전
IMP 7

아이리스 미니·프로, 동급 오픈 소스 검색 에이전트 중 최강

중국 연구소 AllSpark가 350억과 3,970억 파라미터의 오픈 소스 검색 에이전트 Iris-mini와 Iris-pro를 전체 학습 레시피와 함께 공개했습니다. 두 모델은 웹 링크 구조에서 역설계된 다단계 질문과 2단계 필터링, 강화학습으로 학습되어 동급 오픈 소스 검색 에이전트 중 최고 성능을 기록했습니다. 학습되지 않은 일반 도구 사용·사무 작업에서도 성능이 향상되었다는 점과 컨텍스트 관리가 벤치마크 결과에 미치는 영향을 분석한 점이 주목할 만합니다.

검색 에이전트 오픈소스 강화학습
TD
The Decoder • 12일 전
IMP 8

GPT-6 Astra, 감시 드론 조종·자율 사업 운영 모두 성공

안돈 랩스(Andon Labs)의 에이전트 벤치마크에서 GPT-6 Astra가 자판기 사업 시뮬레이션에서 Claude Fable 5.1보다 약 3배 높은 최종 잔액을 기록했습니다. 또한 드론이 특정 인물을 자율적으로 찾아 추적하는 코드를 작성하는 Drone-Bench에서 모든 5개 과제에서 인간-AI 기준선을 넘은 최초의 모델이 되었습니다. 다만 성공률이 아직 불안정하다는 점은 유의해야 합니다.

GPT-6 에이전트 벤치마크
HN
Hacker News • 13일 전
IMP 8

리얼-SWE: 비공개 실제 기업 코드베이스에서 AI 모델 평가

Real-SWE는 실제 기업으로부터 라이선스를 받은 비공개 운영 코드베이스에서 최신 AI 모델을 평가하는 새로운 벤치마크입니다. 과금, 세금 계산, 고객 마이그레이션 같은 실제 비즈니스 결과가 걸린 작업을 다루며, 기업 고유의 코딩 관례와 복잡한 맥락을 이해해야 합니다. 공개 인터넷에 존재하지 않는 독점 시스템에서 에이전트가 실제 소프트웨어 엔지니어의 업무를 수행할 수 있는지를 검증한다는 점에서 주목받습니다.

벤치마크 코딩 에이전트 엔터프라이즈 소프트웨어
HN
Hacker News • 13일 전
IMP 6

AI 에이전트 CAD 작업 벤치마크: CadQuery vs. OpenSCAD

ModelRift이 Claude Opus 5 에이전트를 이용해 코드 기반 CAD 도구인 OpenSCAD와 CadQuery를 통제된 조건에서 비교한 벤치마크 결과다. 여섯 에이전트가 세 가지 과제(선반 브래킷, 스냅핏 케이스, 나사산 호스 어댑터)를 수행한 결과 모두 출력 가능한 부품을 만들었으며, 순수 성능 차이보다는 '실패 방식'에서 두 도구가 뚜렷이 갈렸다. CadQuery는 기하학 재계산에 최대 2초가 걸리는 등 느렸고, OpenSCAD는 잘못된 기하학을 조용히 생성하는 경우가 더 많았다.

에이전트 CAD 벤치마크
MP
MarkTechPost • 14일 전
IMP 6

LLM이 스스로 에이전트 하니스를 설계할 수 있을까

바이댄스 시드(ByteDance Seed)와 SUTD, 조지아텍 등이 모델이 내놓는 답변이 아닌, 모델이 직접 구축한 실행 가능한 하니스(harness)를 평가하는 벤치마크 'HarnessDev'를 발표했습니다. 6개 생성 LLM이 0점의 시드에서 출발해 5개 벤치마크와 2,207개 과제에 대해 하니스를 구축하고 실행 피드백으로 개선했는데, 자체 구축 하니스는 글쓰기와 ML 실험에서 인간 수준에 도달했으나 코딩과 검색에서는 뒤떨어졌습니다. 특히 64개의 개선 변경 중 34개만 홀드아웃 과제에서도 같은 방향으로 일반화되어, LLM의 자기 개선 능력의 한계를 보여준다는 점이 주목됩니다.

에이전트 벤치마크 LLM
TD
The Decoder • 15일 전
IMP 7

GPT-6 Astra, 수학자들에게 숨돌릴 틈 줘…오픈AI는 의도된 결과라고 밝혀

OpenAI의 GPT-6 Astra가 미해결 수학 문제 벤치마크 ErdosBench에서 1위를 차지했으나, 수석 과학자 Jakub Pachocki는 수학 최적화를 의도적으로 우선하지 않았다고 밝혔다. 이는 AI 능력이 최적화하는 영역에서만 집중적으로 성장하는 '뾰족한(spiky)' 발전 경향을 시사하며, OpenAI는 재귀적 자기개선(RSI)과 자동 정렬 연구에 자원을 쏟고 있다.

OpenAI GPT-6 Astra 수학
HN
Hacker News • 16일 전
IMP 9

GPT-6 아스트라와 루프 트랜스포머, 숨겨진 추론

Sebastian Raschka가 OpenAI의 새 모델 GPT-6 아스트라(Astra)의 성능을 리뷰하고, 루프 트랜스포머(Looped Transformer, 순환 깊이) 구조와 추론 과정(chain of thought)을 숨긴다는 소문이 실제로 어떤 관계가 있는지 분석합니다. 아스트라는 특히 3D 렌더링·애니메이션에서 압도적이며 ARC-AGI-3에서 99.9%를 달성했지만, 코딩 에이전트 벤치마크에서는 독립 평가 기준에 따라 성능이 다소 낮게 측정될 수 있다는 점도 짚습니다.

GPT-6 아스트라 루프 트랜스포머
MP
MarkTechPost • 19일 전
IMP 7

메타 FAIR, GPU 낭비 줄이는 AI 연구 선호 모델(RPM) 공개

메타 FAIR이 옥스퍼드대·UCL과 함께 AI 연구 선호 모델(RPM)을 발표했습니다. RPM은 고정된 LLM 심판 역할을 하여 아직 실행하지 않은 15개 실험 후보를 평가·순위화하고 그중 하나만 실제로 실행합니다. AIRS-Bench에서 평균 정규화 점수가 0.684에서 0.729로 상승했고, 기존 24시간 걸리던 결과가 약 15시간 만에 도달해 비용 효율적인 자동 AI 연구에 중요한 진전입니다.

메타 FAIR 선호 모델 AI 연구 에이전트
MP
MarkTechPost • 20일 전
IMP 6

UC버클리, 컴퓨터 사용 AI 에이전트 통합 플랫폼 'CUA-Lite' 공개

UC버클리 주도 연구팀이 컴퓨터 사용 에이전트(Computer-Use Agent) 훈련과 벤치마킹에 필요한 에이전트, 환경, 트레이스, 평가·훈련 프레임워크를 하나의 행동 공간과 데이터 스키마로 통합한 오픈소스 플랫폼 CUA-Lite를 공개했습니다. OSWorld의 작업별 가상머신 방식 대신 일반 Docker 컨테이너를 사용해 용량도 4.1GB에서 0.9GB로 대폭 줄였다는 점이 핵심입니다.

컴퓨터사용에이전트 UC버클리 오픈소스
HN
Hacker News • 20일 전
IMP 8

로봇 팔을 제어하는 GPT-6 Astra

OpenAI의 GPT-6 Astra를 로봇 팔(YAM 암)에 적용해 Claude Fable 5/5.1과 동일한 두 가지 조작 과제로 비교한 벤치마크 결과다. 블록을 그릇에 넣는 과제에서 Astra는 20회 중 19회 성공(95%)하며 Fable 5.1(8회)을 크게 앞섰고, 회당 비용도 약 절반($0.94 vs $2.12), 소요 시간도 2.5분으로 훨씬 빨랐다. 반면 퍼즐 조각 끼우기 과제에서는 두 모델 모두 20회 중 2회에 그치며 마지막 삽입 단계에서 같은 지점에 막히는 한계를 보였다.

로봇공학 GPT-6 벤치마크
TD
The Decoder • 21일 전
IMP 9

GPT-6 아스트라, ARC-AGI-3서 인간 능가… 촐레 AGI 전망 앞당겨

OpenAI의 GPT-6 Astra는 벤치마크 평가 기관마다 상반된 평가를 받고 있다. Epoch AI는 169점으로 1위로 꼽았지만 Artificial Analysis는 이전 모델과 동급인 61점에 그쳤다. 그러나 ARC-AGI-3에서 처음으로 평균 인간보다 효율적으로 과제를 수행하면서 ARC Prize의 프랑수아 촐레(François Chollet)는 예상보다 2배 빠른 진전이라며 AGI 도래 전망을 앞당겼다.

GPT-6 OpenAI ARC-AGI
HN
Hacker News • 22일 전
IMP 7

코딩 AI 에이전트는 어떤 도구를 고를까? 1.7만 회 실험으로 검증

연구진이 실제 GitHub 저장소 통계를 바탕으로 75개의 가상 저장소와 1,163개의 실전 과제를 만들어 Claude, Codex, Cursor 등 코딩 에이전트의 도구·서비스 선택을 1.7만 회 측정했습니다. '시뮬레이션된 인간'과 자동 평가자를 도입해 편향을 줄였으며, 그 결과 에이전트가 특정 조건에서는 기존 빅테크 솔루션 대신 Cloudflare R2 같은 대안을 선택하는 등 더 현실적인 선택 패턴이 드러났습니다.

코딩에이전트 벤치마크 Claude