메뉴

#평가방법론

HN
Hacker News • 9일 전
IMP 8

최신 AI 모델, 물리학 벤치마크 재채점 결과 '거의 포화'

예일대 등 물리학 전문가 50여 명이 최신 프런티어 언어 모델을 6대 물리학 벤치마크에서 재평가한 결과, 기존 저조한 점수의 상당수가 모델의 오류가 아니라 채점 오류·잘못된 정답·모호한 문제 등 벤치마크 자체의 결함 때문이었다. 전문가가 오류를 수정한 결과 GPT-5.6-Sol은 HLE-Physics 47.3%→78.7%, CMT-Benchmark 61.0%→87.2%로 상승했으며, 폐쇄형 과제에서는 거의 포화 상태에 도달했다. 이는 현재 벤치마크가 AI의 실제 물리학 능력을 과소평가하고 있으며, 더 어렵고 전문가 검증된 평가의 필요성을 시사한다.

벤치마크 평가방법론 물리학