TD
The Decoder • 58일 전
IMP 7
OpenAI, 자체 API 환경에서 GPT-5.6 Sol 성능이 Claude Opus 5 능가한다고 주장
OpenAI가 자체 응답 API와 최적화된 환경을 적용했을 때 GPT-5.6 Sol 모델이 논리 벤치마크인 ARC-AGI-3에서 Anthropic의 Claude Opus 5보다 높은 점수를 기록했다고 주장했습니다. 하지만 공식 표준 환경에서는 점수가 크게 하락하여, 벤치마크 측정 방식과 API 기술적 세팅에 대한 공정성 논쟁이 촉발되었습니다. AI 모델 간의 벤치마크 비교가 단순한 모델 성능을 넘어 인프라 세팅에 따라 크게 좌우될 수 있음을 보여주는 중요한 사례입니다.
AI 벤치마크 OpenAI Anthropic