클로드 페이블 5, 최고난도 수학 벤치마크에서 GPT-5.5 제압
Anthropic의 최신 모델인 Claude Fable 5가 최고난도 수학 벤치마크인 FrontierMath에서 88%의 정확도를 기록하며 OpenAI의 GPT-5.5를 13점 차이로 크게 앞섰습니다. 이는 불과 반년 전만 해도 최고난도 문제 정답률이 10% 미만이었던 점을 고려하면 AI의 수학적 추론 능력이 비약적으로 발전했음을 보여줍니다. 이러한 성능 향상은 단순한 벤치마크를 넘어, 오랜 미해결 수학 난제를 실제로 해결하는 등 실제 현실 세계에도 큰 파급력을 미치고 있습니다.
Anthropic의 새로운 모델 Claude Fable 5가 FrontierMath 벤치마크에서 최고 점수를 기록했습니다. Epoch AI에 따르면, Fable 5는 1단계부터 3단계까지 87%의 정확도를 보였으며, 가장 어려운 4단계(v2)에서는 88%의 정확도를 달성했습니다. Anthropic의 모델들은 짧은 기간 동안 수학 능력에서 비약적인 발전을 이루었습니다. 2026년 초만 해도 이전 모델이었던 Opus 4.5는 4단계에서 10% 미만의 점수를 기록했었습니다.
OpenAI의 GPT-5.5는 동일한 4단계에서 약 75%의 정확도를 보여 Fable 5에 크게 뒤처졌습니다. 단, 차세대 모델인 GPT-5.6은 이미 개발 중인 상태입니다. 참고로 모든 모델은 Epoch AI의 표준 환경(scaffold)에서 최대 추론 노력(reasoning effort)을 적용하여 테스트되었습니다. FrontierMath는 AI의 수학적 추론 능력을 평가하는 가장 어려운 벤치마크 중 하나로 널리 평가받고 있습니다.
이러한 수학 능력의 향상은 단순히 벤치마크에만 국한되지 않으며, 실제 사례도 계속해서 쌓이고 있습니다. 최근에는 OpenAI의 모델과 Claude Mythos 모두 오랜 기간 풀리지 않던 에르되시 문제(Erdős problem)를 해결하기도 했습니다.