클로드 오푸스 5, 진정한 지능 벤치마크서 경쟁 모델 압도
Anthropic의 Claude Opus 5 모델이 실제 지능을 평가하는 ARC-AGI-3 벤치마크에서 기존 기록을 크게 뛰어넘는 30.2%를 기록하며 새로운 1위를 차지했습니다. 특히 이 모델은 낯선 환경에서 스스로 규칙을 유추하고 대수학적 표기법을 사용하는 등 이전 AI에서는 볼 수 없었던 고도화된 논리적 추론 능력을 입증했습니다. 하지만 일부 독자적인 테스트에서는 상대적으로 작은 향상만을 보여, 벤치마크 특화 성능 향상일 가능성도 제기되고 있습니다.
Anthropic의 Claude Opus 5가 실제 지능을 측정하기 위해 고안된 벤치마크에서 OpenAI의 GPT-5.6 Sol 및 Fable 5를 크게 압도했습니다.
주요 요점:
- Anthropic의 Claude Opus 5는 ARC-AGI-3 벤치마크에서 30.2%의 점수를 기록했습니다. 이는 OpenAI의 GPT-5.6 Sol (Max)가 세운 기존 기록 7.8%의 거의 4배에 달하는 수치입니다.
- ARC Prize 팀은 이러한 압도적인 선두를 차지한 이유가 더 낯선 환경에서 자율적인 탐색과 계획을 가능하게 하는 진정으로 강력한 논리적 추론 능력 덕분이라고 평가했습니다.
- 테스트 기간 동안 Opus 5는 과업을 대수학적 표기법(algebraic notation)으로 변환하고 반사 방정식(reflection equations)을 독립적으로 공식화하는 등 기존 AI 모델에서는 볼 수 없었던 새로운 행동을 보여주었으며, 이전에 풀리지 않았던 5개의 환경을 풀어내기도 했습니다.
ARC-AGI 벤치마크 개발자들은 Anthropic의 Claude Opus 5가 ARC-AGI-3에서 보여준 압도적인 격차는 '진정으로 향상된 추론 능력' 덕분이라고 설명합니다. 이 모델은 ARC-AGI-3에서 30.2%의 점수를 기록하며 새로운 1위에 올랐습니다. 기존 최고 기록은 OpenAI의 GPT-5.6 Sol (Max)가 세운 7.8%였습니다. 또한 Opus 5는 이전에 풀리지 않았던 5개의 환경을 해결했으며, 그중 4개는 인간 수준에 필적하거나 그 이상의 성능을 보였습니다. 이를 통해 ARC Prize에 따르면 약 20%를 기록한 것으로 알려진 Anthropic의 'Fable-class' 모델들보다도 앞서는 성능을 입증했습니다.
ARC Prize 분석팀은 Opus 5의 선두 수성을 더 강력해진 논리적 추론 덕분으로 돌리며, "이로 인해 낯선 환경에서 더 자율적인 탐색, 계획, 그리고 실행이 가능해졌다"고 밝혔습니다. 테스트 과정에서 Opus 5는 연구진이 기존 모델에서 한 번도 본 적 없는 행동을 보여주기도 했습니다. 예를 들어, 주어진 과업을 대수학적 표기법으로 번역하고 처음으로 스스로 반사 방정식을 공식화했습니다.
현재까지 공개된 25개의 데모 환경 중 6개가 해결되었습니다. 전체 결과, 리플레이 및 벤치마킹 코드는 모두 공개되어 있습니다. 구버전인 ARC-AGI-2 벤치마크에서는 Opus 5가 90.4%를 기록했으며, ARC-AGI-1에서는 97.5%에 도달했습니다. ARC Prize에 따르면 두 결과 모두 이전 최고 점수와 일치하지만, 다소 높은 비용이 소모되었습니다.
ARC-AGI-3는 AI 모델이 훈련 중에 접하지 못했던, 주로 인간이 쉽게 해결할 수 있는 새로운 과업을 얼마나 잘 해결하는지를 측정합니다. 현재 버전은 게임과 비슷하게 작동합니다. 모델은 상호작용 환경의 규칙을 스스로 추론하고, 행동을 계획하며, 이를 단계적으로 실행해야 합니다. 이는 단순히 저장된 지식을 평가하는 것이 아니라 '일반적인 추론 능력'을 테스트하는 데 목적이 있습니다. 일부 AI 시스템은 이미 이 벤치마크를 통과했을 수 있지만, 이들은 '하네스(harness)'라는 외부 소프트웨어에 의존했습니다. 공식 점수는 오직 언어 모델 자체의 성능만을 포함하며, ARC Prize는 미래의 AGI 시스템은 새로운 과업을 해결할 때 외부의 도움이 필요 없어야 한다고 주장합니다. 참고로 Claude Code 환경 내에서 Opus 5를 사용할 경우 점수는 훨씬 더 높아질 것으로 예상됩니다.
독자적인 테스트가 보여주하는 제한적인 성능 향상: Anthropic은 구체적인 성능 향상의 원인을 명확히 설명하지 않았지만, 타겟팅된 데이터 라벨링과 강화학습이 합리적인 요인으로 꼽힙니다. 이전 모델들과 달리 Opus 5는 ARC-AGI-3와 해당 포맷이 공개된 이후에 개발되었습니다. 따라서 정확히 일치하는 과업으로 훈련하지는 않았을지라도, Anthropic이 해당 벤치마크의 평가 스킬과 퍼즐 형식에 맞춰 훈련했을 가능성이 존재합니다. 예를 들어, 데이터 라벨링 작업자가 유사한 퍼즐의 추론 과정, 유용한 행동, 실패한 시도 및 복구 단계 등을 라벨링했을 수 있습니다. 이후 강화학습(RL) 과정에서 탐색, 계획, 규칙 발견 및 자가 수정을 통한 시도에 보상을 제공함으로써 성능을 극대화했을 수 있습니다.
하지만 상호작용 퍼즐 게임을 위해 개발된 Guanghan Ning의 비공개 벤치마크인 'Witness'에서의 독립적인 테스트는 다소 좁은 폭의 향상을 보여줍니다. 이 테스트에서 Opus 5는 43.4점을 기록하며 Kimi K3 및 Fable 5와 통계적으로 비슷한 수준을 보였고, ARC-AGI-3에서 보여준 것만큼 Opus 4.8 대비 큰 폭의 향상은 보여주지 못했습니다. Ning에 따르면 Opus 5는 어떤 행동도 취하기 전에 기존 퍼즐의 숨겨진 규칙을 파악했지만, 익숙하지 않은 메커니즘이 적용된 게임에서는 Opus 4.8보다 저조한 성능을 보였습니다. Ning은 이러한 패턴이 특정 장르 데이터를 활용한 훈련 결과와 부합한다고 언급했지만, Witness 벤치마크만으로는 Anthropic이 어떤 데이터를 사용했는지 특정할 수는 없다고 덧붙였습니다.
그럼에도 불구하고 ARC-AGI-3 개발자 중 한 명인 Greg Kamradt는 이번 결과가 AI의 더 폭넓은 추론 능력 향상 가능성을 배제하지 않는다고 밝혔습니다.