OpenAI, 세계 최고 알고리즘 대회서 인간 참가자 전원 격파
OpenAI의 최신 AI 에이전트가 세계적인 규모의 프로그래밍 대회인 AtCoder 월드 투어 결승전(Algorithm Division)에서 모든 인간 참가자를 제치고 1위를 차지했습니다. 이번 성과는 최근 몇 년간 특정 대회용으로 파인튜닝하지 않은 범용 추론 모델(GPT-5.6 기반)의 코딩 및 논리적 추론 능력이 인간의 최고 수준을 뛰어넘었음을 입증하는 중요한 이정표입니다.
OpenAI의 최신 AI 에이전트가 세계적인 규모의 프로그래밍 대회인 AtCoder 월드 투어 결승전(Algorithm Division)에서 모든 인간 참가자를 제치고 1위를 차지했습니다. 이번 성과는 최근 몇 년간 특정 대회용으로 파인튜닝하지 않은 범용 추론 모델(GPT-5.6 기반)의 코딩 및 논리적 추론 능력이 인간의 최고 수준을 뛰어넘었음을 입증하는 중요한 이정표입니다.
Epoch AI와 METR는 AI 모델이 원본 소스 코드 없이 전체 프로그램을 처음부터 다시 구현해야 하는 'MirrorCode' 벤치마크를 공개했습니다. Claude Opus 4.7 모델이 56%의 해결률로 1위를 차지했으나, 가장 복잡한 대규모 작업에서는 여전히 모든 모델이 완벽한 구현에 실패했습니다. 이는 최신 AI가 인간 개발자 수 주일이 걸리는 복잡한 장기 프로젝트를 얼마나 자율적으로 수행할 수 있는지 평가하는 중요한 기준점이 됩니다.
개발자가 해커뉴스에 공개한 상세 분석에 따르면, 앤스로픽의 '클로드 코드(Claude Code)'가 2월 업데이트 이후 복잡한 엔지니어링 작업을 수행하지 못할 정도로 품질이 심각하게 저하되었습니다. 분석 결과, 이 문제의 핵심 원인은 AI의 깊은 추론 과정을 숨기는 '사고 토큰 생략(redact-thinking)' 기능이 적용된 시점과 품질 저하 시점이 수치적으로 정확히 일치하기 때문인 것으로 나타났습니다. 이에 따라 시니어 엔지니어들로 구성된 해당 팀은 클로드 대신 다른 AI 제공업체로 갈아탔습니다.