메뉴
HN
Hacker News • 53일 전

AI가 단독으로 완성할 수 있는 가장 큰 소프트웨어 프로젝트는?

IMP
8/10
핵심 요약

기존 소프트웨어 엔지니어링 평가 방식과 달리, MirrorCode 벤치마크는 AI의 한계를 제대로 테스트하기 위해 파격적인 추론 예산을 제공합니다. 실제로 한 태스크에는 약 2,600달러의 비용이 들었으며, AI가 무려 19일 동안 사람의 개입 없이도 독립적으로 작업을 수행했습니다. 이는 자율적인 AI 코딩 에이전트가 실제 업무 환경에서 얼마나 복잡하고 장기적인 프로젝트를 감당할 수 있는지 보여주는 중요한 척도입니다.

번역된 본문

규모를 고려한 평가: 무엇보다 중요한 점은, 우리가 MirrorCode 태스크를 본격적으로 해결할 수 있도록 충분히 큰 추론 예산(inference budget)을 제공했다는 것입니다. 기존의 수많은 소프트웨어 엔지니어링 벤치마크들은 인간이 완료하는 데 몇 주가 걸리는 태스크조차도 1달러에서 10달러 수준으로 추론 비용 지출을 제한합니다. 예를 들어, 가장 규모가 큰 MirrorCode 태스크 중 하나는 단 한 번의 실행에 2,600달러의 비용이 소요되었으며, 이 과정에서 AI는 사람의 개입 없이 19일 동안 작업을 수행했습니다.

원문 보기
원문 보기 (영어)
Scale-aware evaluations Crucially, we provide a large enough inference budget to make a serious attempt at MirrorCode tasks. Many existing software engineering benchmarks limit inference spending to around $1–10, even when the task would take weeks for a human to complete. For example, one of the largest MirrorCode tasks cost $2,600 for a single run and involved AI working for 19 days without human intervention.