HN
Hacker News • 53일 전
IMP 8
AI가 단독으로 완성할 수 있는 가장 큰 소프트웨어 프로젝트는?
기존 소프트웨어 엔지니어링 평가 방식과 달리, MirrorCode 벤치마크는 AI의 한계를 제대로 테스트하기 위해 파격적인 추론 예산을 제공합니다. 실제로 한 태스크에는 약 2,600달러의 비용이 들었으며, AI가 무려 19일 동안 사람의 개입 없이도 독립적으로 작업을 수행했습니다. 이는 자율적인 AI 코딩 에이전트가 실제 업무 환경에서 얼마나 복잡하고 장기적인 프로젝트를 감당할 수 있는지 보여주는 중요한 척도입니다.
AI 코딩 에이전트 소프트웨어 엔지니어링 벤치마크