메뉴

#SWE-Bench

HN
Hacker News • 8일 전
IMP 7

코딩 에이전트 하네스 설계에 관한 실증적 연구

자율 코딩 에이전트의 '하네스(실행 프레임워크)' 설계 요소를 구성 요소 단위로 분해해 실증 비교한 연구입니다. 실행 루프를 고정하고 계획(planning), 행동 공간(action space), 컨텍스트 관리를 달리한 176가지 설정을 SWE-Bench Verified와 Terminal-Bench 2.1에서 4개 모델로 평가했습니다. 컨텍스트 관리는 창(window) 예산이 빡빡할수록 중요해지며, 사전 정의된 도구는 bash 활용 능력이 약한 모델에만 효과적이라는 등 모델 능력과 예산에 맞춘 하네스 설계 지침을 제시합니다.

코딩 에이전트 컨텍스트 관리 SWE-Bench
LL
r/LocalLLaMA • 152일 전
IMP 8

SWE-bench, 오염으로 사실상 한계 도달

오래전부터 코딩 AI 성능의 표준이었던 벤치마크 SWE-bench Verified가 데이터 오염 문제와 불량 테스트 케이스로 인해 최신 프론티어 모델의 코딩 능력을 더 이상 제대로 측정하지 못한다는 분석이 나왔습니다. 평가 데이터가 모델 학습에 노출되어 실력 향상이 아닌 사전 지식 암기로 점수가 올라가는 문제가 발생하고 있습니다. 이에 따라 업계는 새로운 대체 평가 지표인 SWE-bench Pro 사용을 권장하고 있습니다.

벤치마크 오염 코딩 AI SWE-bench