메뉴
BL
MarkTechPost • 14일 전

LLM이 스스로 에이전트 하니스를 설계할 수 있을까

IMP
6/10
핵심 요약

바이댄스 시드(ByteDance Seed)와 SUTD, 조지아텍 등이 모델이 내놓는 답변이 아닌, 모델이 직접 구축한 실행 가능한 하니스(harness)를 평가하는 벤치마크 'HarnessDev'를 발표했습니다. 6개 생성 LLM이 0점의 시드에서 출발해 5개 벤치마크와 2,207개 과제에 대해 하니스를 구축하고 실행 피드백으로 개선했는데, 자체 구축 하니스는 글쓰기와 ML 실험에서 인간 수준에 도달했으나 코딩과 검색에서는 뒤떨어졌습니다. 특히 64개의 개선 변경 중 34개만 홀드아웃 과제에서도 같은 방향으로 일반화되어, LLM의 자기 개선 능력의 한계를 보여준다는 점이 주목됩니다.

번역된 본문

바이댄스 시드(ByteDance Seed), SUTD, 조지아텍(Georgia Tech), M-A-P, TokenWave.AI는 모델이 반환하는 답변이 아니라 모델이 직접 구축한 실행 가능한 하니스(harness)를 채점하는 벤치마크 'HarnessDev'를 발표했습니다. 0점을 받는 시드에서 출발하여 6개의 생성(creator) LLM이 5개 벤치마크와 2,207개 과제에 걸쳐 하니스를 구축한 뒤, 실행 피드백을 바탕으로 이를 발전시킵니다. 그 결과, 자체 구축한 하니스는 글쓰기와 머신러닝 실험 분야에서는 인간이 만든 참조 구현과 대등한 수준을 보였지만, 코딩과 검색 분야에서는 뒤처졌습니다. 또한 64개의 진화적 변경 사항 중 단 34개만이 홀드아웃(held-out) 과제에서 같은 방향으로 일반화되는 것으로 나타났습니다.

원문 보기
원문 보기 (영어)
ByteDance Seed, SUTD, Georgia Tech, M-A-P, and TokenWave.AI introduce HarnessDev, a benchmark that scores the runnable harness a model builds rather than the answer it returns. Starting from a seed that scores 0, 6 creator LLMs construct harnesses across 5 benchmarks and 2,207 tasks, then evolve them from execution feedback. Self-built harnesses match human references on writing and ML experimentation but trail on code and search, and only 34 of 64 evolution changes move the same direction on held-out tasks. The post Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize appeared first on MarkTechPost.