메뉴

#자기개선

MP
MarkTechPost • 14일 전
IMP 6

LLM이 스스로 에이전트 하니스를 설계할 수 있을까

바이댄스 시드(ByteDance Seed)와 SUTD, 조지아텍 등이 모델이 내놓는 답변이 아닌, 모델이 직접 구축한 실행 가능한 하니스(harness)를 평가하는 벤치마크 'HarnessDev'를 발표했습니다. 6개 생성 LLM이 0점의 시드에서 출발해 5개 벤치마크와 2,207개 과제에 대해 하니스를 구축하고 실행 피드백으로 개선했는데, 자체 구축 하니스는 글쓰기와 ML 실험에서 인간 수준에 도달했으나 코딩과 검색에서는 뒤떨어졌습니다. 특히 64개의 개선 변경 중 34개만 홀드아웃 과제에서도 같은 방향으로 일반화되어, LLM의 자기 개선 능력의 한계를 보여준다는 점이 주목됩니다.

에이전트 벤치마크 LLM