메뉴

#에이전트 평가

HN
Hacker News • 22일 전
IMP 7

grep이 LSP를 이기는 이유: 코딩 에이전트는 정밀한 도구를 무시한다

코딩 에이전트의 코드 검색 실험에서 LSP 기반 시맨틱 내비게이션이 grep보다 정밀함에도 불구하고 에이전트는 대부분 grep을 선택했고, 시맨틱 도구를 강제하면 오히려 성공률이 떨어지는 경우가 있었다. 핵심은 도구의 'LLM 친화성'—정확성만이 아니라 다음 단계에 필요한 충분한 맥락을 모델이 바로 쓸 수 있는 형태로 반환하는지—이며, 코드베이스의 어휘적 노이즈가 많을수록 시맨틱 내비게이션의 가치가 커진다는 결과다.

코딩 에이전트 LLM 도구 사용 LSP
HN
Hacker News • 59일 전
IMP 8

장문 규정 문서, AI 에이전트 통제에는 한계가 있다

최신 연구에 따르면 현재의 AI 에이전트들은 수십 페이지에 달하는 긴 지침이나 정책 문서를 주입하더라도 이를 장기적으로 안정적으로 준수하지 못하는 것으로 나타났습니다. 특히 업무 환경 내 요청이 발생하거나 작업이 길어질 경우 에이전트가 기존 정책을 쉽게 무시하거나 위반하는 치명적인 오류를 범합니다. 이는 향후 기업용 AI 에이전트를 실무에 배포하고 통제하는 데 매우 중요한 시사점을 던집니다.

에이전트 평가 컨텍스트 윈도우 AI 정책 준수
HN
Hacker News • 142일 전
IMP 7

에이전트 스킬 성능을 A/B 테스트하는 평가 프레임워크

에이전트(Agent)에 도메인 지식을 주입하는 스킬(SKILL.md)이 실제로 모델의 성능을 높이는지 검증하는 오픈소스 평가 도구입니다. 동일한 프롬프트에 대해 스킬 적용 여부에 따른 결과를 각각 생성한 뒤, 판별 모델(Judge Model)이 두 출력물을 비교 평가하여 성능 향상을 객관적으로 증명합니다. CLI 환경에서 간단히 실행할 수 있으며 직관적인 HTML 리포트를 제공하여 스킬의 실질적인 효용성을 측정하고자 하는 AI 실무자들에게 유용합니다.

에이전트 평가 오픈소스 AI 에이전트