메뉴

#평가(Evals)

MP
MarkTechPost • 14일 전
IMP 6

앤스로픽, 클로드 코드에 플러그인 평가 기능 추가

앤스로픽이 Claude Code에 새로운 플러그인 평가(Plugin Evals) 워크플로우를 발표했습니다. 'claude plugin eval' 명령어는 실제적인 프롬프트에 대해 플러그인을 실행하고, Claude가 생성한 결과를 채점하며, 플러그인이 로드되지 않은 상태의 실행 결과와 비교합니다. 이를 통해 플러그인 개발자들은 그동안 측정할 수 없었던 세 가지 질문—스킬이 실제로 트리거되는지, 제대로 동작하는지 등—에 답할 수 있게 되었습니다.

앤스로픽 클로드 코드 플러그인
HN
Hacker News • 28일 전
IMP 6

분석형 AI 핸드북

Sutro가 발표한 '분석형 AI(Analytical AI)' 가이드로, 생성형 AI와 달리 LLM을 데이터 분류·추출·판단 등 대규모 의사결정에 활용하는 패턴을 정리했습니다. 분석형 AI는 측정 가능성, 일관성, 배치 처리 허용 등으로 인해 생성형 AI와 다른 모범 사례가 필요하며, 이 핸드북은 데이터·ML팀, 평가(evals) 구축자, 운영팀을 위한 살아있는 참고 자료를 지향합니다.

LLM 데이터 분석 평가(evals)
HN
Hacker News • 29일 전
IMP 7

AI 엔지니어 노트북 – Colab에서 무료로 배우는 프레임워크 없는 RAG/에이전트/평가 가이드

실전 LLM 스택을 프레임워크 없이 원시 API 호출만으로 처음부터 구현해보는 무료 Colab 노트북 모음입니다. 프롬프팅부터 RAG, 평가(evals), 에이전트, 파인튜닝, 서빙까지 다루며, Groq 무료 API로 신용카드 없이 전 과정을 실행할 수 있습니다. 프레임워크가 내부에서 하는 일을 직접 이해하고 '튜닝 전에 측정하라'는 평가 습관을 기르는 것이 핵심 차별점입니다.

교육자료 RAG 에이전트