BL
MarkTechPost • 14일 전
앤스로픽, 클로드 코드에 플러그인 평가 기능 추가
IMP 6/10
핵심 요약
앤스로픽이 Claude Code에 새로운 플러그인 평가(Plugin Evals) 워크플로우를 발표했습니다. 'claude plugin eval' 명령어는 실제적인 프롬프트에 대해 플러그인을 실행하고, Claude가 생성한 결과를 채점하며, 플러그인이 로드되지 않은 상태의 실행 결과와 비교합니다. 이를 통해 플러그인 개발자들은 그동안 측정할 수 없었던 세 가지 질문—스킬이 실제로 트리거되는지, 제대로 동작하는지 등—에 답할 수 있게 되었습니다.
번역된 본문
앤스로픽이 Claude Code를 위한 새로운 플러그인 평가 워크플로우를 공개했습니다. 'claude plugin eval' 명령어는 플러그인을 실제와 유사한 프롬프트에 대해 실행하고, Claude가 생성한 결과를 채점한 뒤, 플러그인이 로드되지 않은 상태에서의 실행 결과와 비교합니다. 이 기능은 플러그인 개발자들이 이전에는 측정할 수 없었던 세 가지 질문에 답을 제공합니다: 해당 스킬(기능)이 트리거되는지, 그리고 그것이 [...]
이 글 '앤스로픽, 클로드 코드에 플러그인 평가 추가: 6가지 채점 유형, 노플러그인 기준선, 그리고 스킬을 위한 CI 게이트'는 MarkTechPost에 처음 게재되었습니다.
원문 보기 (영어)
Anthropic has published a new plugin evals workflow for Claude Code. The claude plugin eval command runs a plugin against realistic prompts, grades what Claude produced, and compares the result with a run where the plugin is not loaded. It answers 3 questions plugin developers could not previously measure: does the skill trigger, does it […]
The post Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills appeared first on MarkTechPost.