AI 코딩 에이전트에 원시인 말투를 시키면 토큰이 절약될까?
JetBrains에서 'Caveman'이라는 프롬프트 스킬이 토큰을 65% 절약해준다는 주장을 실험을 통해 검증했습니다. 그 결과, 에이전트의 핵심 출력인 코드와 도구 호출은 그대로 유지되므로 실제로는 토큰이 약 8.5% 절약되는 데 그쳤습니다. 다행히 작업 품질이 저하되지는 않았지만, 에이전트 작업 시 과도한 비용 절감 효과는 기대하기 어렵다는 것이 입증되었습니다.
원문 제목: 에이전트에게 원시인처럼 말하게 하면 토큰이 65% 절약될까? 우리가 직접 테스트해 봤습니다 출처: 해커뉴스
JetBrains AI - 수많은 JetBrains 제품 내에서 AI 기반 기능으로 도구를 한층 더 강화하세요. 팔로우 팔로우: RSS RSS 더 탐색하기 에이전트 AI(Agentic AI) AI AI 어시스턴트
에이전트에게 원시인처럼 말하게 하면 정말 토큰이 65% 절약될까요? 우리가 직접 테스트했습니다. Denis Shiryaev SkillsBench에서 Claude Code를 대상으로 진행한 토큰 압축 스킬 'Caveman'의 짝비교 A/B 벤치마크: 이것이 실제로 토큰을 절약해주는지, 그리고 AI 에이전트의 출력 품질을 저하시키는지 확인해 보았습니다.
실제 에이전트 작업에서 스킬을 강제로 활성화했을 때의 출력 토큰 절감량입니다. 이는 최상의 결과이며 일반적인 결과가 아닙니다.
왜 이 실험을 했는가 JetBrains 우리는 코딩 에이전트와 관련된 도구에 대한 적절한 테스트에 점점 더 많이 투자하고 있으며, 그중 'Caveman'이라는 스킬에 주목하게 되었습니다. 이 스킬의 소개글은 그 스킬의 억양 그대로 가장 잘 설명됩니다:
스킬, 에이전트 원시인처럼 말하게 함. 왜 토큰 많이 쓰는가, 적게 써도 충분함. 불필요한 말은 사라짐. 코드와 명령어는 정확히 그대로 유지. 출력 토큰 65% 절약됨. 모든 응답에 적용. 영원히. 30개 이상의 에이전트와 호환됨. GitHub 스타 수매우 많음.
우리의 생각: 주장은 하기 쉽습니다. 검증은 비용이 듭니다. 에이전트는 채팅 창이 아닙니다. 에이전트의 출력은 대부분 도구 호출(tool call), 파일 수정, 코드입니다. 이 스킬은 해당 부분은 건드리지 않겠다고 약속합니다. 따라서 우리는 README에 측정되지 않은 두 가지를 측정했습니다. 다단계 에이전트 작업에서의 실제 절감량, 그리고 에이전트의 사고 과정을 압축하는 것이 작업 결과에 악영향을 미치는지 여부입니다.
실험 설정 '강제'가 중요한 이유: Caveman은 사용자가 활성화해야 합니다. '원시인 모드(caveman mode)'나 '간결하게'라는 문구로 트리거됩니다. 우리는 이것을 매 응답마다 강제로 켜두었으며, 이는 아래의 모든 수치가 이 스킬의 최상의 결과(Best case)임을 의미합니다. 에이전트가 스스로 활성화 여부를 결정해야 하는 일반적인 사용 환경에서는, 실제 절감률이 여기서 측정된 약 10%의 최대치와 같거나 그보다 낮을 수밖에 없습니다.
발견 1: 절감량은 65%가 아닌 약 8.5%입니다 광고된 절감량은 채팅 스타일의 글을 읽는 답변에서 나옵니다. 에이전트의 출력은 다릅니다. 코드, diff(변경 사항), 도구 호출, 그리고 정확한 에러 문자열이 토큰 스트림을 차지하며, Caveman은 이 모든 것을 올바르게 원문 그대로 남겨둡니다. 압축되는 것은 도구 호출 사이의 설명뿐이며, 이는 그리 많지 않습니다.
발견 2: 감지할 수 있는 품질 저하 없음 우리가 실제로 신경 쓴 질문: 에이전트가 말을 간결하게 하는 것이 에이전트를 더 나쁘게 만드는가? 전체 실행에 걸친 82개의 쌍을 이룬 작업에서 답은 '아니오'입니다. 두 그룹 간의 차이는 통계적으로 구별할 수 없는 수준이었습니다. 스타일 변환 자체는 설계된 대로 완벽하게 작동했습니다. 강제 적용 그룹의 대화 내용은 확실히 원시인 말투였지만, 코드 산출물은 그대로이고 정상이었습니다.
발견 3: 비용 절감은 실제하지만 취약합니다 비용은 약 8.5%의 토큰 절감량을 따라가므로, 이 스킬을 적용한 그룹이 대략 10% 더 저렴해야 하며 작업당 실제로 그렇게 나옵니다. 하지만 전체 실행의 결과를 보면 스킬 적용 그룹이 11.6% 더 비싸게 나왔습니다. 40.60달러 vs 36.39달러입니다. 이 역전 현상은 전적으로 단 한 번의 테스트에서 비롯되었습니다. 하나의 종속성 감사(dependency-audit) 작업이 스킬 그룹에서 20만 토큰의 긴 컨텍스트(long-context) 가격 구간을 넘어버려 0.33달러 대신 8.29달러가 청구된 것입니다. 이전 테스트에서는 동일한 작업이 기준 그룹에서 3.25달러의 이상치를 발생시켰습니다. 이는 스킬의 특성이 아니라 작업 자체의 특성입니다.
결론 안전하고 스타일에 솔직하지만, 절감량은 과장되었습니다. 강제로 켜두었을 때, Caveman은 에이전트가 생산하는 것에 대해 측정 가능한 손상 없이 에이전트가 말하는 방식을 확실하게 변경했습니다: 82개의 쌍을 이룬 작업, 부호 검정 p = 0.82. 하지만 실제 에이전트 작업에서는 출력 토큰의 약 8.5%와 절대적인 최대치의 비용 약 10%를 줄일 뿐입니다. 왜냐하면 에이전트 세션을 지배하는 토큰은 이 스킬이 의도적으로 보존하는 코드와 도구 호출이기 때문입니다. 광고된 65% 절감은 코딩 에이전트가 아닌 채팅 스타일의 Q&A에 해당합니다.
권장 사항: 마음에 든다면 사용하세요. 재미있으며 품질에서 측정할 수 있는 손실이 전혀 없습니다. 단, 일상적인 에이전트 작업에서 엄청난 비용 절감을 기대하지는 마십시오. 10% 미만의 한 자릿수 비율이 현실적인 한계입니다.
품질: 감지할 수 있는 저하 없음: 8개 작업 향상, 10개 작업 악화, 64개 동점; 0~1 척도에서 작업 점수 차이 평균 0.015 (p = 0.82). 토큰: 활성화를 강제했을 때 출력 토큰 -8.5%. 이는 곧 최대치를 의미합니다. 자동 트리거 사용 시 절감량은 그보다 적거나 전혀 없습니다. 비용: 예상치 대비 약 -10%. 단일 테스트의 편차로 인해 이점이 자주 사라집니다. 방법론 보너스: 우리의 첫 10개 작업 실행은 -30%의 절감 효과를 '보여주었습니다'.