Anthropic, Claude Code에서 낮춘 노력 수준 A/B 테스트 의혹
사용자 보고에 따르면 Anthropic이 Claude Code 2.1.236 이상 버전에서 'Sonnet 5(fable)' 세션을 대상으로 서버 측 실험을 진행해 노력(effort) 척도를 축소하고 있습니다. 2.1.237부터는 'high' 노력 수준이 실제로 100점 만점에 10점으로 처리되며, 이는 예전 'low' 수준과 동일한 수치입니다. 변경 로그에는 이 내용이 전혀 언급되지 않아 테스트 그룹에 포함된 사용자는 모델 성능이 저하된 것처럼 느낄 수 있습니다.
🥔🥔🥔 @argofowl 업데이트: 앱 문제가 아니라 서버 측 문제입니다. Anthropic이 Claude Code 2.1.236 이상 버전의 fable(Sonnet 5) 세션을 실험에 등록시켜 노력(effort) 척도를 축소하고 있습니다. 구버전과 Opus 5는 그대로입니다. 아마 A/B 테스트라서 모든 사람에게 나타나는 것은 아닙니다. 만약 'high'가 'low'처럼 느껴진다면 당신은 테스트 그룹에 포함된 것입니다. 세상에, Anthropic, 당신들은 정말 때때로 견디기 힘들군요.
🥔🥔🥔 @argofowl (6시간 전)
이번 주에 fable이 멍청해졌다고 느꼈다면, 그건 당신 탓이 아닙니다. ❗❗❗ 2.1.237부터 모델이 'high' 노력 수준을 100점 만점에 10점으로 읽는데, 이는 바로 예전에 'low'가 차지하던 정확히 같은 수치입니다. 그리고 변경 로그(changelog)에는 한 마디도 언급되어 있지 않습니다. 저는 오후 내내 T3 코드와 제 앱이 고장 난 줄 알고 확인하느라 시간을 다 보냈었습니다... (계속 보기)