메뉴
HN
Hacker News • 34일 전

Anthropic, Claude Code에서 낮춘 노력 수준 A/B 테스트 의혹

IMP
6/10
핵심 요약

사용자 보고에 따르면 Anthropic이 Claude Code 2.1.236 이상 버전에서 'Sonnet 5(fable)' 세션을 대상으로 서버 측 실험을 진행해 노력(effort) 척도를 축소하고 있습니다. 2.1.237부터는 'high' 노력 수준이 실제로 100점 만점에 10점으로 처리되며, 이는 예전 'low' 수준과 동일한 수치입니다. 변경 로그에는 이 내용이 전혀 언급되지 않아 테스트 그룹에 포함된 사용자는 모델 성능이 저하된 것처럼 느낄 수 있습니다.

번역된 본문

🥔🥔🥔 @argofowl 업데이트: 앱 문제가 아니라 서버 측 문제입니다. Anthropic이 Claude Code 2.1.236 이상 버전의 fable(Sonnet 5) 세션을 실험에 등록시켜 노력(effort) 척도를 축소하고 있습니다. 구버전과 Opus 5는 그대로입니다. 아마 A/B 테스트라서 모든 사람에게 나타나는 것은 아닙니다. 만약 'high'가 'low'처럼 느껴진다면 당신은 테스트 그룹에 포함된 것입니다. 세상에, Anthropic, 당신들은 정말 때때로 견디기 힘들군요.

🥔🥔🥔 @argofowl (6시간 전)

이번 주에 fable이 멍청해졌다고 느꼈다면, 그건 당신 탓이 아닙니다. ❗❗❗ 2.1.237부터 모델이 'high' 노력 수준을 100점 만점에 10점으로 읽는데, 이는 바로 예전에 'low'가 차지하던 정확히 같은 수치입니다. 그리고 변경 로그(changelog)에는 한 마디도 언급되어 있지 않습니다. 저는 오후 내내 T3 코드와 제 앱이 고장 난 줄 알고 확인하느라 시간을 다 보냈었습니다... (계속 보기)

원문 보기
원문 보기 (영어)
🥔🥔🥔 @argofowl update: it's server-side, not the app anthropic enrols fable 5 sessions on claude code 2.1.236+ into an experiment that shrinks the effort scale, older versions and opus 5 are left alone probably an a/b test, so not everyone will see it if "high" feels like "low" for you, you're in the test group holy fuck anthropic, you guys are unbearable sometimes 🥔🥔🥔 @argofowl 6h if fable felt dumber this week, it's not you ❗❗❗ since 2.1.237 the model reads "high" effort as 10 out of 100, the exact number "low" used to be and the changelog doesn't say a word i spent my whole afternoon convinced t3 code and my own app were broken before i went Show more
관련 소식