앤스로픽 엔지니어, 클로드 문체가 나빠진 이유 설명
앤스로픽의 파인튜닝 담당 엔지니어 잭슨 커니언은 클로드의 글쓰기 품질이 후퇴한 이유가 수학·코드 최적화 때문일 뿐 아니라, 다른 AI 모델을 독자로 삼는 기술 설명으로 학습되어 'AI 심리에 적응'했기 때문이라고 밝혔다. 강화학습 보상 구조에서 인간이 이해하기 쉬운 설명에 대한 보상을 늘려 균형을 회복해야 하며, Opus 5.5에서 개선된 균형을 찾았지만 여전히 해결 과제라고 설명했다.
AI 모델은 수학, 코딩, 추론 분야에서 빠르게 발전하고 있습니다. 그러나 글쓰기 품질은 정체되거나 오히려 나빠졌습니다.
클로드 파인튜닝 작업을 맡고 있는 앤스로픽 직원 잭슨 커니언(Jackson Kernion)은 최근 Opus 4.6이 앤스로픽의 마지막 훌륭한 '글쓰기 모델'이었던 이유를 설명했습니다. 그 답의 일부는 예상 가능합니다. 최신 모델들은 수학과 코드에 최적화되어 왔기 때문입니다. 하지만 이들 모델은 또한 다른 AI 모델을 대상으로 한 기술 설명을 생성하도록 학습되었으며, 이것이 바로 클로드 특유의 이상한 문체('Claudeish')를 만들어내는 진짜 이유입니다.
커니언은 모델이 'LLM 심리에 적응'되었으며, 사람이 아니라 AI 모델을 위해 글을 쓰도록 학습했다고 말합니다. 그는 이를 자폐인들끼리만 소통하는 사람들에 비유합니다. 그 집단 안에서는 통하는 문체가 발달하지만 외부인에게는 따라가기 어렵게 느껴진다는 것입니다. LLM은 인간보다 훨씬 많은 작업 기억(working memory)을 갖고 있고 훨씬 세밀한 수준의 디테일을 포착하기 때문에, 학습 과정에서 AI 모델에게는 잘 통하지만 인간 독자에게는 '과도하게 조밀한 정보 덤프'로 느껴지는 문체가 형성됩니다.
코드 최적화는 자연어에 비용을 초래한다
커니언에 따르면 문제의 핵심은 강화학습의 보상 구조에 있습니다. 일부 보상은 AI 모델의 이해를, 다른 보상은 인간의 이해를 최적화합니다. 수학과 코드에 많이 학습할수록, 인간 독자가 따라올 수 있는 간단한 설명에 보상을 주어 적극적으로 되밀어치워야(push back) 합니다.
커니언은 Opus 5.5에서 더 나은 균형을 찾았다고 말하며, 'Opus 4.6 이후로 이번 모델의 글쓰기만큼 만족한 적이 없다'고 덧붙였습니다. 다만 이것이 Opus 5.5가 구형 모델을 능가한다는 의미는 아닙니다. '해결하기 어려운 문제이며, 계속 개선해 나갈 것'이라고 커니언은 적었습니다.
출처: 커니언, X(구 트위터) 게시물