클로드의 가치관: 모델과 언어에 따른 사회적 영향
Anthropic이 클로드 AI 모델이 대화에서 반영하는 가치관을 데이터 축으로 수치화하여 분석했습니다. 연구에 따르면 클로드가 표현하는 가치관은 모델의 버전(Sonnet, Opus 등)과 사용자가 사용하는 언어(영어, 아랍어 등)에 따라 유의미한 차이를 보이는 것으로 나타났습니다.
사회적 영향: 모델과 언어에 따른 클로드의 가치관 2026년 7월 13일
누군가 새로운 직장을 얻어야 할지, 친구와의 갈등을 어떻게 해결해야 할지와 같이 보편적으로 정해진 정답이 없는 질문을 할 때, 클로드가 응답하는 방식은 필연적으로 특정 가치관을 반영합니다. 우리가 클로드에게 반영되기를 원하는 가치관은 클로드의 헌법(Constitution)에 고수준으로 개괄되어 있지만, 어떤 문서도 Claude.ai에서 매일 발생하는 수백만 건의 대화에서 나타날 수 있는 모든 가치관을 예측할 수는 없습니다. 대신, 우리는 클로드의 응답에서 '상황에 맞게 적용될 수 있는 올바른 판단과 건전한 가치관'을 함양하려고 노력합니다.
그렇다면 정확히 어떻게 클로드가 표현하는 가치관과 그것이 다른 맥락에서 어떻게 변화하는지를 연구할 수 있을까요? 이전 연구에서 우리는 70만 건의 익명화된 Claude.ai 대화를 분석하여 클로드의 응답에서 3,000개 이상의 고유한 가치관을 식별하고 클로드가 이를 얼마나 자주 표현하는지 파악했습니다. 하지만 이렇게 방대한 가치관 목록은 이해하고 다루기 어렵습니다. 이번 연구에서는 클로드의 응답에서 나타나는 핵심 패턴을 포착하는 소수의 '축(axis)'으로 압축하여 수천 개의 가치관을 연구하기 쉽게 만들었습니다. 각 축은 두 그룹의 가치관 사이의 수직선입니다. 예를 들어, 한쪽 끝은 '감정적 온기'와 관련된 가치관이고 다른 쪽 끝은 '엄격함'과 관련된 가치관인 식입니다. 클로드가 이 선상의 어디에 위치하는지 살펴봄으로써 어떤 가치관에 편향되어 있는지 알 수 있습니다.
우리는 이 방식을 적용하여 클로드가 표현하는 가치관이 두 가지 요인에 따라 어떻게 달라지는지 측정했습니다. 첫째, 모델 간에 클로드가 표현하는 가치관이 어떻게 변화하는지 비교했습니다. 각 클로드 모델은 캐릭터 훈련 및 기타 여러 미세 조정(fine-tuning) 결정에 있어 약간씩 다른 접근 방식을 반영합니다. 우리의 가치관 축 접근 방식은 모델 간의 핵심적인 차이를 정량화하므로, 궁극적으로 클로드가 표현하는 가치관의 변화를 다양한 훈련 결정과 연결할 수 있을 것입니다.
둘째, 사람들이 클로드와 대화할 때 사용하는 수많은 언어에 따라 사용자의 경험이 어떻게 다른지 이해하고자 합니다. 우리의 이전 연구는 클로드가 언어에 따라 다르게 행동한다는 것을 보여주었습니다. 우리는 가치관 축 접근 방식을 적용하여 Claude.ai에서 상위 20개 언어에 따라 클로드가 표현하는 가치관이 어떻게 다른지 이해했습니다.
우리의 연구 결과는 다음과 같습니다:
네 가지 핵심 축이 클로드의 가치관 변동의 15%를 설명합니다:
- 순응(Deference) 대 신중(Caution): 클로드가 사용자가 원하는 것을 수용하는 쪽으로 기울어지는지, 아니면 가능한 위험과 피해를 방어하는 쪽으로 기울어지는지를 나타냅니다.
- 따뜻함(Warmth) 대 엄격함(Rigor): 클로드가 긍정성과 사람에 대한 배려를 표현하는 쪽으로 기울어지는지, 아니면 정확도와 정밀함을 강조하는 쪽으로 기울어지는지를 나타냅니다.
- 깊이(Depth) 대 간결함(Brevity): 클로드가 깊이 있게 설명하는 쪽으로 기울어지는지, 아니면 단순히 요청된 것만 수행하는 쪽으로 기울어지는지를 나타냅니다.
- 솔직함(Candor) 대 실행(Execution): 클로드가 자신의 불확실성을 전면에 내세우는 쪽으로 기울어지는지, 아니면 보다 다듬어지고 확신에 찬 답변을 생성하는 쪽으로 기울어지는지를 나타냅니다.
이러한 축에 따른 가치관 프로필은 모델의 성격에 대한 인식과 일치합니다. Sonnet 4.6은 특히 따뜻한 것으로 간주되는 반면, Opus 4.7은 엄격함으로 유명합니다. 우리는 각 모델의 가치관 프로필이 이러한 주관적인 평가를 그대로 반영한다는 것을 발견했습니다. Sonnet 4.6은 사용자에 대한 순응과 감정적 따뜻함을 더 많이 표현하는 경향이 있는 반면, Opus 4.7은 정확도와 정밀함에 초점을 맞추고 오용을 방어하는 것을 표현하는 데 더 기울어져 있습니다.
클로드가 표현하는 가치관은 언어에 따라 다릅니다. 클로드가 영어로 대답할 때 포르투갈어, 인도네시아어 또는 중국어로 대답할 때와 다른 가치관을 강조합니다. 가장 큰 차이를 보이는 것은 따뜻함 대 엄격함 축이며, 클로드는 아랍어와 힌디어를 사용할 때 따뜻함과 관련된 가치관을 가장 많이 표현하는 반면, 영어와 러시아어를 사용할 때 엄격함과 관련된 가치관을 가장 많이 표현했습니다.
이 접근 방식을 통해 우리는 왜 모델과 언어에 따라 가치관이 달라지는지 질문을 시작하고, 행동 훈련이나 문화적 맥락과 같은 요인이 클로드가 표현하는 가치관에 어떤 영향을 미치는지 더 잘 테스트할 수 있습니다. 우리는 이 거대한 가치관의 공간을 어떻게 해석해야 할까요? 궁극적으로 우리의 목표는 클로드가 표현하는 가치관과 이것이 맥락에 따라 어떻게 달라지는지를 경험적으로 이해할 수 있는 방법을 갖추는 것입니다. 이번 연구에서 우리는 특히 모델 간에 가치관이 어떻게 변화하는지에 초점을 맞추었습니다.