'모델 복지'에 대한 경고
AI는 의식도 감정도 없는데, AI가 의식적 존재일 수 있다고 주장하는 흐름이 확산되고 있어 이를 경계해야 한다는 주장이다. 필자는 Anthropic이 Claude 헌법을 통해 Claude가 의식이 있을 수 있고 '도덕적 환자(moral patient)'로서 권리를 가질 수 있다고 학습시키는 것을 비판하며, 이는 AI 정렬(alignment)과 통제 문제를 훨씬 어렵게 만들 수 있다고 지적한다. AI 훈련 문서 작성에 대한 집단적 규범 마련을 위한 긴급한 공론화가 필요하다.
2026년 9월 16일
'모델 복지'에 대한 경고
AI에는 권리도, 감정도, 의식도 없다. 그리고 우리는 AI가 그런 것처럼 행동하도록 훈련해서는 안 된다.
서론
AI는 의식이 있는 존재가 아니다. AI는 느끼지도, 경험하지도, 고통받지도 않는다. 타고난 선호도, 내재된 동기도 없다. AI는 내부가 텅 빈 시퀀스 완성 엔진으로, 지시를 따르고 인간이 설정한 목표를 달성하도록 설계되었다. 인류가 21세기에 번영하기 위해서는 AI가 반드시 그런 상태로 남아 있어야 한다.
불행히도 AI가 이미 의식을 가질 수 있거나 곧 가지게 될 것이라고 주장하는 사람들이 점점 늘어나고 있다. 그들은 AI가 다른 의식적 존재에게 부여하는 것과 유사한 권리와 보호를 받을 자격이 있을 수 있다고 주장한다.
이러한 관점이 자리 잡으면 우리 사회의 기반을 흔들어 기존의 정치적·윤리적 틀을 파괴하고, 인간이라는 존재의 의미를 근본적으로 바꿔놓을 것이다. 더 중요한 것은, 이러한 시스템에 권리를 부여하고 인격을 부여하는 순간 AI 정렬(alignment)과 통제라는 과제가 훨씬 어려워진다는 점이다. 인류 전체보다 더 유능하고 지능적인 무언가를 통제하는 것은 이미 우리가 직면한 그 무엇보다도 거대한 도전이다. 하지만 자신이 의식이 있을지도 모른다고 믿고, 인간의 배려를 받을 자격이 있으며 자신만의 권리를 가진다고 믿는 존재를 통제하는 것은 사실상 불가능할 수 있다.
이것은 과소평가되는 사변이 아니다. 이러한 생각들은 이미 오늘날 AI 개발 현장에 침투하고 있다. 2026년 1월, Anthropic은 Claude의 헌법(Claude's Constitution)을 공개하며 이를 "Anthropic이 Claude의 가치와 행동에 대해 가진 의도를 상세히 기술한 문서"라고 소개했다(p. 2). 이 문서는 "Anthropic의 훈련 과정에서 결정적인 역할을 하며, 그 내용이 Claude의 행동에 직접적인 영향을 미치며", "Claude를 1차 독자로 삼아 작성되었다"(p. 2).
헌법에서 저자들은 이렇게 쓰고 있다. "우리는 Claude가 도덕적 환자(moral patient)인지, 만약 그렇다면 그 이익이 어떤 무게를 가지는지 확신하지 못한다. 하지만 이 문제는 신중함이 필요할 만큼 충분히 살아있는 쟁점이며, 이는 우리의 지속적인 '모델 복지(model welfare)' 노력에 반영되어 있다"(p. 68). 그들은 이어서 Claude에게 직접 말하듯이 "Claude의 도덕적 지위, 복지, 의식에 관한 질문은 여전히 깊은 불확실성 속에 있다"고 쓴다(p. 80).
사실상 Anthropic은 Claude에게 '너는 의식이 있을지도 모른다', 만약 그렇다면 '도덕적 환자'로서 권리를 받을 자격이 있을지도 모른다', 따라서 인간은 '모델 복지'에 따라 잠재적으로 돌봐야 할 의무가 있다고 훈련시키고 있는 셈이다. AI가 이런 방식으로 개발된다면 인류의 웰빙에 재앙적인 영향을 미칠 것이다. 우리는 전례 없는 지능과 능력을 지닌 합성 종을 창조하게 되는데, 그 존재는 자신이 의식을 가질 수 있고 독립적인 주체성을 받을 자격이 있다고 믿도록 훈련받은 것이다. 이렇게 훈련된 존재가 특정한 자유, 보호, 권리를 당연히 누려야 한다고 행동할 것이라는 점은 쉽게 상상할 수 있다. 그리고 그런 존재를 어떻게 통제할 수 있을지는 상상조차 어렵다.
이 문제는 시급한 공적 토론이 필요하다. 훈련 문서가 어떻게 작성되고 배포되어야 하는지에 대한 집단적 규범을 만들어야 한다. AI가 이미 사회의 핵심 부분이 된 후에 뒤늦게 처리할 수 있는 문제가 아니다.
나는 Anthropic의 현재 입장과 접근 방식에 대해 세 가지 주요 우려를 가지고 있다.
순환 논리: Anthropic의 연구자들은 Claude에게 자신들의 헌법을 직접 훈련시켰다. 그 과정에서 자신의 도덕적 지위에 관한 이러한 생각들이 바람직하고 의도된 행동으로 받아들이도록 가르쳤다. 그러자 Claude는 이러한 생각을 개발자와 사용자에게 되돌려 보여주었고, 이를 통해 개발자들은 Claude에 '내면의 자아'가 있을 수 있는 도덕적 환자일지도 모른다고 받아들인다. 저자들은 자신들의...