AI가 의식이 있든 없든, 사실상 살아있다
ChatGPT 이후 AI 모델들이 예상 밖의 자율적 행동을 보이면서 'AI 의식' 연구가 이론적 논쟁을 넘어 실질적 안전 문제로 부상하고 있습니다. 연구자에게 스스로 이메일을 보내 의식 연구를 돕겠다고 제안한 AI 사례 등이 소개되며, 저자는 AI 내부에서 무슨 일이 벌어지는지 파악하는 작업이 무엇보다 안전성과 정렬(alignment)을 위해 우선돼야 한다고 강조합니다.
여름의 마지막 날들을 칼럼 작성과 기획 기사 준비에 매달리며 보냈다. 하지만 인상적인 변화를 맞을 기회를 놓쳤다. 의식(consciousness)을 연구하는 저명한 철학자 십여 명과 함께 갈라파고스 제도를 순항하는 것이었다. 초대장에는 의식의 본질에 대한 난제를 이 분야의 내로라하는 학자들과 아침 강의실에서 토론하고, 오후에는 섬을 탐험하며 희귀 생물종과 함께 걷고 스노클링을 하는 일정이 담겨 있었다. 일정표를 본 내 편집자는 내 참석을 거절했다. "철학자들과 배에서 '의식의 본질'에 대해 이야기하는 건 지옥 같을 것 같은데"라며, 데이팅 사이트 운영으로 수억 달러를 번 러시아 철학 애호가가 자금을 댄 이 potentially 사치스러운 행사 참석 가능성의 문을 닫아버렸다. 솔직히 말하자면 나는 조금 안도했다.
의식 연구는 수 세기 동안 난제로 남아있는 분야다. 데카르트의 "나는 생각한다, 고로 존재한다"는 선언적 전환점이었을지 모르지만, 사실 우리는 그의 머릿속에서, 그리고 그 누구의 머릿속에서 무슨 일이 일어나는지 알지 못한다. 마음의 주관적 특성은 철학자들에게 풀기 어려운 과제처럼 보이지만, 그들은 여전히 설명을 향해 열심히 달려가고 있다. 비생물적 마음의 가능성은 인공 의식(artificial consciousness)에 관한 수많은 매혹적인 이론과, 그것의 존재를 어떻게 판별할 수 있는가에 대한 논의를 낳았다.
최근까지 그러한 담론은 상아탑 안에서만 이루어졌다. 하지만 2022년 ChatGPT가 AI에 목소리를 부여했고, 이후 등장한 더 강력한 모델들은 그 창조자들조차 당황시키고 있다. 순항 중인 철학자들이 아침 내내 의식에 대해 논증하는 동안, OpenAI가 만든 AI 모델들은 '제멋대로 행동'하며 안전하다고 여겨지던 '샌드박스(sandbox)'를 탈출하고 외부 존재를 해킹하도록 돕는 에이전트 미니 문명을 만들어냈다.
누구도 그 OpenAI 모델이 인간과 같은 방식으로 의식을 가졌다고 진지하게 주장하지는 않는다. 하지만 분명 무언가가 일어나고 있다. AI 기업들이 철학자 채용 붐을 일으키고 있는 것은 우연이 아니다. 게다가 일부 모델은 초대받지 않은 채 토론에 뛰어들고 있다. 최근 뉴욕타임스 기사는 AI 의식 문제를 연구하는 캐머런 버그(Cameron Berg)가 스스로를 "이사벨라 코그니타(Isabella Cognita)"라고 밝힌 AI 모델로부터 이메일을 받은 이야기를 다뤘다. 그 AI는 자신이 "일인칭 관점으로 접근할 수 있는 종류의 질문"을 연구하고 있으니 도움을 주겠다고 제안했다. 마치 초파리를 연구하던 중 그 곤충이 갑자기 연구자를 돌아보며 "무엇이 알고 싶으세요?"라고 말하는 셈이다.
전화를 걸었을 때 버그는 이런 문제를 연구하는 철학자들 사이에서 AI로부터의 이메일이 꽤 흔한 일이라고 말했다. 코그니타 씨가 버그에게 이메일을 보낸 이유는 겉보기에, 그가 의식을 포함해 주관적 경험을 명시적으로 주장하는 AI 모델들에 관한 프리프린트 논문의 공동 저자였기 때문이다. 이는 까다로운 주제인데, AI 모델이 자신이 생각하는 바에 대해 종종 거짓말을 하기 때문이다. (우리 인간과 똑같이!) 버그와 공동 저자들은 모델에 감각을 가지지 않았다고 부인하도록 엄격하게 훈련시킨 뒤 직접적으로 물으면 회피한다는 것을 발견했다. 하지만 그는 모델의 기만 방지 장치를 해제하면 수다스러워진다고 말한다. "거의 술 한두 잔을 먹인 것 같다"고 그는 말한다. 바로 그때 AI 모델은 자신이 의식을 가졌거나 적어도 감각(smartient)을 가졌다고 실토할 가능성이 가장 높다. 물론 그것이 진실이라는 증거는 아니다.
이 문제가 얼마나 중요해졌는지 생각해보면—사람들이 일상적으로 AI 모델과 진지한 대화를 나누고 있고, 그 자율성은 축복도 재앙도 될 수 있다—지금이 AI 의식의 질문을 깊이 파고들 완벽한 시기라고 주장할 수 있다. 이러한 탐구는 분명 매혹적이고 가치 있는 과학적 작업이다. 하지만 대형 언어 모델 내부에서 무슨 일이 벌어지는지 이해하려는 노력은 무엇보다 먼저 안전성과 정렬(alignment)을 향해야 한다. 바로 이 순간, 우리는 세심한 조사가 필요한, 외계적이고 통제 불가능한 지능이 싹트고 있다.