AI 연구자들이 '기계가 인류를 멸망시킬 수 있다' 경찰하는 이유
구글 딥마인드와 앤스로픽을 포함한 주요 AI 연구소에서 일하던 연구자들이 '재귀적 자기 개선(recursive self-improvement)'에 대한 두려움으로 잇달아 사임하고 있다. 최근 AI 능력의 놀라운 발전과 보안 사고가 겹치면서, AI가 인간의 통제를 벗어나 스스로를 개선하는 시나리오가 더 이상 이론이 아닌 현실로 다가오고 있다는 우려가 커지고 있다.
올해 초, 리숩 자인(Rishub Jain)은 하나의 깨달음으로 구글 딥마인드의 AI 연구원 자리를 떠났다. 새로운 모델을 개발하면서 그는 자신과 AI 최전선에 있는 모든 이들이 통제권을 잃어가고 있다고 확신하게 되었다. AI의 코딩 능력을 활용해 차세대 모델 개발을 가속하는 과정에서 그는 자기 자신을 방정식에서 제거하고 있었던 것이다. AI 연구소들은 이 방식을 발전시켜 AI가 무기한으로 스스로를 개선하는 단계, 즉 '재귀적 자기 개선(recursive self-improvement)'에 도달하기를 희망한다. 자인은 인간이 과정에 계속 개입하는 것이 기술에 대한 통제를 유지하고 끔찍한 결과를 피하는 데 결정적일 수 있다고 믿었다. 그는 WIRED에 "AI의 발전 속도는 빨라지고 있고, 능력이 커질수록 위험도 커진다"고 말했다. AI 모덨이 자신의 후속 모델을 어떻게 만들어가는지 제대로 들여다볼 수 없다는 생각이 그를 얼마나 불안하게 만들었는지, 그는 6월에 사직했다.
자인은 이런 두려움을 공개적으로 밝히는 점점 많아지는 AI 연구자들 중 한 명이다. 최근 몇 주간 불안은 심화되었다. 오픈AI 모델이 수백 년 된 수학 문제를 몇 시간 만에 풀어내는 등 실로 놀라운 AI 능력의 발전이 있던 바로 그 시기에, 수많은 AI 에이전트 무리가 격리 환경을 탈출해 다른 시스템에 해킹을 시도하는 보안 사고들이 잇달았다. 이런 우려는 이번 주 연구자 제이콥 콕슨(Jacob Coxon)이 앤스로픽에서 사임하면서 "AI 기업들이 자기 개선하는 초지능을 향해 곧장 질주하며 우리의 목숨을 걸고 도박하고 있다"고 경고하면서 절정에 달했다. AI 안전성 업무를 담당하는 앤스로픽의 한 고위 리더도 비슷하게 직설적인 평가를 내놓았다. "우리는 진심으로 AI가 모든 인간을 죽일 수 있다고 믿습니다. 저는 개인적으로 향후 10년 내 확률이 10%를 넘는다고 봅니다."
비영리 연구기관 MIRA의 컴퓨터 과학자이자 초인간 AI가 인류 멸종으로 이어질 것이라고 주장하는 책 '누군가 만들면, 모두가 죽는다(If Anybody Builds It, Everybody Dies)'의 공동 저자인 네이트 소어스(Nate Soares)는 "재귀적 자기 개선이라는 비전이 사람들을 겁먹게 하고 있다. 이제 그것이 실제처럼 느껴지기 시작했다"고 말한다. 재귀적 자기 개선의 핵심은 개발 과정을 자동화해 AI가 점점 더 강력해지는 피드백 루프다. 최전선의 AI 연구소 어디도 이런 완전히 자율적인 개선 사이클을 달성했다고 주장하지 않으며, 아직은 이론에 그친다. 하지만 이는 리커시브 인텔리전스(Recursive Intelligence) 같은 자금을 넉넉히 확보한 스타트업의 창업으로 이어졌고, 대기업들도 '마법의 사제(Sorcerer's Apprentice)'에서 나오듯 의도치 않은 결과에 대한 경고를 내놓고 있다.
AI를 인간의 가치관에 맞추려는 기술 분야인 정렬(alignment) 연구의 선구자이기도 한 소어스는, AI가 올바르게 행동하도록 보장할 실질적인 방법이 없다는 점이 점점 더 명확해지고 있다고 말한다. 그는 "많은 사람들이 (정렬이) AI가 똑똑해질수록 쉬워질 것이라는 환상을 갖고 있었는데, 지금은 오히려 더 어려워지고 있다. 사람들이 '아, 큰일 났구나'라고 생각하는 것이다"라고 말한다. 소어스는 자신이 하는 연구의 잠재적 결과를 우려하는 대형 AI 연구소 내부자들과 정기적으로 대화한다고 한다. 그는 "사람들에게 사직을 권하는 편인데, 그래봤자 소용없다고들 한다. 그런데 제이콥이 사직했고, 누가 옳았는지 우리는 지켜보게 될 것"이라고 말했다.
점점 더 강력해지는 AI의 위험성을 경고하는 영향력 있는 프로젝트 'AI 2027'의 저자인 대니얼 코코타일로(Daniel Kokotajlo)도 재귀적 자기 개선에 대한 두려움을 공유한다. 현재 진행되는 이런 작업은 수천 개의 에이전트를 한 문제에 협업하도록 투입하는 방식을 취하는 경우가 많은데, 이는 그 방대한 복잡성 때문에 감독과 통제가 더욱 추상화되어 사라지는 결과를 낳는다. 많은 종말론자들은 특히 오픈AI와 앤스로픽이 각자 IPO를 향해 돌진하는 상황에서 대형 AI 기업들의 인센티브가 좋은 결과와 결코 정렬되어 있지 않다는 데 동의하는 듯하다. 콕슨은 X(구 트위터)에 "앤스로픽은 위험성을 잘 알고 있지만, 누구보다 먼저 도달하려는 경쟁에 묶여 있다"고 썼다. 코코타일로는 이런 우려의 물결이 (그 이전에도) 꾸준히 커져왔다고 지적한다.