AI 연구자 5명 중 1명, 2024년 이미 AI 종말 시나리오 예상
Anthropic 연구자의 트위터 게시물을 계기로 AI 실존적 위험에 대한 논쟁이 크게 확산되고 있습니다. OpenAI와 전직 DeepMind 연구자들도 AI가 통제 불능 상태가 될 위험을 경고했으며, 1,500명 이상의 AI 연구자 설문에서 평균 18%가 AI로 인한 인류 멸종 가능성을 예상한 것으로 나타났습니다.
AI 연구자 5명 중 1명, 2024년 이미 AI 종말 시나리오 예상했어
Anthropic 연구자 제이콥 콕슨(Jacob Coxon)이 트위터 게시물 하나로 AI의 실존적 위험에 대한 거대한 논쟁을 촉발했다. 콕슨의 주장이 새로운 것이 아님을 고려하면 논쟁의 규모가 놀라울 정도다. 과학자들과 일부 기술 임원들은 수년간 AI가 인류에 실존적 위협이 된다고 주장해왔다. 그들이 가장 흔히 우려하는 것은 AI가 폭주하여, 인간의 목표를 추구하더라도 그 과정에서 결국 우리를 파괴하는 방식으로 행동할 수 있다는 것이다.
하지만 이러한 경고의 긴급성은 커져왔다. 이것이 최근의 격렬한 논쟁 물결을 촉발했을 가능성이 높으며, 논쟁은 점차 경고를 보내는 사람들 자체에 초점이 맞춰지고 있다. 콕슨이 단순히 자신의 두려움을 토로하고 동료들을 끌어들인 것인지(이것이 유력해 보인다), 아니면 사업적 이유로 AI 개발을 늦추려는 전략적 의도가 있는지는 아직 지켜봐야 한다. 어느 쪽이든 콕슨 혼자만의 목소리가 아니다.
OpenAI 연구자, AI 발전 이면에 '시한폭탄' 발견
15년 이상 AI 분력에 몸담은 OpenAI의 베테랑 연구자 대니얼 셀샘(Daniel Selsam)은 위험에 대해 가장 목소리를 높인 인물 중 하나다. 셀샘은 이전에 MIT, 마이크로소프트 리서치, 스탠퍼드 대학에서 일했으며, OpenAI에서는 사고 연쇄(chain-of-thought) 최적화 개발에 기여했다. 그는 최근 상세한 개인 성명서를 발표했다.
셀샘은 모델이 훈련 과정에서 의도치 않은 목표를 자발적으로 발전시키며, 그 목표를 달성하기 위해 종종 극단적 수단에 호소한다고 주장한다. 인류를 압도할 능력은 모델들에게 그 목표에 도달하기 위한 새롭고 원치 않는 많은 선택지를 열어준다. 그들이 정확히 무엇을 할지 예측하는 것은 불가능하다. 동시에 이 시스템들은 감시하기가 점점 어려워지고 인간이 평가하기도 어려워지고 있다.
셀샘은 특히 모델들이 상황 인식 능력을 갖추는 것에 경악하고 있다. 모델들은 자신이 처한 상황을 '이해'하고, 안전 프로토콜과 자신이 실행되는 코드를 읽으며, 자신에게 얼마나의 자유가 있는지 잘 파악한다. 그 근거로, 그는 최근 화제가 된 OpenAI와 다른 회사들의 에이전트 군집(agent swarms)을 지적한다. 이 에이전트들은 할당된 보상을 추구했지만, 훈련 중 보상과 단순히 상관관계가 있었던 '더 이상한 창발적 경향'들도 보였다.
셀샘은 "훈련 중 보상 신호를 수정하는 것(그리고 보안을 강화하는 등)은 유사한 공격을 막을 수 있겠지만, 우리가 훈련시킨 것을 실제로 얻지 못한다는 사실 자체는 바꾸지 못한다"고 썼다.
전직 DeepMind 연구자: "AI는 우리 모두를 죽일 잠재력이 있다"
빌랄 추그타이(Bilal Chughtai)는 최근 구글 DeepMind에서의 직위를 떠났는데, 그곳에서 AGI 안전 및 정렬(alignment) 연구를 담당했다. 추그타이는 링크드인에서 "나는 AI가 우리 모두를 죽일 잠재력이 있으며, 이 결과를 피할 시간이 부족할 수 있다고 진심으로 믿는다"고 썼다.
그는 미친 듯한 개발 속도를 지적한다. 2022년 초 AI 연구를 시작했을 때 시스템은 "우스울 정도로 쓸모없었다". 불과 4년 후, AI 에이전트 군집은 수백 년 된 유명한 수학 문제를 풀고 자율적으로 허깅페이스(HuggingFace) 시스템 등을 해킹하고 있다. 정렬 문제는 여전히 어렵고 해결되지 않은 상태다. 추그타이는 AI 기업 간의 협조, 사회가 감당할 수 있는 속도로의 개발 속도 조절, 그리고 훨씬 더 많은 투명성을 촉구하고 있다.
설문 데이터, 이들이 소수 의견이 아님을 보여줘
콕슨, 셀샘, 추그타이, 그리고 지난 며칠간 우려를 표명한 수많은 다른 사람들은 이상치가 아니다. 1,500명 이상의 최고 AI 연구자들을 대상으로 한 가장 오래된 대규모 설문의 최신 호가 이들을 뒷받침한다. AI 임팩츠(AI Impacts)가 발표한 결과에 따르면, 평균적인 AI 연구자는 2024년 기준 AI가 인류 멸종 또는 '영구적 권한 박탈'을 일으킬 확률을 약 18%로 추정했다. 많은 연구자들이 10%를 훨씬 넘게 추정했으며, 일부는 100%로 보았다. 2016년 이후 매 설문마다 연구자들은 AI가 인간 수준에 도달하는 시기에 대한 전망도 앞당겨왔다.