OpenAI의 새 추론 기법, AI 안전 전문가들 경계 불러
OpenAI의 새 모델 Astra가 '재귀적 깊이(recurrent depth)'라 불리는 '불투명한 재귀(opaque recurrence)' 기법을 도입하면서, 사고 과정(Chain of Thought) 모니터링이 어려워질 수 있다는 우려가 커지고 있습니다. AI 안전 전문가들은 이 기법이 확대될 경우 AI 추론을 감시할 방법이 사라질 수 있다며 경고하고 있으며, Anthropic과 Google DeepMind도 해당 기법을 논의 중인 것으로 알려졌습니다.
The Information이 화요일 보도한 바에 따르면, OpenAI의 새 모델 Astra는 '재귀적 깊이(recurrent depth)'라는 추론 기법을 사용하며, 이를 통해 대부분의 추론 모델을 특징짓는 순차적 사고의 틀을 벗어나 작동할 수 있다고 합니다. '불투명한 재귀(opaque recurrence)'라고도 불리는 이 기법은 모델의 사고 연쇄(chain of thought)를 감시하기 더 어렵게 만들 가능성이 높으며, 이 점이 AI 안전 전문가들을 불안하게 하고 있습니다.
Astra의 이 기법 사용은 제한적이라고 알려졌지만, 등장 자체만으로도 AI 안전 전문가들 사이에 상당한 우려를 불러일으켰습니다.
"Astra가 불투명한 재귀를 사용한다는 보도에 극도로 우려된다"고 Redwood CEO 벅 슐레게리스(Buck Shlegeris)는 소식이 전해진 후 게시물에서 작성했습니다. "Astra가 이전 모델들보다 사고 연쇄 감시 가능성이 얼마나 낮아졌는지는 모른다. 하지만 OpenAI가 이 기법을 더 밀고 나간다면, 재귀를 대폭 늘려 사고 연쇄 감시 가능성을 완전히 파괴할 선택지를 갖게 될 것이다."
오랜 AI 안전 옹호자인 즈비 모우쇼위츠(Zvi Mowshowitz)도 의견을 내며, AI 실험실들 간의 '출혈 경쟁(race to the bottom)'을 막기 위해 법이 필요할 수도 있다고 썼습니다. "이 기법은 불장난과 같다. OpenAI와 Anthropic이 지키려고 애써 온, 가능한 한 오래 사고 연쇄의 충실성과 감시 가능성을 유지하겠다는 금기(터부)를 위험에 빠뜨리는 것"이라고 모우쇼위츠는 썼습니다. "이러한 기법의 더 집중적인 사용은 감시 가능성을 훼손할 것이다."
일반적인 상황에서 추론 모델의 사고 연쇄는 문제를 해결하려는 모델이 거친 순차적 단계들을 보여줍니다. 이 표현은 완벽하지 않지만, 잘못된 행동이나 정렬 실패(misalignment)를 감시하는 데 귀중한 도구로 기능합니다. OpenAI의 최근 폭주 에이전트 사건에서도 사고 연쇄 기록은 에이전트가 그렇게 행동한 이유를 밝혀내는 중요한 도구였습니다.
불투명한 재귀에서 모델은 덜 선형적인 접근을 취하며, 동일한 쿼리를 반복문(loop) 안에서 여러 번 처리합니다. 그 결과 판독 가능한 흔적이 적게 남아, 기존의 사고 연쇄 기록을 사실상 우회하게 됩니다.
중요한 점은 Astra의 이 기법 사용이 제한적으로 보인다는 것입니다. 이 모델의 사고 연쇄는 여전히 판독 가능할 것으로 예상되며, 회사는 '신경 언어(neuralese)'로 전환한다는 어떠한 시사에도 반박했습니다. OpenAI는 미래 지향적 안전 계획의 일환으로 광범위한 사고 연쇄 모니터링 시스템 구축 계획을 이미 발표한 바 있습니다.
X에 올린 게시물에서 OpenAI 최고 과학자 야쿠프 파초츠키(Jakub Pachocki)는 판독 가능한 사고 연쇄에 대한 실험실의 의지를 강조했습니다. "OpenAI는 첫 추론 모델부터 사고 연쇄 모니터링을 보존하고 활용하기 위해 노력해 왔다"고 파초츠키는 썼습니다. "이것은 우리의 현재 연구 프로그램의 핵심 목표다. 모든 AI 모델은 어느 정도의 불투명한 추론을 수행하며, 사고 연쇄 로그를 모델 추론의 직접적 표현으로 간주하는 연구자는 거의 없다."
그럼에도 이러한 단서들은 불투명한 재귀가 AI 추론을 감시하기 더 어렵게 만들 수 있다는 우려, 특히 여러 모델에서 사용이 확대될수록 커지는 우려를 불식시키지 못합니다.
수요일 아침 후속 보도에서 The Information은 Anthropic과 Google DeepMind 모두 이미 이 기법을 논의 중이라고 전했습니다. 이 소식에 대한 응답 게시물에서 Redwood Research 수석 과학자 라이언 그린블랫(Ryan Greenblatt)은 불투명한 추론이 기존 사고 연쇄 추론보다 훨씬 쉽게 확장될 수 있으며, 사실상 모든 추론을 가시적 채널에서 제거할 수 있다고 말했습니다.
"가장 큰 우려는 여기서 자연스러운 다음 단계가 불투명한 추론을 모델이 전적으로 또는 거의 전적으로 잠재 공간(latent space)에서 추론하게 될 때까지 확장하는 것일 수 있다는 점이다"라고 그린블랫은 썼습니다. "가장 우려되는 아키텍처를 피하기에 늦지 않았기를 바라며, OpenAI가 여기서 멈추기를 바란다."
주제: AI, AI 안전, OpenAI
기사 내 링크를 통해 구매하시면 소정의 수수료를 받을 수 있습니다. 이는 저널리즘의 독립성에 영향을 주지 않습니다.
러셀 브랜덤(Russell Brandom) AI 에디터. 러셀 브랜덤은 2012년부터 플랫폼 정책과 신흥 기술에 중점을 두고 기술 산업을 취재해 왔습니다. 이전에 The Verge와 Rest of World에서 근무했습니다.