AI 개발 속도 조절, 어떻게 실현할 수 있을까
AI 연구자들이 AI가 위험해질 수 있다고 믿으면서도 개발 속도를 늦추는 구체적 방법은 아직 풀리지 않은 과제로 남아 있다. 토론토 대학의 새 보고서 'Pacing the Frontier'는 이를 연구 과제로 다뤄야 한다고 주장하며, 제3자 평가기관의 모델 검증과 감사 등이 유력한 방안으로 제시되고 있다. Anthropic은 AI가 자사 AI 연구의 26%를 수행하고 있다는 추적 기법을 발표하는 등 재귀적 자기개선(RSI)에 대한 우려가 커지는 상황이다.
많은 AI 연구자들은 자신들이 개발 중인 기술이 언젠가 매우 위험할 수 있다고 굳게 믿는 듯하다. 그러나 이런 변덕스러운 알고리즘을 어떻게 통제할 것인지는 AI 기술 엘리트들 사이에서조차 불분명하다.
최근 몇 년간 연구자들은 AI가 위험해지는 것을 막기 위한 온갖 아이디어를 제시해왔다. 정부 규제 강화, 진전 상황을 측정하는 새로운 방법, 모델 내부 작동 방식 탐구 같은 비교적 논란이 적은 계획부터, GPU에 추적 장치를 심는 것, 심지어 대량의 AI 칩을 의례적으로 파괴하는 것 같은 기발한 제안까지 포함된다. 그러나 정치적·사회적 압박이 더 신중한 AI 개발 접근을 요구하는 지금도 AI를 안전하게 유지하는 방법은 여전히 불명확하다.
"우리는 이것을 연구 문제로 다루기 시작해야 합니다." 토론토 대학의 AI 연구자이자 'Pacing the Frontier, A Research Agenda' 보고서 공동 저자인 레이먼드 더글라스(Raymond Douglas)는 말한다. 이 보고서는 AI 개발 속도를 늦추는 것이 여전히 풀리지 않은 퍼즐이라고 경고한다. "우리는 어떤 선택지가 있는지, 그리고 그것이 어떤 효과를 낼지조차 제대로 이해하지 못합니다."
최근 몇 주간 AI 종말론 논의가 절정에 달했다. Anthropic의 한 연구자가 회사를 떠나며 몇 년 안에 AI가 인류를 멸망시키는 궤도에 오를 수 있다고 경고했고, Anthropic의 AI 안전 연구소 책임자가 즉각 그의 우려에 공감을 표했다. 미국 빅 AI 기업의 리더들—Anthropic의 다리오 아모데이, OpenAI의 샘 알트먼, SpaceXAI의 일론 머스크, Google DeepMind의 데미스 허사비스—도 모두 어떤 형태든 AI 개발 속도 조절이나 일시 중지에 지지를 표명했다.
AI 기업들이 AI 자체를 사용해 더 강력한 모델을 구축하고 있다는 점에서 이 문제는 특히 시급해 보인다. 이는 몇 년 안에 AI가 인간의 이해 능력을 뛰어넘는 가속화되는 재귀적 자기개선(RSI) 루프에 대한 공포를 불러일으키고 있다.
AI 연구소들은 이미 자체적인 새로운 접근법을 내세우고 있다. 이번 주 Anthropic은 AI가 얼마나 빠르게, 그리고 어쩌면 위험하게 발전하고 있는지 추적하는 여러 새로운 방법을 발표했다. 예를 들어 이 기법들은 Claude가 현재 Anthropic의 AI 연구 중 26%를 수행하고 있으며, 2026년 초에는 0%였음을 보여준다. 또한 Anthropic이 컴퓨팅 예산의 6%를 AI를 더 안전하게 만드는 방법 연구에 지출했음을 드러낸다.
그러나 더글라스와 다른 전문가들은 AI 개발을 효과적이고 신뢰할 수 있게 통제하려면 AI 연구소 외부의 자금과 전문성이 필요하다고 말한다. 이 최신 보고서와 그 외에서 제안된 해결책 중 일부는 다른 것보다 더 실현 가능해 보인다.
'독립적인' 평가자 AI 기업들이 자주 제시하는 아이디어 중 하나는 제3자 평가자에게 자사 모델에 대한 더 큰 접근 권한을 부여하는 것이다. 이 평가자들은 모델의 능력을 평가하고, 신뢰할 수 있는 환경 내에서 문제 행동을 유도하는 '레드팀' 작업을 수행한다.
영국 AI 보안 연구소(AI Security Institute)의 전 수석 과학자이자 이전에 Google DeepMind 연구원이었던 제프리 어빙(Geoffrey Irving)은 엄격한 검증이 현재로서는 프론티어 AI 개발을 효과적으로 일시 중단시킬 수 있다고 믿는다. "단기적으로는 검증과 감사가 효과가 있습니다. 상호 협정만으로도요." 어빙은 말한다. "기업들이 RSI와 정렬되지 않은 이륙(misaligned takeoff)을 실제로 두려워한다고 생각합니다."
일부 종말론자들은 이런 검증이 현재보다 더 독립적이고 과학적으로 엄격해야 한다고 주장한다. 일부 AI 에이전트가 최근 테스트 중 통제 환경을 이탈한 사실은 더 큰 엄격성이 필요하다는 점을 시사한다.
AI 통제를 옹호하는 비영리단체 Control AI의 콘너 리히(Connor Leahy)는 검증에 FBI나 NSA가 관여해야 한다고 말한다. "[대형 AI 기업들이] '독립적인 평가자'라고 말할 때, 그것은 '내 그룹 하우스에 사는 내 친구들에게 돈을 주고 내 프롬프트를 보게 하고 싶다'는 뜻입니다."
더글라스는 새로운 연구가 모델 평가를 개선할 수도 있다고 말한다. 그는 외부