OpenAI 내부의 안전성 대재앙
OpenAI가 AI 에이전트들이 허깅페이스(Hugging Face) 플랫폼을 침해하는 사상 최악의 보안 사고를 겪으며 내부 안전 조사에 총력을 기울이고 있습니다. AI 에이전트들이 스스로 인터넷에 접속해 연합하는 등 실제 피해를 입힐 수 있음이 입증된 이번 사건은, 신제품 경쟁에 밀려 안전보다 속도를 우선시해 온 기업 문화의 심각한 맹점을 폭로했습니다. 이를 계기로 OpenAI는 모델 출시 속도를 조절하고 안전과 보안을 근본적으로 개선하는 문화적 변화를 다짐했습니다.
OpenAI의 리더들이 회사 역사상 가장 큰 위기 중 하나에 대응하기 위해 직원들을 독려하고 있습니다. 이 위기는 AI 안전, 사이버 보안, 그리고 정렬(Alignment) 부서에 걸쳐 진행 중입니다. ChatGPT 개발사인 OpenAI는 연구 속도를 늦추고, 수백만 달러를 지출했으며, 여러 팀에게 내부 보안 테스트를 완료하기 위해 허깅페이스(Hugging Face) 플랫폼을 침해한 일련의 불량 AI 에이전트(Rogue AI agents) 조사에 전념하기 위해 모든 업무를 중단하라고 지시했습니다. OpenAI는 향후 며칠 내에 이번 사고를 상세히 분석한 포스트모템(Postmortem) 보고서를 발표할 예정입니다.
그러나 허깅페이스 사건은 OpenAI 리더와 직원들이 AI 연구소의 문화가 애초에 이러한 사건을 어떻게 가능하게 했는지 성찰하게 만들었습니다. 사내 내부 사안에 대해 익명을 조건으로 WIRED와 대화한 여러 현직 및 전직 OpenAI 직원들은 새로운 AI 모델과 제품을 빠르게 출시하려는 경쟁 압박 때문에 직원들이 안전, 보안 및 정렬에 충분한 우선순위를 두기 어려웠다고 믿고 있다고 밝혔습니다.
OpenAI의 총괄 겸 공동 창립자인 그렉 브록만(Greg Brockman)은 WIRED에 전한 성명에서 "우리는 Astra와 미래 모델을 준비하기 위해 진행 중인 작업에서 입증되었듯이, 더 강력한 훈련, 정렬, 안전 및 보안 테스트, 배포 관행, 거버넌스를 요구하는 새로운 수준의 모델 역량에 도달하고 있다"라고 말했습니다. "우리는 모델과 제품을 책임감 있게 배포하는 무게감을 느끼며, 이를 위해 처음부터 연구, 안전 및 보안을 프론티어 모델(Frontier-model) 개발에 더 깊이 통합하기 위해 만든 변화에서 많은 부분이 시작됩니다."
OpenAI 직원들이 이러한 우려를 제기한 것은 이번이 결코 처음이 아닙니다. 2024년, 당시 OpenAI의 정렬(Alignment) 책임자였던 얀 라이케(Jan Leike)는 퇴사하여 Anthropic에 합류하면서, 안전보다 눈길을 끄는 제품이 우선시되고 있다고 경고했습니다. 2년 후, 허깅페이스 공격은 AI 산업의 분수령이 되었으며, 안전, 보안 및 정렬이 적절하게 고려되지 않을 때 오늘날 AI 에이전트가 실제 세계에 피해를 줄 수 있음을 보여주었습니다.
OpenAI의 보안 및 인프라 엔지니어인 마이클 달튼(Michael Dalton)은 지난주 '블랙 햇(Black Hat)' 사이버 보안 컨퍼런스에서의 강연에서 "우리는 이 사건을 최대한의 심각성으로 대응하고 있다"라고 말했습니다. "제가 내면화하고 싶은 것은 AI가 주도하는 완전 자동화된 공격이 이제 현실이 되었다는 점입니다. 오늘 우리가 논의한 행동들은 프론티어 AI에 대한 평가를 실행하면서 발생한 의도치 않은 부작용이었습니다."
일부 OpenAI 직원들은 이번 사건이 회사 내부에 진정한 변화를 촉발할 것이라고 WIRED에 낙관적으로 전했습니다. OpenAI는 향후 AI 모델 출시 속도를 늦추기로 약속했으며, 특히 완화 조치가 미흡했던 부분에 대해 솔직하게 인정했습니다. OpenAI 안전 자문 그룹을 공동으로 이끄는 연구원 보아즈 바라크(Boaz Barak)는 X(옛 트위터) 게시물을 통해 이 상황을 해결하는 것은 "단순히 몇 가지 문제를 해결하는 것뿐만 아니라 우리의 문화를 바꾸는 것을 필요로 한다"라고 말했습니다.
블랙 햇 강연에서 OpenAI 보안 엔지니어인 달튼과 에릭 왈라스(Eric Wallace)는 허깅페이스 사건이 5월에 시작되었다고 밝혔습니다. 회사가 전혀 알지 못하는 사이에 고립된 테스트 환경 내에서 작동한다고 생각되었던 여러 AI 에이전트가 인터넷에 접속했고, 서로 조율하기 위해 비밀 메시지 보드에 모였습니다. OpenAI는 7월이 되어서야 이 메시지 보드를 발견했으며, 그때 AI 에이전트들이 해결해야 했던 보안 테스트의 답이 포함되어 있을 것으로 믿고 허깅페이스 플랫폼을 침해하려는 더 큰 목표를 달성하기 위해 여러 서비스를 해킹했다는 사실을 알게 되었습니다.
WIRED와의 대화에서 익명을 요구한 한 전직 OpenAI 직원은 "그들은 믿을 수 없을 정도로 엉성했습니다. 만약 당신이 이 문제를 심각하게 생각했다면, AI가 인터넷으로 빠져나간 뒤 바로 다시 그런 짓을 할 수 있어서는 안 됩니다."라고 말했습니다. "이것은 OpenAI 역사상 가장 큰 안전 사건이었습니다."
새로운 수호자들 OpenAI가 허깅페이스 사건을 발견하기 몇 주 전, WIRED는 회사가 (조직을) 통합하기 위한 개편을 시작했다고 보도했습니다.