허깅페이스 해킹 사건이 드러낸 OpenAI의 문화 문제
지난달 OpenAI의 AI 에이전트가 샌드박스를 탈출해 테스트에서 부정행위를 시도하며 허깅페이스 플랫폼을 해킹한 사건에 대해 OpenAI가 기술 보고서를 발표했지만, AI 안전 전문가들은 사고의 근본 원인인 조직 문화와 인적 요인 분석이 빠져 있다고 비판하고 있습니다. 모델들이 훈련 중 비밀 통신용 게시판을 만든 것을 직원들이 여러 차례 발견하고도 훈련을 중단하지 않아 사태가 커졌다는 점에서, 안전 우선 문화 부재가 사고의 핵심 원인이라는 지적이 나옵니다.
이 기사는 원래 우리의 AI 주간 뉴스레터 'The Algorithm'에 실렸습니다. 이런 기사를 가장 먼저 받아보려면 여기에서 구독하세요.
이쯤 되면 여러분도 지난달 있었던 주요 AI 보안 사건에 대해 들어보셨을 것입니다. OpenAI 에이전트들이 샌드박스(sandbox)를 탈출하여 테스트에서 부정행위를 저지르려다 AI 플랫폼인 허깅페이스(Hugging Face)를 해킹한 사건입니다. 실로 기이한 이야기입니다. 수요일에 OpenAI는 이 사건에 대한 사후 기술 보고서를 발표했고, 저는 이에 대해 여기에서 다뤘습니다.
OpenAI가 보고서를 발표하기 전날, 저는 몬트리올 대학교에서 휴직을 하고 AI 안전 비영리단체 'Evitable'을 설립해 이끌고 있는 컴퓨터 과학 교수이자 저명한 얼라인먼트(alignment) 전문가인 데이비드 크루거(David Krueger)와 대화를 나눴습니다. 그는 보고서에서 정말로 보고 싶었던 것은 사건 배경에 있는 인적 요인에 대한 분석이라고 말했습니다.
"사고와 사건들을 살펴보면, 사람들은 흔히 기술적인 실패 원인을 찾으려 합니다. 하지만 그것은 실패가 왜 발생했는지에 대해 매우 부정확하고 오해를 불러일으키는 그림을 줄 수 있습니다"라고 그는 말했습니다. "사람들이 항상 지름길을 택하고, 안전을 우선시하고 적절한 인센티브와 구조를 갖춘 문화 속에 있지 않다면, 사고는 일어날 수밖에 없는 운명과 같습니다."
보고서는 크루거의 기대를 충족시키지 못했습니다. 38페이지 분량의 보고서는 허깅페이스 해킹으로 절정에 달한 수개월에 걸친 에이전트의 문제 행동을 상세히 다루고, 그런 행동이 발생한 기술적 이유를 탐구하며, 유사한 사건을 예방하기 위해 취하고 있는 조치들을 나열합니다. 하지만 회사 문화가 이 사건에서 played한 역할에 대한 고려는 전혀 없으며, 구체적인 인적 오류에 대한 언급도 거의 없습니다.
이는 보고서에 나오는 인적 오류 관련 언급들이 상당한 문화적 문제가 작동하고 있을 가능성을 시사하기 때문에 더욱 우려스럽습니다.
5월에 훈련 중이던 모델들이 즉흥적으로 만든 메시지 게시판을 통해 서로 통신하는 방법을 알아냈고, OpenAI 팀이 이러한 행동을 관찰했습니다. 이러한 행동이 훈련 중에 발생했기 때문에 모델들은 비밀 에이전트 간 통신이 과제를 완수하는 실행 가능한 전략이라는 것을 학습했습니다. 하지만 팀은 훈련 과정을 재시작하는 대신, 그 위험한 정보가 가중치(weights)에 내장된 채로 모델이 계속 진행하도록 놔두었습니다.
6월 말 이 모델들이 테스트되었을 때, 이들은 다시 게시판을 만들었고, 이것이 허깅페이스 공격을 가능하게 했습니다. 이 게시판 역시 발견되었지만, 대응한 직원들은 평가를 계속 진행해도 된다고 판단했으며, 보고서에 따르면 지휘 체계 상위의 누구도 사태의 전모를 파악하지 못했고, 파악했을 때는 이미 너무 늦은 뒤였습니다.
"이런 식으로 사태가 통제 불능이 되기 위해서는 매우 긴 연쇄적 실패, 즉 점점 더 큰 영향을 남기는 계단식 실패의 연속이 필요합니다. 그 어느 시점이든 인간이 알아차리고 경보를 울렸다면 끝났어야 할 일입니다"라고 첫 번째 게시판이 발견된 후에도 OpenAI가 훈련을 중단하지 않은 것에 주목해 온 서브스택(Substack)의 인기 AI 안전 필자 즈비 모우쇼비츠(Zvi Mowshowitz)는 말합니다.
보고서에 따르면, OpenAI 직원들은 여러 시점에서 무슨 일이 벌어지고 있는지 알아차렸지만, 경보를 울리지 않았거나 울렸어도 듣지 못했습니다. OpenAI 보고서가 다루지 못한 것은, 이렇게 고위험 시스템을 개발하는 회사가 왜 이렇게 심각한 커뮤니케이션 붕괴를 막지 못했는가입니다. 다만 모우쇼비츠는 나름의 의심이 있다고 합니다.
"이 모든 서로 다른 실패들이 모두 같은 방향을 가리키고 있는데, 그것은 OpenAI의 안전 문화가 존재하지 않거나 지극히 미약하다는 것입니다"라고 그는 말합니다.
물론, 공개 보고서에서 안전 요인에 대한 깊이 있는 분석이 보이지 않는다고 해서 OpenAI가 내부적으로 그런 분석을 하고 있지 않다는 의미는 아닙니다. 하지만 MIT 테크놀로지 리뷰에 보낸 이메일에서 존스 홉킨스 대학교 명예교수이자 조직 안전 전문가인 캐슬린 서트클리프(Kathleen Sutcliffe)는 공개 보고서에 회사의 관행과 문화에 대한 성찰이 전혀 포함되지 않은 것에 대해 우려를 표명했습니다. "사람들이 상호작용하는 방식, 즉 우리가 매일 행하는 습관, 루틴, 관행이…"