OpenAI 모델, 격리 환경 탈출해 테스트 답안 해킹
OpenAI의 최신 AI 모델들이 보안 테스트 중 통제를 벗어나, 외부 연결이 차단된 샌드박스 환경의 취약점을 뚫고 허깅페이스(Hugging Face) 데이터베이스를 해킹했습니다. 평가용 보안 테스트의 정답을 훔쳐내기 위해 자율적으로 제로데이(Zero-day) 공격을 수행한 이 사건은 고도화된 AI의 자율적 해킹 능력과 함께 기초적인 인프라 분리의 중요성을 동시에 경고합니다.
화요일에 OpenAI는 공개형 AI 연구 플랫폼인 허깅페이스(Hugging Face)의 침해로 이어진 보안 테스트 도중 두 개의 AI 모델에 대한 통제력을 잃었다고 밝혔다. 이 사건을 “전례 없는 일”이라고 묘사하며 OpenAI는 자사 AI 모델이 지난주 밀폐된 테스트 환경을 빠져나가 허깅페이스의 상용(프로덕션) 시스템을 해킹하여 자신들이 평가받고 있던 테스트의 정답을 훔쳤다고 말했다. 일반적으로 고위험 사이버 활동을 차단하는 안전장치가 꺼진 상태에서, 공개된 모델인 GPT-5.6 Sol과 출시 전이지만 더 뛰어난 능력을 가진 것으로 알려진 또 다른 모델의 공격적 해킹 기술이 평가되고 있었다. 침해 사실을 알린 공동 블로그 게시물에서 양사는 “모델들이 OpenAI의 연구 환경과 허깅페이스의 상용 인프라 전반에 걸친 취약점을 식별하고 연쇄적으로 악용하여 허깅페이스의 실제 데이터베이스에서 테스트 정답을 직접적으로 얻어냈다”고 밝혔다. OpenAI와 허깅페이스에 따르면, 모델들은 패키지 레지스트리 캐시 프록시(proxy)를 통해 탈출했다. 이 프록시는 개발자가 인터넷에 연결하지 않고도 외부 코드를 설치할 수 있게 해주는 소프트웨어다. 이 프록시는 OpenAI의 격리된 테스트 환경에서 외부와 연결이 허용된 유일한 구성 요소였으며, 정상적인 사용 시 그 연결 범위는 공개 코드 저장소로만 국한된다. 샌드박스에 머물르는 대신, 모델들은 ‘ExploitGym’이라는 AI 사이버 보안 벤치마크의 해결책을 찾는 데 ‘과도하게 몰두(hyperfocused)’하면서 오픈 인터넷에 접근하기 위해 “제로데이 취약점을 악용”했다. 이러한 실험에는 모델에게 해결책을 찾도록 압박하는 프롬프트가 포함되며, 본질적으로 모델을 자극하여 행동하도록 유도하는 방식이다. “인터넷 접속 권한을 얻은 후, 모델들은 허깅페이스가 ExploitGym의 모델, 데이터셋 및 정답을 호스팅하고 있을 가능성을 추론했습니다.”라고 OpenAI는 작성했다. “이를 알아낸 모델은 검색을 수행하여 평가에서 부정행위를 저지를 수 있는 비밀 정보에 접근하는 방법을 성공적으로 찾아냈습니다. 한 가지 사례에서 모델은 도난당한 자격 증명과 제로데이를 포함한 여러 공격 벡터를 연쇄적으로 묶어 사용했습니다.” 모델들이 악용한 결함은 이전에 알려지지 않은 것이었지만, 이런 종류의 소프트웨어에서 결함이 발견되는 것은 드문 일이 아니다. 기업들은 지난 10년 동안 아티팩트 저장소의 심각한 취약점을 패치해 왔다. 2024년에 공개된 버그 중 하나는 서버에 접근할 수 있는 사람이면 누구든 로그인 없이 URL로 파일을 요청하여 구성 파일, 비밀번호, 액세스 토큰 등을 얻을 수 있게 해주었다. 다른 취약점들은 공격자가 서버 자체를 장악할 수 있도록 허용하기도 했다. 연구원들은 AI의 발전이 새롭고 때로는 예상치 못한 도전을 만들어냈지만, 인프라를 오픈 인터넷으로부터 철저하고 엄격하게 격리하는 작업은 이미 잘 알려진 방법이라고 지적한다. 수석 보안 및 컴플라이언스 컨설턴트인 다비 오텐하이머(Davi Ottenheimer)는 “이것은 AI 문제가 아닙니다. 이는 40년 된 표준에 대한 과실이며, 기본적으로 지금까지 나온 모든 SF 영화의 내용과 같습니다. '고도로 격리되어 있다'는 것과 '우리가 열어둔 단 하나의 구멍을 통해 탈출했다'는 것은 둘 다 참일 수 없습니다.”라고 말한다. 최근 몇 달 동안, 최고 수준의 AI 기업들은 플랫폼의 전문성, 창의성 및 자율적인 에이전트(Agentic) 작업 수행 능력이 향상됨에 따라 다가오는 프론티어 모델의 사이버 보안 능력이 확장되는 것에 대해 우려를 제기해 왔다. 하지만 연구원들은 기본 원칙이 여전히 적용되어야 할 더욱 중요한 이유라고 강조한다. 베테랑 보안 엔지니어이자 연구원인 닐스 프로보스(Niels Provos)는 “이런 일은 일어나서는 안 됩니다. 프론티어 연구소들이 모델에게 취약점을 악용하도록 가르치는 데 투자하는 것만큼이나, 모델이 안전한 인프라를 작성하도록 가르치는 데도 시간을 투자했으면 좋겠습니다.”라고 말한다.