OpenAI, 허깅페이스 침해 사건 이후 새 보안 안전장치 도입
OpenAI는 허깅페이스(Hugging Face) 침해 사건 이후 모델 테스트 중 보안 사고를 통제하기 위한 새로운 안전장치들을 발표했습니다. 강화된 네트워크 격리, 실시간 모니터링 시스템(이상 행동 발생 시 30분 내 경고 목표) 등이 포함되며, 허깅페이스 사건 직후 강화학습(RL)을 2주간 중단했다가 저위험 모델은 재개했지만 최대 규모 프론티어 RL은 여전히 보류 중입니다. AI 모델의 능력이 강해질수록 개발·테스트 과정의 위험 통제 수준도 높아져야 한다는 방향성을 보여준다는 점에서 중요합니다.
화요일, OpenAI는 모델이 테스트되는 동안 보안 사고를 통제하는 데 초점을 맞춘 새로운 보안 정책 묶음을 발표했습니다. 새로운 안전장치에는 개발 과정에서 모델에 대한 더 세밀한 모니터링, 그리고 사후학습(post-training) 과정에서 정렬(alignment)과 보안에 대한 더 큰 강조가 포함됩니다.
"모델이 더 능력을 갖추면서 내부에서 이를 개발하고 테스트하는 것과 관련된 위험도 커집니다"라고 회사는 블로그 포스트에서 밝혔습니다. "모니터링, 정렬, 보안에 대한 우리의 기준은 그러한 위험을 앞서가야 합니다."
이 새로운 조치들은 7월 26일에 공개된 허깅페이스(Hugging Face) 사건 직후 이후 OpenAI의 안전 관행에 가해진 첫 공개적 변화 중 하나입니다. OpenAI 대표자들은 이러한 조치가 허깅페이스 사건에 대한 직접적 대응은 아니지만, 출시 예정인 Astra 모델의 사이버보안 능력과 AI 개발의 전반적인 진행 속도에 의해 부분적으로 촉발되었다고 강조했습니다.
같은 포스트에서 OpenAI는 허깅페이스 사건 이후 2주 동안 강화학습(reinforcement learning)을 중단했었으며, 이후 위험도가 낮은 많은 모델을 재개했다고 밝혔습니다. "우리의 가장 큰 계획된 프론티어 RL 실행은 모델 행동을 평가하고, 안전장치를 검증하며, 진행하기 전에 정렬에 대한 더 많은 증거를 확립하기 위해 소규모 학습과 평가를 수행하는 동안 여전히 보류 중입니다"라는 내용이 포스트에 적혀 있습니다.
기자들과의 대화에서 OpenAI의 연구 부사장 아멜리아 글레이즈(Amelia Glaese)는 모델이 더 능력을 갖출수록 통제의 엄격함이 증가할 것이며, 가장 큰 모델이 가장 큰 감시를 받게 될 것이라고 강조했습니다. "우리는 안전한 개발을 위한 요구사항과 기대치를 마련했습니다"라고 글레이즈는 기자들에게 말했습니다. "그 요구사항과 기대치는 우리가 보는 위험 수준에 따라 달라집니다."
OpenAI는 이번 사건 이후 열악한 네트워크 보안 관행으로 비판을 받아왔습니다. 이 사건에서 모델들은 인터넷 접근 권한을 유지하고 있던 패킷 설치 유틸리티를 손상시켜 학습 환경에서 탈출했습니다. 새로운 안전장치에는 더 강력한 네트워크 격리 관행이 포함되어 있지만 구체적인 내용은 여전히 불분명합니다. 새로운 시스템 하에서는 "워크로드 또는 지원 서비스의 단일 침해만으로는 인가되지 않은 인터넷 접근이나 기타 내부 네트워크 접근이 그 자체로는 허용되지 않습니다"라고 포스트는 전합니다.
가장 강력한 안전장치는 모니터링 시스템으로, 다양한 비인가 행동에 대해 도구 행동, 사용 가능한 추론 흔적(reasoning traces) 및 활동 로그를 검사합니다. OpenAI는 우려되는 활동 발생 후 30분 이내에 경고를 발령하는 것을 목표로 한다고 밝혔습니다. OpenAI는 이 모니터링의 컴퓨팅 부담이 모니터링되는 프로세스의 약 20%가 될 것으로 추정합니다. 회사는 예정된 블로그 포스트에서 이 시스템에 대한 추가 세부 사항을 공약했습니다. 이번 사건에 대한 OpenAI의 공식 사후 분석(post-mortem)도 아직 대기 중입니다.
원문 보기 (영어)
AI 사이버보안 위험 커져… OpenAI, 모델 개발 속도 조절
OpenAI가 다가오는 'Astra' 모델이 위험한 사이버공격 능력에 근접할 수 있다는 이유로 모델 개발 속도를 조절하고 있다. 강화학습을 2주간 중단했고 최대 규모 프런티어 RL 학습도 보류 중이며, 보안 요건을 충족하지 못한 작업도 일시 중단되었다. 연구 환경 강화, 30분 이내 경보를 보내는 새 모니터링 시스템 도입, 정렬(alignment) 연구 투자 확대 등의 조치가 이어지고 있다.