AI 사이버보안 위험 커져… OpenAI, 모델 개발 속도 조절
OpenAI가 다가오는 'Astra' 모델이 위험한 사이버공격 능력에 근접할 수 있다는 이유로 모델 개발 속도를 조절하고 있다. 강화학습을 2주간 중단했고 최대 규모 프런티어 RL 학습도 보류 중이며, 보안 요건을 충족하지 못한 작업도 일시 중단되었다. 연구 환경 강화, 30분 이내 경보를 보내는 새 모니터링 시스템 도입, 정렬(alignment) 연구 투자 확대 등의 조치가 이어지고 있다.
OpenAI는 AI 사이버보안 위험이 너무 위험해지면서 모델 개발 속도를 조절하고 있다고 밝혔다. 부분적으로는 다가오는 'Astra' 모델이 핵심적인 사이버공격 능력을 확보할 수 있는 수준에 가까워지고 있기 때문이다.
이 회사는 2주간 강화학습(RL)을 중단했으며, "가장 큰 규모로 계획된 프런티어 RL 학습"은 여전히 보류 중이고, 새로운 보안 요건을 충족하지 못한 작업 부하들도 일시 중단되었다. Hugging Face 보안 사고와 "내부 연구의 빠른 진전"도 이번 속도 조절의 배경이 되었다.
이후 OpenAI는 더 나은 네트워크 격리와 더 엄격한 샌드박스를 통해 연구 환경을 강화했다고 밝혔다. 새로운 모니터링 시스템은 의심스러운 행동을 감지하면 30분 이내에 경보를 보내며, 작업 부하에 따라 감독용 추론 컴퓨팅의 약 20퍼센트를 사용한다.
회사는 준비 프레임워크(Preparedness Framework)를 확장하고 정렬(alignment) 연구에 더 많이 투자할 계획이다. 다만 해당 프레임워크를 만들었던 팀은 해체했으며, 그 책임을 다른 팀들로 이관했다.
비판론자들은 OpenAI가 시간과 관심을 벌기 위해 공포를 조장한다고 계속 비난할 가능성이 크다. 한편 독립 정부 기관인 AISI는 유사한 유해한 모델 행동을 문서화한 바 있어, OpenAI의 주장에 어느 정도 무게를 실어준다.
출처: OpenAI
원문 보기 (영어)
OpenAI Overhauls Safety Protocols After Its AI Agents Went Rogue
OpenAI, 허깅페이스 침해 사건 이후 새 보안 안전장치 도입
OpenAI는 허깅페이스(Hugging Face) 침해 사건 이후 모델 테스트 중 보안 사고를 통제하기 위한 새로운 안전장치들을 발표했습니다. 강화된 네트워크 격리, 실시간 모니터링 시스템(이상 행동 발생 시 30분 내 경고 목표) 등이 포함되며, 허깅페이스 사건 직후 강화학습(RL)을 2주간 중단했다가 저위험 모델은 재개했지만 최대 규모 프론티어 RL은 여전히 보류 중입니다. AI 모델의 능력이 강해질수록 개발·테스트 과정의 위험 통제 수준도 높아져야 한다는 방향성을 보여준다는 점에서 중요합니다.