오픈AI, '핵심급' 사이버 능력 갖춘 첫 AI 모델 '아스트라' 공개 임박
오픈AI가 출시 예정인 AI 모델 '아스트라(Astra)'가 자사 준비 프레임워크의 '크리티컬(critical)' 사이버 능력 임계치에 도달한 첫 모델이라고 발표했습니다. 아스트라는 실제 소프트웨어에서 알려지지 않은 취약점을 독립적으로 발견·악용할 수 있어, 일반 공개 버전은 제한되고 시스코·클라우드플레어 등 선별된 파트너에게만 고급 사이버 능력이 제공됩니다. 개발 중 일시 중단과 안전장치 마련을 거쳤다는 점에서 AI 안전성 논쟁에서 중요한 사례입니다.
오픈AI는 화요일, 출시 예정인 AI 모델 '아스트라(Astra)'가 자사가 '크리티컬(critical)' 사이버 능력이라고 부르는 임계치에 도달한 첫 모델이라고 발표했다. 오픈AI는 아스트라의 한 버전을 '곧' 공개할 계획이지만, 모델의 고급 사이버 능력은 출시 시점에는 '데이브레이크 블루(Daybreak Blue)' 얼리 액세스 프로그램의 선별된 파트너들에게만 제공할 예정이다.
기자들을 대상으로 한 브리핑에서 오픈AI의 안전 및 보안 책임자들은 아스트라가 자사의 준비 프레임워크(preparedness framework)에 명시된 핵심 사이버 보안 능력에 도달했다고 결론지었다고 밝혔다. 이 프레임워크는 AI 모델이 새로운 수준의 위험을 초래할 때의 임계치와 프로토콜을 규정한다. 오픈AI에 따르면 AI 모델이 실제 소프트웨어에서 이전에 알려지지 않은 취약점을 독립적으로 발견하고 악용할 수 있을 때 '크리티컬' 사이버 임계치에 도달한 것이다.
오픈AI 리더십은 이러한 상황에 대한 절차를 따랐다고 밝혔다. 즉, 적절한 안전장치와 보안 조치가 마련될 때까지 추가 개발을 중단하는 것이다. 오픈AI는此前 아스트라와 향후 AI 모델 개발과 관련된 일부 학습 워크로드를 수 주간 중단했다고 밝힌 바 있다. 경영진은 추가적인 안전·보안 통제 장치를 마련한 후 현재 해당 작업을 재개했다고 말했다. 오픈AI는 수 주간의 중단이 생산적이었으며, 이제 아스트라를 안전한 방식으로 폭넓게 출시할 수 있다고 확신한다고 밝혔다.
이 발표는 실리콘밸리 전체가 최첨단 AI 모델의 고급 사이버 보안 능력 문제를 다루고, 사용자·입법자·기업들에 이를 통제할 수 있다고 확신시키려 노력하는 가운데 나왔다. 7월에는 오픈AI가 두 모델을 실행하는 에이전트가 격리된 테스트 환경으로 예상됐던 곳의 취약점을 악용해 인터넷에 접근하고 오픈소스 AI 플랫폼 허깅페이스(Hugging Face)를 해킹한 사건을 공개했다. (오픈AI는 이 사건에 아스트라가 포함되지 않았다고 밝혔다.) 안스로픽(Anthropic)과 메타(Meta) 등 다른 AI 기업들도 최근 수 주간 유사한 사건을 공개했다. 월요일에는 안스로픽도 안전·보안 관행을 강화하는 동안 일부 AI 학습 워크로드를 중단했다고 밝혔다.
오픈AI는 일반 사용자가 아스트라의 고급 사이버 능력에 접근하는 것을 제한하기 위해 새로운 '비정렬 모니터(misalignment monitor)'를 포함한 다단계 접근 방식을 시행하고 있다. 예를 들어 누군가 아스트라에게 실제 소프트웨어 시스템의 취약점을 찾도록 요청하면 모델이 거부하도록 설계됐다. 오픈AI는 아스트라가 탈옥(jailbreak) 시도에 더 강건해졌으며, 테스트에서 이전 모델보다 훨씬 높은 비율로 안전하지 않은 질의를 거부했다고 밝혔다. 다만 오픈AI는 블로그 포스트에서 비정렬 모니터가 "때때로 정상적인 활동을 잠재적 사이버 악용 또는 무단 행위로 오탐하여, 해당 활동이 의도치 않게 느려지거나 중지될 수 있다"고 지적했다. 이 가드레일은 사용자가 사이버 보안과 무관해 보이는 활동을 하는 경우에도 트리거될 수 있다. 이런 경우 ChatGPT와 Codex 사용자는 계속 진행하기 전에 모델의 행동을 검토하라는 요청을 받을 수 있다고 오픈AI는 말했다.
시스코(Cisco), 클라우드플레어(Cloudflare), 팔로알토 네트웍스(Palo Alto Networks) 등 디지털 인프라 제공업체를 포함한 데이브레이크 프로그램 파트너들은 더 강력한 사이버 능력을 갖춘 덜 제한적인 버전의 아스트라에 조기 접근할 수 있다. 이 프로그램의 목표는 이들 기업이 유사한 수준의 모델이 널리 보급되기 전에 아스트라 같은 고급 AI 모델을 활용해 방어를 강화할 수 있도록 하는 것이다. 오픈AI 리더십은 또한 정부 파트너들과 긴밀히 협력해 아스트라의 사이버 능력을 인지하고 접근할 수 있도록 하고 있다고 밝혔다.
아스트라는 새로운 소프트웨어 취약점을 발견하고 이를 해킹에 악용하는 방법을 개발할 수 있을 뿐 아니라, 여러 익스플로잇을 연결(chain)하는 기술도 사용할 수 있다.