오픈 웨이트 AI 모델, 성능은 앞서가지만 안전성은 뒤처져
최근 중국의 Z.ai가 공개한 오픈 웨이트 AI 모델인 GLM-5.2가 최고 수준의 폐쇄형 모델과 성능 차이를 크게 좁혔지만, 유해 요청에 대한 차단 등 안전성 측면에서는 여전히 심각한 취약점을 보이고 있습니다. 가중치를 자유롭게 다운로드하여 수정할 수 있는 구조적 특성상 외부 통제가 불가능해, 보안 위험 관리가 AI 산업의 핵심 과제로 떠올랐습니다.
정책 입안자들이 OpenAI의 GPT-5.6 Sol과 Anthropic의 Mythos 같은 점점 더 강력해지는 AI 시스템을 어떻게 규제할지 논의하는 동안, 중국의 오픈 웨이트 모델이 업계 선두 주자들과의 격차를 좁혔다. AI 안전 비영리 단체인 SaferAI의 새로운 보고서에 따르면, 중국 Z.ai의 오픈 웨이트 AI 모델인 GLM-5.2는 사이버 및 생물학적 역량 면에서 OpenAI의 GPT-5.5 및 Anthropic의 Claude Opus 4.7과 불과 몇 달 차이밖에 나지 않는다. 하지만 최고 수준의 성능과 안전성 실천 사이의 격차는 오히려 벌어지고 있다.
이 비영리 단체가 Z.ai의 공개 API를 통해 실행한 SaferAI의 평가에 따르면, GLM-5.2는 제공된 공격적인 사이버 또는 이중 용도 생물학 작업을 전혀 거부하지 않았다. 이와 대조적으로, Claude Opus 4.7은 "SaferAI가 CyberGym(사이버 보안 역량을 평가하는 벤치마크로, OpenAI가 지난달 Hugging Face 침해 사고 이전에 평가했던 벤치마크) 테스트를 아예 완료할 수 없을 정도로" 일관되게 거부했다.
이는 일부 비평가들이 수년간 경고해 온 것을 여실히 상기시킨다. 즉, 오픈 웨이트 AI 모델은 매우 강력한 AI를 잠재적인 공격자의 손에 쥐여줄 수 있으며, 일단 가중치가 다운로드된 후에는 그들이 이 기술을 어떻게 사용하는지 통제할 방법이 전혀 없다는 것이다. 오픈 웨이트 모델이 세계 최고 수준의 AI 시스템 역량에 빠르게 근접함에 따라, 논쟁의 초점은 '이 모델들이 경쟁할 수 있는가'에서 '출시 후 사회가 어떻게 위험을 관리할 것인가'로 이동하고 있다.
SaferAI의 헨리 파파다토스(Henry Papadatos) 이사는 TechCrunch와의 인터뷰에서 "역량의 최전선이 곧 위험의 최전선은 아니며, 따라서 위험을 제대로 평가하기 위해서는 완화 조치의 상태도 함께 고려해야 한다"고 말했다. Z.ai가 자체 호스팅 API에 안전 조치를 적용할 수는 있지만, 누군가 자체 하드웨어에서 가중치를 실행하게 되면 이러한 보호 장치는 강제력을 잃게 된다. 사용자는 안전장치를 제거하거나 수정하고, 모델을 미세 조정(fine-tune)하거나 시스템 프롬프트를 변경할 수 있기 때문이다.
OpenAI 및 Anthropic와 같은 최고 수준의 개발사는 위험한 사이버 및 생물학적 지원을 제한하기 위해 분류기(classifier), 거부 학습(refusal training), API 수준 제어와 같은 안전장치에 주로 의존한다. 하지만 이러한 조치도 결코 완벽하지 않다. 탈옥(Jailbreak) 공격은 배포된 모델의 보호 장치를 정기적으로 우회한다. AI 안전 비영리 단체인 Far.ai는 xAI의 Grok 4.5 및 Google DeepMind의 Gemini 3.1 Pro와 같은 최고 수준의 모델에서 수백 개의 '범용 탈옥(universal jailbreaks)'을 발견했다. 여기서 범용 탈옥은 대부분의 유해한 요청에 성공적으로 사용될 수 있는 '재사용 가능한 열쇠'로 정의된다.
보고서에 따르면, 공격자가 역할 수행, 권위자 가장, 가짜 대화 기록, 후속 프롬프트 등 여러 조작 기술을 결합하여 모델 방어의 약점을 극대화할 때 탈옥이 성공한다. 그러나 폐쇄형 모델을 위해 마련된 이러한 안전장치는 오픈 웨이트 모델에서는 전혀 작동하지 않는다. 오픈 웨이트 모델은 어떠한 안전장치도 없는 환경을 포함해 모든 인프라에서 실행될 수 있도록 설계되었기 때문이다.
파파다토스는 "목표는 분명히 좋은 역량, 즉 안전한 역량은 누구나 접근할 수 있도록 하되, 오픈소스 방식을 통해서라도 나쁜 역량은 제거하려고 노력하는 것이어야 한다"고 말했다. 파파다토스가 도움이 될 수 있다고 언급한 기술 중 하나는 '사전 학습 데이터 필터링(pre-training data filtering)'이다. 이는 AI 기업이 학습 데이터에서 공격적인 사이버 보안 정보를 제거한 다음, 선별된 데이터 세트로 모델을 학습시키는 방법이다. 일부 연구에 따르면 이 방법은 모델의 전반적인 성능을 저하시키지 않으면서도 위험한 생물학적 지식을 줄일 수 있다고 한다.
하지만 사이버 보안의 경우, 데이터 필터링은 실용성이 훨씬 떨어진다. 코딩에 탁월하지만 해킹에는 서툰 범용 모델을 학습시키는 것은 매우 어렵기 때문이다. 코딩은 현재 AI의 가장 큰 수익원이 되었기 때문에, 개발사들은 오용을 제한할 방법을 모색하는 동시에 이러한 성능을 계속 향상시켜야 하는 압박에 직면해 있다. 이 때문에 선도적인 개발자들은 대신 다른 완화 방법에 점점 더 의존하고 있다. 한 가지 접근 방식은 모델이 제공하는 사이버 보안 지원의 유형을 선택적으로 제한하는 것이다. 예를 들어, Anthropic의 Opus 5 모델 시스템 카드에 따르면 이 모델은 컴파일되지 않은 소스 코드의 취약점은 검색할 수 있지만, 컴파일된 소프트웨어의 취약점은 검색할 수 없다. 이러한 조치의 이유는