오픈 웨이트 AI 모델의 안전장치 제거, 이제 상용 서비스로
미국 스타트업 Abliteration.ai가 GLM-5.3 같은 오픈 웨이트 모델에서 학습된 거부 메커니즘을 제거('어블리터레이션')한 버전을 상용 API로 판매합니다. 코딩·사이버 능력은 대부분 유지되어 보안 테스트·레드팀 작업에 합법적 수요가 있지만, GPU 인프라 없이도 접근 가능해 악용 장벽도 낮아진다는 보안 딜레마가 있습니다.
오픈 웨이트 AI 모델의 안전장치 제거, 이제 턴키 상용 서비스로
핵심 요점
- 미국 스타트업 Abliteration.ai는 GLM-5.3 같은 오픈 웨이트 모델에서 학습된 거부 메커니즘을 제거하고, 수정된 버전에 대한 접근을 상용 API로 판매한다.
- 어블리터레이션은 모델의 많은 거부 반응을 억제해 사이버보안 테스트, 레드팀 작업, 멀웨어 분석 등에 활용할 수 있게 한다.
- 고객은 자체 GPU 인프라에서 모델을 구동할 필요가 없지만, 그만큼 쉬운 접근성은 악용의 장벽도 낮춘다.
Abliteration.ai는 강력한 오픈 웨이트 모델에서 학습된 거부 메커니즘을 제거하고, 수정된 버전에 대한 접근을 서비스로 판매한다. 여기에는 합법적인 시장이 존재하지만, 동시에 어려운 보안 트레이드오프를 만들어낸다.
오픈 웨이트 모델의 가중치에 접근할 수 있는 사람은 누구든 학습된 안전 메커니즘을 수정할 수 있다. 미국 스타트업 Abliteration.ai는 정확히 이것을 사업으로 만들었다. 이 회사는 8월 말 'abliterated-model-large-v2'를 출시했는데, 이는 Z.AI의 GLM-5.3을 수정해 민감한 요청을 거부하는 빈도를 크게 줄인 버전이다.
이 기법은 '어블리터레이션(abliteration)'이라고 불린다. 간단히 말해, 모델 내부에서 거부를 유발하는 활성화 패턴을 찾아낸 뒤, 해당 패턴을 억제하도록 모델 가중치를 조정하는 과정이다. 이는 프롬프트 탈옥(jailbreak)이 아니라 모델 자체를 변경하는 것이다. Abliteration.ai는 코딩, 사이버, 에이전트 능력은 대부분 그대로 유지된다고 주장한다.
회사의 자체 평가가 이를 뒷받침한다. 어블리터레이션된 GLM-5.3 버전은 CyberGym에서 84.5%, Terminal-Bench 4.0에서 41.8%, ExploitGym에서 2시간 동안 105개 과제를 해결했다. 다만 모델이 모든 분야에서 1위는 아니다. 회사 자체 표에서 GPT-5.5가 CyberGym에서 85.6%로 최상위를 기록했고, GPT-5.6 Sol과 Fable 5는 ExploitGym에서 훨씬 높은 점수를 냈다. Abliteration.ai도 비교 점수들이 서로 다른 테스트 환경과 컴퓨팅 예산에서 나온 것이라 직접 비교에는 한계가 있다고 인정했다.
왜 GLM인가?
전신 모델인 'abliterated-model-large'도 GLM-5.2를 기반으로 했다. Abliteration.ai에 따르면 이전 GLM 버전들은 실질적인 보안 작업에 사용하기 어렵도록 의도적으로 학습되었다. Z.AI는 GLM-5.3의 사이버 능력이 포스트트레이닝 과정에서 예상보다 빠르게 성장했다고 밝힌 바 있다. GLM은 강력한 코딩·에이전트·사이버 성능과 오픈 웨이트, 상업적 사용 가능 라이선스를 결합하고 있다. Qwen, DeepSeek, Mistral 등의 대안도 존재한다.
Z.AI는 수정, 파생 모델, 상업적 '모델 서비스(Model as a Service)' 제공을 허용한다. 따라서 그 라이선스상 Abliteration.ai는 GLM-5.3을 수정하고, 결과 모델을 호스팅하며, 접근권을 판매할 수 있다.
오픈 웨이트, 독점 서비스
어블리터레이션 자체는 새로운 것이 아니다. 개발자들은 수년간 수정된 모델을 Hugging Face에 공개해왔다. Abliteration.ai는 수정된 가중치를 공개 다운로드로 제공하지 않는다. 대신 호스팅과 운영을 직접 처리한다. 어블리터레이션된 GLM-5.3은 표준 요금 기준 입력 또는 출력 토큰 100만 개당 5달러다. 이 서비스는 고객이 모델을 다운로드하거나 GPU 인프라를 직접 구동하지 않고도 접근할 수 있게 한다. 하지만 그 턴키 방식은 문제적 사용의 장벽도 낮춘다.
회사는 이미 수요가 있다고 말한다
Abliteration.ai는 이 모델을 공격적 사이버보안, AI 레드팀, 에이전트 테스트, 신뢰와 안전(Trust & Safety) 업무용으로 마케팅한다. 여기에는 알려진 취약점 재현, 개념 증명 익스플로잇, 멀웨어 분석, 시뮬레이션 피싱 공격 등이 포함된다.
이 스타트업의 익명 창업자는 ThursdAI 팟캐스트에서 초기 수요가 특히 대기업과 은행에 배포된 AI 에이전트를 테스트하는 회사들에서 나왔다고 말했다. 이런 시스템은 공격자가 탈옥이나 프롬프트 인젝션을 이용해 승인되지 않은 행동을 유발할 수 있는지 검증할 필요가 있다.