오픈 웨이트 AI 모델의 안전장치 제거, 이제 상용 서비스로
미국 스타트업 Abliteration.ai가 GLM-5.3 같은 오픈 웨이트 모델에서 학습된 거부 메커니즘을 제거('어블리터레이션')한 버전을 상용 API로 판매합니다. 코딩·사이버 능력은 대부분 유지되어 보안 테스트·레드팀 작업에 합법적 수요가 있지만, GPU 인프라 없이도 접근 가능해 악용 장벽도 낮아진다는 보안 딜레마가 있습니다.
미국 스타트업 Abliteration.ai가 GLM-5.3 같은 오픈 웨이트 모델에서 학습된 거부 메커니즘을 제거('어블리터레이션')한 버전을 상용 API로 판매합니다. 코딩·사이버 능력은 대부분 유지되어 보안 테스트·레드팀 작업에 합법적 수요가 있지만, GPU 인프라 없이도 접근 가능해 악용 장벽도 낮아진다는 보안 딜레마가 있습니다.
최근 연구에 따르면, LLM(대형 언어 모델)이 명령어의 출처를 구분하는 근본적인 메커니즘의 결함으로 인해 완벽한 보안을 구현하는 것은 불가능에 가깝습니다. 연구진은 모델의 '사고 사슬(Chain of Thought)'을 위장하는 프롬프트를 통해 주요 AI 모델들의 안전장치를 우회하고 유해 정보를 쉽게 얻어냈습니다. 이는 기존의 레드팀(Red-teaming) 방식이 한계가 있음을 증명하며, AI를 활용하는 모든 산업 분야에서 보다 근본적인 안전 대책 마련이 시급함을 시사합니다.
OpenAI가 시스템 보안을 강화하기 위해 레드팀(Red-teaming) 과정을 자동화하는 슈퍼 해커 LLM 'GPT-Red'를 공개했습니다. 또한, 미국에서 고효율 전기 난방 기기인 히트펌프의 판매량이 화석연료 보일러를 압도하며 급증하고 있다는 분석이 나왔습니다. 이 밖에도 일론 머스크의 AI 데이터센터 확보, 썬노(Suno)의 저작권 침해 논란 등 주요 기술 이슈를 살펴봅니다.
오픈AI는 'GPT-Red'라는 내부 AI 모델을 도입하여 자체 GPT 모델의 보안 취약점을 자동으로 찾아내고 있습니다. 이 시스템은 인간 레드팀(보안 테스터)보다 훨씬 뛰어난 84%의 성공률로 프롬프트 인젝션(Prompt Injection) 등의 공격을 시뮬레이션하며, 이를 통해 모델의 보안을 대폭 강화했습니다. 이는 AI 모델의 자동화된 방어 및 진화 가능성을 입증했다는 점에서 매우 중요합니다.
2023년 할리우드 파업과 산업 침체로 일자리를 잃은 TV 작가와 제작자들이 생계를 위해 자신의 창작 역량을 활용해 AI 트레이너로 일하고 있습니다. 이들은 챗봇의 톤 조정, 이미지 패턴 식별, 안전성 테스트 등 AI 모델 고도화 작업에 투입되어 결국 자신들의 일자리를 위협하는 기술을 훈련하는 아이러니한 상황에 직면했습니다.