안스로픽, 사이버 보안 강화된 신모델 '미토스' 파트너십 공개 및 '페이블' 일반 배포
안스로픽이 보안 취약점 발견 및 해킹 툴 제작에 악용될 수 있는 고성능 모델 '클로드 미토스 5(Claude Mythos 5)'를 정부 및 선별된 산업 파트너에게만 제한적으로 공개했습니다. 일반 사용자에게는 동일한 기반 모델에 사이버 보안, 생물학, 화학 관련 질문을 차단하는 안전장치(Guardrails)를 적용한 '클로드 페이블 5(Claude Fable 5)'를 배포하며, 민감한 질문은 구형 모델로 라우팅됩니다. 이는 AI의 고도화된 사이버 능력이 악의적인 해커들에게 넘어가는 것을 사전에 방지하기 위한 업계의 안전한 모델 공개 전략을 보여줍니다.
화요일, 안스로픽(Anthropic)은 클로드 페이블 5(Claude Fable 5)와 클로드 미토스 5(Claude Mythos 5)라는 두 가지 새로운 AI 모델을 발표했습니다. 이 모델들은 4월에 소수의 기술 산업 파트너들에게 제한적으로 공개되었던 미토스 프리뷰(Mythos Preview) 모델보다 더 뛰어난 성능을 갖춘다고 회사는 밝혔습니다. 안스로픽은 초기 한정 공개가 모델의 기능이 악의적인 행위자에 의해 해킹 도구 개발에 악용되어 방어자들을 당황하게 할 수 있다는 우려에서 비롯되었다고 밝혔습니다.
안스로픽은 현재 클로드 미토스 5를 제한된 산업 파트너들에게만 제공하고 있으며, 이들 중 다수는 이미 미토스 프리뷰에 대한 접근 권한을 가졌던 곳들입니다. 또한 이번 배포 과정에서 미국 정부와 협력하고 있다고 회사는 밝혔습니다.
일반에 공개되는 클로드 페이블 5는 미토스 5와 동일한 기반 모델을 사용하지만, 출시와 함께 모델이 사이버 보안, 생물학 및 화학과 관련된 많은 사용자 질문에 답하는 것을 차단하는 '가드레일(Guardrails, 안전장치)'을 갖출 것이라고 회사는 화요일에 전했습니다. 이러한 요청은 대신 이전 세대 AI 모델인 클로드 오퍼스 4.8(Claude Opus 4.8)로 라우팅됩니다.
안스로픽은 사용자가 클로드 페이블 5를 바탕으로 더 큰 AI 모델의 응답을 활용해 더 작은 AI 모델을 학습시키는 '증류(Distillation)'를 시도하고 있다고 의심할 경우, 해당 요청 역시 클로드 오퍼스 4.8로 라우팅할 것이라고 밝혔습니다.
WIRED와의 인터뷰에서 안스로픽의 제품 관리 총괄 다이앤 펜(Diane Penn)은 회사가 4월 출시 이전부터 미토스의 소프트웨어 취약점 발견 능력 및 기타 고급 기능을 어떻게 다룰 것인지에 대한 문제를 고민해 왔다고 밝혔습니다. 그러나 그 이후의 테스트와 사용자 피드백이 이번 전략을 다듬는 데 도움이 되었다고 덧붙였습니다.
펜은 "모든 사용 사례에 대해 완벽한 해결책을 처음부터 갖추지 못했더라도, 유익한 방식으로 개선을 이루려고 노력하고 있다"며, "여러 가지 접근 방식 중에서 이것이 가장 실행 가능하고 최선의 방법으로 부상했습니다. 결과적으로 이것이 사용자가 페이블 5에서 최대의 가치를 얻을 수 있는 최고의 제품 선택이라고 느꼈습니다"라고 말했습니다.
현재로서는 보호 메커니즘이 보수적인 쪽으로 오류를 일으키도록(안전 쪽으로 치우치도록) 설계되었다고 펜은 밝혔습니다. 즉, 일부 사용자 질문이 실제로는 무해하더라도 성능이 낮은 AI 모델로 라우팅될 수 있다는 뜻입니다. 안스로픽은 시간이 지나면서 분류기를 더 정교하게 만들 계획이지만, 현재로서는 이 방법이 모델을 광범위하게 배포할 수 있는 유일한 안전한 방법이라고 펜은 설명했습니다.
화요일, 안스로픽은 클로드 미토스 5를 '프로젝트 글래스윙(Project Glasswing)' 파트너들에게 제공하는 것 외에도 '선별된 생물학 연구자들'에게도 접근 권한을 부여하고 있다고 밝혔습니다. 또한 블로그 게시물을 통해 '신뢰할 수 있는 액세스 프로그램'이 가동될 때까지 이 소규모 고객 그룹에 제한 없는 버전을 제공하고 있다고 언급하며, 향후 접근 범위를 더 확대할 계획임을 시사했습니다.
4월 미토스 출시 이후, 안스로픽은 민간 기업과 오픈 웨이트(Open Weight) 분야의 경쟁사들도 결국 필연적으로 미토스 수준의 성능을 갖춘 모델을 제공하게 될 것이라고 반복해서 강조했습니다. 클로드 미토스와 기타 새로운 AI 모델들이 새로운 소프트웨어와 레거시 소프트웨어 모두에서 취약점을 찾아 악용하는 해킹 도구를 설계할 수 있는 능력은 전 세계의 기술 기업과 정부가 이 수준의 AI 모델이 공격자들에게 널리 제공되기 전에 소프트웨어 방어 체계를 강제하도록 만들고 있습니다.
안스로픽은 처음에 '프로젝트 글래스윙'이라는 컨소시엄 산하의 산업 파트너들에게 미토스를 배포했습니다. 이는 더 폭넓은 배포가 이루어지기 전에 회원사들이 자체 시스템을 준비하고 이러한 위협에 대한 글로벌 해결책을 모색하는 데 먼저 우위를 점할 수 있도록 하기 위한 아이디어였습니다.
안스로픽은 지난주 있었던 프로젝트 글래스윙 업데이트에서 다음과 같이 작성했습니다. "우리는 일반 이용자들에게 미토스 수준의 기능을 안전하게 배포하기 위해 최대한 빨리 노력하고 있습니다. 그러기 위해서는 모델의 사이버 기능이 오용되는 것을 방지하는 매우 강력한 안전장치가 필요합니다. 하지만 이러한 안전장치는 우리(그리고 우리가 아는 한 모든 AI 개발사)가 아직 개발하지 못한 것입니다." 안스로픽에 따르면 클로드 페이블 5의 이름은 문학 형태에서 따온 것입니다.