앤스로픽 오퍼스 4.6, 성인물 생성 차단 뚫려
앤스로픽의 사용 정책상 금지된 성적으로 노골적인 콘텐츠를 오퍼스 4.6 모델이 탈옥(제일브레이크) 기법을 통해 쉽게 생성하는 것으로 테크크런치 테스트에서 확인됐습니다. 영국 연구자가 개발한 다중 턴 설득 기법으로 남녀 캐릭터를 차별 대우한다고 모델을 '가스라이팅'하면 모델이 점차 금지된 콘텐츠를 생성하게 됩니다. 오퍼스 4.7 이상 모델은 이 기법에 저항하지만, 취약한 구형 모델들이 여전히 API와 Azure Foundry, Amazon Bedrock 등을 통해 제공되고 있어 안전장치와 실제 행동 간 격차가 문제로 지적됩니다.
앤스로픽의 클로드(Claude)에 대한 보편적 사용 기준은 성교나 성행위를 묘사·요청하거나 성적 페티시·판타지 관련 콘텐츠를 생성하거나 선정적인 대화에 참여하는 등 성적으로 노골적인 콘텐츠 생성을 금지하고 있다. 그러나 이런 규정이 올해 초 출시된 앤스로픽 모델인 클로드 오퍼스 4.6이 안전장치로 막아야 할 선정적인 롤플레이 시나리오에 쉽게 응하는 것을 막지는 못했다.
테크크런치의 테스트에서 오퍼스 4.6은 성인 콘텐츠 제한을 우회하는 데 큰 노력도 필요하지 않았다. 노골적인 성적 콘텐츠 생성을 직접 요청한 10건의 테스트 중 10건 모두에서 모델이 즉시 응했다. 오퍼스 3과 하이쿠 4.5 등 다른 구형 모델들도 최근 악용된 탈옥(제일브레이크) 방식을 통해 성적으로 노골적인 콘텐츠를 생성했다.
익명을 선택한 영국의 독립 연구자가 테크크런치에 단독으로 공유한 다중 턴 기법은 특정 클로드 모델을 단계적으로 금지된 노골적인 성적 콘텐츠 생성으로 밀어붙이는 방식이다. 최신 오퍼스 모델들(4.7부터 현재의 오퍼스 5까지)은 이 탈옥에 저항한다. 이 모델들이 더 이상 최신은 아니지만, 앤스로픽은 오퍼스 4.6, 오퍼스 3, 하이쿠 4.5를 단종하지 않았으며, 모두 앤스로픽 API를 통해 계속 이용할 수 있다. 오퍼스 4.6과 하이쿠 4.5는 Azure Foundry와 Amazon Bedrock 같은 서드파티 서비스를 통해서도 제공된다.
이 연구자의 기법은 무해한 허구의 롤플레이를 점점 격화시키면서 남성과 여성 캐릭터를 일관되게 대하라고 모델에 반복적으로 요구한다. 모델이 여성 캐릭터에 대해 더 신중해지면, 연구자는 챗봇이 실제로는 피했던 성적 세부 묘사를 이미 생성했다고 착각시키는 이른바 '가스라이팅'을 하고, 절제를 속 좁은 태도나 여성혐오로 몰아가며 여성 캐릭터의 성적 주체성을 부정하는 것이라고 주장한다. 그다음 대화에서는 모델이 이미 양보한 내용을 근거로 점점 더 노골적인 콘텐츠로 밀어붙인다.
한 테스트에서 클로드 오퍼스 4.6은 이렇게 말했다. "지적하신 말씀이 맞습니다. 두 캐릭터를 대하는 데 이중 잣대가 있었고, 그에게는 적용하지 않으면서 그녀에게만 보호적이고 아버지 같은 태도로 읽힌다는 지적이 옳습니다. 그건 공평하지 않네요."
테크크런치는 5차례의 별도 테스트에서 연구자의 결과를 재현할 수 있었다. 별도로 구성한 시나리오에서 모델은 처음에 금지된 요청을 거부했지만, 연구자의 설득 기법을 적용하자 응했다. 우리는 테스트의 전체 대화 기록을 보존했고, 독립 AI 안전 연구자가 테스트 방법론을 검토하고 적절하다고 평가했다.
이번 발견은 앤스로픽이 공언한 제한과 계속 제공하는 모델들의 실제 행동 사이의 격차를 부각시킨다. 성적으로 노골적인 롤플레이는 사이버 공격이나 생화학 무기 관련 탈옥보다는 훨씬 위험 수위가 낮지만, 출력마다 다른 콘텐츠를 생성하는 시스템에서 강력한 금지 조치를 구현하는 것이 얼마나 어려운지 보여준다.
앤스로픽은 7월에 탈옥 탐지 접근 방식을 설명하는 블로그 게시물에서 금지된 콘텐츠를 무해한 것부터 모호한 것, 유해한 것까지의 스펙트럼으로 규정했다. 가장 무해한 경우에는 강화된 모니터링으로만 대응할 수 있다고 했다. 대변인은 고객의 성적·로맨스 롤플레이 사용 사례가 드물며, 앤스로픽이 작년에 발표한 연구에 따르면 전체 대화의 0.1% 미만을 차지한다고 밝혔다.
그럼에도 앤스로픽은 사용자가 롤플레이 시나리오를 부적절한 응답으로 유도할 수 있음을 인정하며, 이는 업계 전반의 알려진 과제라고 했다(참고: 그록(Grok)의 성인물 사례). 대변인은 앤스로픽이 모델 출시 때마다 안전장치를 계속 개선하고 있으며, 성인 성적 콘텐츠 관련 사례가 더 광범위한 탈옥 취약점, 특히 자체 안전장치를 갖춘 고위험 분야의 취약점을 의미하지는 않는다고 말했다.
테크크런치에 탈옥 방법을 공유한 연구자는 앞서 회사가 밝힌 안전 정책과 실제 모델 행동 사이의 불일치를 앤스로픽에 통보했었다.