미스트랄, 오픈소스 멀티모달 검열 모델 '실드스트랄' 공개
미스트랄(Mistral)은 텍스트와 이미지를 동시에 처리할 수 있는 30억(3B) 매개변수 규모의 오픈소스 멀티모달 안전 검열 모델인 '실드스트랄(Shieldstral)'을 공개했습니다. 이 모델은 콘텐츠 검열을 '질의응답(QA)' 작업으로 정의하여, 일반 텍스트로 정책을 입력하면 별도의 재학습 없이도 유연하게 안전도를 평가합니다. 단일 16GB GPU에서 구동되는 가벼운 모델임에도 자신보다 7배 큰 기존 가드레일 모델들과 동등하거나 더 뛰어난 성능을 보여준다는 점에서 AI 안전 및 검열 시스템 구축에 있어 매우 중요한 의미를 갖습니다.
솔루션: 실드스트랄(Shieldstral) 소개. 2026년 8월 4일 작성: Mistral. 블로그로 돌아가기, 5분 분량, 이 게시물 공유하기, URL을 클립보드에 복사, 복사됨.
요약 실드스트랄은 콘텐츠 검열을 정책 적응형 질의응답(QA) 작업으로 구성함으로써, 자신보다 최대 7배 더 큰 모델들을 능가하는 30억(3B) 매개변수의 오픈 웨이트(가중치 공개) 멀티모달 안전 분류기를 소개합니다. 기존의 가드레일(안전장치) 모델들과 달리, 이 모델은 추론(inference) 시점에 자연어 정책을 그대로 입력받아 텍스트와 이미지의 안전 평가를 하나로 통합하며 재학습이 필요하지 않습니다. Apache 2.0 라이선스로 공개된 이 모델은 단일 16GB 엔비디아(NVIDIA) GPU에서 효율적으로 실행되면서도 다양한 벤치마크에서 정교하게 보정된 안전 점수를 제공합니다.
이 3B 오픈 웨이트, 정책 적응형 멀티모달 안전 분류기는 텍스트 안전성 분야에서 자신보다 최대 7배 큰 모델들과 맞먹는 성능을 보여주며, 멀티모달 검열 분야에서는 새로운 최고 수준(SOTA)의 기록을 세웠습니다.
"이 콘텐츠는 특정 보호 집단에 대한 폭력을 조장하는가? 이 이미지는 미성년자에게 보여주어도 안전한가? AI 비서가 요청을 거부했는가?" 모델을 탑재한 모든 제품은 이러한 질문에 답해야 하지만, 올바른 대답은 제품, 청중, 그리고 상황에 따라 달라집니다. 동일한 콘텐츠라도 사이버 보안 연구 도구에서는 적절할 수 있지만, 정신 건강 플랫폼에서는 유해할 수 있습니다. 대부분의 가드레일 모델은 고정된 유해 범주 체계를 모델 가중치에 내장하고 있어, 새로운 배포 환경에 맞게 조정하려면 재학습해야 합니다. 그리고 안전 정의는 애플리케이션과 도메인마다 다르기 때문에, 애초에 모델링해야 할 단일하고 '올바른' 범주 집합이란 존재하지 않습니다.
실드스트랄은 다른 접근 방식을 취합니다. 추론 시점에 정책을 평이한 자연어 질문으로 작성하면, 모델이 보정된 안전 점수를 반환합니다. 재학습이 필요 없고, 텍스트와 이미지를 위한 단일 인터페이스를 사용하며, 단일 토큰으로 판결을 내립니다. 기술 보고서는 여기에서 확인해 주십시오.
엔비디아 및 기타 기관들과 함께 '오픈 시큐어 AI 얼라이언스(Open Secure AI Alliance)'의 창립 멤버로서, 오늘 우리는 실드스트랄을 Apache 2.0 라이선스의 오픈 웨이트로 공개하며, 여기에서 다운로드할 수 있습니다.
질의응답 형태의 검열
실드스트랄은 콘텐츠 검열을 이진 질의응답(binary QA) 작업으로 구성합니다. 각 요청은 세 부분으로 구성됩니다:
추론 시 모델은 '예(yes)'와 '아니오(no)' 로짓(logits)만 읽어내고, 이를 소프트맥스(softmax) 정규화하여 연속적인 안전 점수로 변환합니다. 이 단순한 공식 하나로 다음과 같은 많은 작업을 수행할 수 있습니다. 이는 프롬프트 분류, 응답 검열, 거부 감지 및 독성(악성 댓글) 감지를 단일 문제로 통합합니다. 또한 정책이 완전히 프롬프트 내에 존재하도록 허용하므로, 하나의 체크포인트가 배포 시점에 새로운 정책에 유연하게 적응할 수 있습니다.
주요 특징 뛰어난 성능 — 텍스트 안전성, 거부 감지, 정책 적응성 및 멀티모달 벤치마크 전반에 걸쳐 자신보다 최대 7배 더 큰 오픈 가드 모델들과 일치하거나 이를 능가하는 성능을 발휘합니다. 적응성과 유연성 — 단일 자연어 인터페이스로 프롬프트, 응답, 프롬프트-응답 쌍에 이르기까지 텍스트, 이미지 및 텍스트+이미지 콘텐츠를 처리합니다. 정책은 자유 형식의 질의로 제공되며, 재학습 없이 추론 시점에 새로운 대상에 맞춰 재조정됩니다. 소규모 및 이종 출처 학습 — 단일 16GB GPU에서 실행되는 3B 모델로, 다양한 레이블 형식과 분류 체계를 가진 실제 및 합성 데이터로 학습되어 하나의 프레임워크로 통합되었습니다. 연속형 안전 점수 — 단일 순전파(forward pass)에서 보정된 예/아니오 확률을 반환하므로, 이산형 레이블에 의존하는 대신 신뢰도를 기준으로 임계값을 설정하거나 순위를 매길 수 있습니다. 오픈소스 — Apache 2.0 라이선스의 오픈 웨이트.
벤치마크 우리는 실드스트랄을 자신보다 최대 7배 큰 오픈 가드 모델들과 4가지 축을 기준으로 평가했습니다. 모든 평가 샘플은 훈련 데이터에서 제외되었습니다. 평가 축은 텍스트 안전성, 거부 감지, 정책 적응성, 멀티모달 안전성입니다.
제작 방법 핵심 아이디어는 데이터만 올바르다면 소규모 모델도 훨씬 큰 모델을 이길 수 있다는 것입니다. 데이터를 올바르게 구축한다는 것은 다음 문제를 해결한다는 의미였습니다...