Shieldstral: 자연어 정책으로 바꾸는 멀티모달 가드레일
Mistral AI가 런타임 자연어 정책에 따라 텍스트와 이미지를 판정하는 3B급 오픈 웨이트 안전 분류기 Shieldstral을 공개했다.
한 문장 요약: Mistral AI가 런타임 자연어 정책에 따라 텍스트와 이미지를 판정하는 3B급 오픈 웨이트 안전 분류기 Shieldstral을 공개했다.
무엇이 발표됐나
Mistral AI는 8월 4일 Shieldstral 1.0을 공개했다. 텍스트, 이미지, 둘을 결합한 입력에서 사용자 프롬프트와 모델 응답의 안전성, 거절 여부를 판정하는 3.8B 파라미터 모델이다. Apache 2.0 가중치와 기술 보고서를 함께 배포했으며 vLLM, llama.cpp, SGLang, Transformers에서 자체 서빙할 수 있다. 12개 언어와 32K 학습 문맥을 지원한다. 기반 구조가 이론상 256K를 받아도 모델 카드는 학습 범위인 32K 안에서 쓰라고 권고한다.
기술 구조에서 볼 지점
기존 가드 모델은 위해 범주를 가중치에 고정하는 경우가 많다. Shieldstral은 판정을 <Instruct>, <Query>, <Document> 세 부분의 질의응답으로 바꾼다. 제품 맥락과 엄격도, “폭력을 조장하는가” 같은 하나의 예·아니요 질문, 실제 콘텐츠를 입력하면 첫 출력 위치의 yes와 no 로짓을 정규화해 연속 점수를 만든다. 정책이 바뀌어도 체크포인트를 다시 학습하지 않고 질문과 임계값을 바꿀 수 있다.
학습에서는 서로 다른 분류 체계와 라벨을 가진 공개·합성 데이터 약 5,410만 건을 같은 형식으로 통합했다. 비슷하지만 경계가 다른 정책 쌍을 만들어 한 정책만 위반하도록 문장을 고친 대조 데이터도 사용했다. 공개 데이터용 체크포인트, 정책 구분용 체크포인트와 기반 지시 모델을 LoRA로 학습한 뒤 SLERP로 병합했다.
개발자에게 왜 중요한가
이 구조에서는 안전 정책도 코드처럼 버전 관리할 수 있다. 제품 표면별 지침, 질문, 임계값과 모델 버전을 함께 배포하고 실제 트래픽의 거짓 양성·거짓 음성을 비교할 수 있다. 텍스트와 이미지에 같은 인터페이스를 쓰는 점은 중복 파이프라인을 줄인다. 다만 정책 하나당 기본적으로 한 번 판정하므로 범주 수가 늘면 지연과 비용도 늘어난다. 광범위한 질문 한 번과 세부 질문 여러 번 사이의 오류·처리량 절충을 측정해야 한다.
한계와 검증 포인트
발표사의 F1 비교는 고정 벤치마크와 일부 0.5 임계값에 기반하며 이 글은 결과를 재현하지 않았다. 모델 카드도 언어·도메인별 편차, 합성 라벨 노이즈, 난독화 입력과 긴 문서에서의 신뢰도 저하를 명시한다. 운영 전에는 실제 정책 위반률을 반영한 데이터로 임계값을 보정하고, 정책 문구의 작은 변경에 점수가 흔들리는지 확인해야 한다. 이미지 OCR 우회, 인코딩·음차 공격, 문맥 후반의 위반도 따로 평가해야 한다. 이 분류기는 권한 제한이나 인간 검토를 대체하는 최종 보안 경계가 아니다.
공식 1차 출처
- Introducing Shieldstral — Mistral AI, 2026-08-04
- Shieldstral Technical Report — 학습 데이터 구성과 평가 방법
- Shieldstral 모델 카드와 가중치 — 라이선스, 실행 방법과 제한