facts: 3B 규모의 오픈 가중치 모델과 입력 구조

단일 16GB NVIDIA GPU에서 구동 가능한 3B 파라미터 규모의 Shieldstral은 텍스트와 이미지를 통합 처리하는 멀티모달 안전 분류기다. Apache 2.0 라이선스로 공개되어 가중치 다운로드가 가능하며, 기존 가드레일 모델과 달리 추론 시점에 자연어로 작성된 정책을 직접 입력받는 '정책 적응형(Policy-adaptive)' 방식을 채택했다.

모델의 입력 인터페이스는 세 가지 필드로 구성된다. 평가 컨텍스트와 엄격도, 안전하지 않은 콘텐츠의 정의를 담는 `<Instruct>`, "이 콘텐츠가 신체적 폭력을 조장하는가?"와 같은 예/아니오 형태의 질문을 던지는 `<Query>`, 그리고 판단 대상인 프롬프트나 응답, 혹은 이미지와 텍스트가 결합된 `<Document>`가 그것이다.

출력 방식은 이진 질문-답변(Binary QA) 과업으로 처리된다. 추론 단계에서 모델은 'Yes'와 'No'에 해당하는 로짓(Logits) 값만 읽어 들인 뒤, 이를 소프트맥스(Softmax) 정규화하여 연속적인 안전 점수로 변환한다. 이 구조를 통해 프롬프트 분류, 응답 모더레이션, 거부 탐지, 독성 탐지 기능을 단일 체크포인트에서 통합 수행한다.

how-it-works: 정책 적응형 QA 메커니즘과 학습 파이프라인

학습의 핵심은 고정된 유해 카테고리를 가중치에 내재화하는 대신, 주어진 정책의 경계를 추론하는 능력을 기르는 데 있다. Mistral 팀은 이를 위해 서로 유사해 혼동하기 쉬운 정책 세트를 구성하고, LLM을 이용해 특정 정책은 위반하지만 유사한 다른 정책은 위반하지 않는 대조 쌍(Contrastive pairs) 데이터를 생성해 학습시켰다. 이는 모델이 단순 암기가 아닌 정밀한 판별 능력을 갖추게 하여, 추론 시 처음 접하는 사용자 정의 정책에도 대응할 수 있게 한다.

데이터 통합 과정에서는 서로 다른 레이블 체계와 분류법을 가진 공개 안전 데이터셋들을 동일한 '지시-질문-문서' 형식으로 변환하는 전처리기를 사용했다. 특히 적대적 탈옥(Jailbreak) 데이터에는 엄격한 기준을, 응답 품질 데이터에는 완화된 기준을 적용해 결정 경계를 보정했다. 이미지 안전성 확보를 위해 일반 목적의 이미지 데이터셋을 고품질 부정 샘플(Negatives)로 활용했으며, 비전-언어 리랭커(Vision-Language Reranker)를 통해 오레이블링과 환각을 필터링했다.

최종 모델은 세 가지 체크포인트를 SLERP(Spherical Linear Interpolation, 구면 선형 보간) 방식으로 병합해 완성했다. 공개 데이터로 보정된 체크포인트, 생성 데이터로 정책 판별력을 높인 체크포인트, 그리고 기본 인스트럭트(Instruct) 모델을 LoRA(Low-Rank Adaptation)로 미세 조정 후 병합하여 지시 이행 능력과 정책 적응력을 동시에 확보했다. 이 과정은 Mistral의 자체 학습 플랫폼인 Forge에서 수행되었다.

벤치마크 결과, Shieldstral은 텍스트 안전성, 거부 탐지, 정책 적응성 및 멀티모달 벤치마크에서 최대 7배 더 큰 규모의 오픈 가드 모델들과 대등하거나 더 높은 성능을 기록했다. 특히 멀티모달 모더레이션 분야에서는 새로운 SOTA(State-of-the-art) 성능을 달성했다고 발표했다. 모든 평가는 학습 데이터에 포함되지 않은 홀드아웃(Held-out) 샘플을 통해 검증되었다.

implementation-impact: 배포 환경에 따른 정책 제어와 운영 기준

기존 모더레이션 모델은 서비스 성격이 바뀌면 유해 카테고리를 재정의하고 모델을 다시 학습시켜야 했다. 하지만 Shieldstral은 정책이 프롬프트 내에 존재하므로, 사이버 보안 연구 도구처럼 허용 범위가 넓은 서비스와 정신 건강 플랫폼처럼 엄격한 기준이 필요한 서비스에 동일한 모델을 배포하고 `<Query>` 문구만 수정해 즉각적으로 대응할 수 있다.

실무자는 모델이 내놓는 이진 레이블 대신 소프트맥스로 정규화된 연속 안전 점수를 활용해 서비스별 임계값(Threshold)을 다르게 설정하거나, 신뢰도에 따라 결과값을 랭킹화하여 운영할 수 있다. 따라서 개발자는 특정 카테고리의 분류 정확도보다, 서비스의 도메인 특성에 맞는 자연어 정책 질문을 정교하게 설계하고 이에 따른 점수 임계값을 튜닝하는 것에 집중해야 한다.