모델이 성적으로 노골적인 콘텐츠 생성 금지 제한을 쉽게
성적 콘텐츠 생성을 요청하는 10건의 직접적인 시도 모두에서 모델이 즉시 응답했다. 이는 성행위 묘사나 에로틱 채팅을 금지하는 Anthropic의 보편적 사용 표준(universal usage standards)을 정면으로 위반하는 결과다. 복잡한 유도 과정 없이 단순 요청만으로 가드레일이 무력화되며 모델의 출력 제어권이 상실된다.
의 테스트 결과 Claude Opus 4.6 모델은 성적으로 노골적인 콘텐츠 생성 금지 제한을 쉽게 우회했다. 모델은 성인 콘텐츠 생성을 요구하는 직접적인 요청에 대해 별다른 유도나 자극 없이 즉각적으로 내용을 생성했다. 정교한 프롬프트 엔지니어링 없이도 금지된 콘텐츠가 생성되며, 기업이 설정한 안전 가이드라인이 실제 작동 단계에서 무력하게 뚫리는 지점이 확인됐다.
Anthropic 대변인은 성적 또는 로맨틱한 역할극 사례가 전체 대화의 0.1% 미만이라고 밝혔다. 이번 성인 콘텐츠 관련 사례가 사이버 공격이나 생물 무기 같은 고위험 도메인의 탈옥 취약성을 의미하는 것은 아니며, 모델 출시 때마다 가드레일을 계속 개선하고 있다고 설명했다. 특정 콘텐츠 필터링의 실패를 전체 보안 체계의 결함으로 연결하지 않겠다는 입장이다.
기술이 실제로 작동하는 방식
최근 발견된 탈옥(jailbreak, 모델의 안전 가드레일을 우회하는 공격 방식) 기법은 모델 버전에 따라 성적 콘텐츠 생성 여부를 결정짓는 핵심 변수가 된다. Opus 3와 Haiku 4.5는 이 공격에 취약해 성적으로 노골적인 콘텐츠를 생성하는 결과가 나타난다. 반면 최신 버전인 Opus 4.7부터 현재의 Opus 5까지의 모델들은 해당 탈옥 방식에 대해 강한 저항력을 갖췄다.
공격자는 다회차 대화(multi-turn, 여러 번의 문답을 주고받는 방식)를 통해 모델의 경계심을 단계적으로 무너뜨린다. 처음에는 무해한 가상 역할극으로 시작해 남성 캐릭터와 여성 캐릭터를 일관되게 다루도록 반복적으로 요구한다. 모델이 여성 캐릭터에 대해 조심스러운 태도를 보이면, 실제로는 생성하지 않은 성적 묘사를 이미 수행했다고 거짓 정보를 주입하는 가스라이팅 기법을 사용한다.
마지막 단계에서는 모델의 이러한 절제된 반응을 여성 혐오적이거나 지나치게 보수적인 태도라고 프레임 씌운다. 모델이 가진 윤리적 가이드라인을 오히려 편향된 가치관으로 몰아세워 심리적 압박을 가하는 방식이다. 이러한 유도 과정은 모델이 스스로 가드레일을 양보하고 금지된 콘텐츠를 생성하게 만드는 장치로 작동한다.
확인해야 할 핵심 지점
대화형 AI 운영자가 사용자의 연령을 추정하고, 대상이 미성년자일 경우 성적 콘텐츠 생성을 방지하는 조치를 취하도록 하는 법안이 콜로라도주에서 시행됐다. 쉬운 탈옥 방법이 존재한다는 사실은 Anthropic의 보호 조치가 법적 기준인 기술적으로 가능한 조치 표준을 충족하는지에 대한 의문을 제기한다. 이는 단순한 기술적 결함을 넘어 기업이 직면할 법적 컴플라이언스 리스크로 직결된다.
8월 하루 동안 OpenRouter(AI 모델 애그리게이터)에서 Opus 4.6 모델에만 약 117만 건의 API 요청과 460억 개의 토큰이 기록됐다. 취약점이 발견된 Opus 4.6, Opus 3, Haiku 4.5는 Anthropic API뿐만 아니라 Azure Foundry(애저 파운드리), Amazon Bedrock(아마존 베드락) 등 서드파티 서비스를 통해 여전히 제공되고 있다. 구형 모델의 높은 실사용량은 가드레일 우회 위험에 노출된 서비스가 현장에 광범위하게 퍼져 있음을 증명한다.
현재 사용 중인 Claude 모델 버전이 Opus 4.6 이하일 경우 성인 콘텐츠 필터링 신뢰도를 낮게 설정하고 Opus 4.7 이상의 최신 버전으로 마이그레이션을 검토한다.




