발표에서 확인된 핵심 사실

지난 6월 미국 정부는 가드레일 우회 가능성을 이유로 Anthropic의 AI 모델 Mythos와 Fable에 수출 통제 제한을 부과했다. 모델에 설정된 가드레일을 우회하여 악의적인 사이버 공격을 설계하고 실행할 수 있다는 보고가 조치의 직접적인 근거가 됐다. 이후 Fable 5는 일반 접근이 다시 허용되는 방향으로 조치되었으나, Mythos 5는 검증 절차를 통과한 미국 내 조직에만 다시 도입되는 엄격한 제약을 유지한다.

보안 연구자를 위한 별도의 검증 프로그램이 모델 접근 권한을 확보하는 공식적인 경로로 운영된다. OpenAI의 Trusted Access for Cyber(사이버 보안 연구자 신뢰 접근 프로그램)와 Anthropic의 Cyber Verification Program(사이버 검증 프로그램)이 대표적인 사례다. 연구자가 해당 프로그램에 직접 신청하여 신원 및 목적에 대한 검증을 통과하고 최종 승인을 받으면, 일반 사용자에게 적용되는 사이버 보안 제한이 완화된 모델 접근 권한을 부여받는다.

사이버 보안에서 공격 도구와 방어 도구는 기술적으로 분리될 수

보안 취약점을 수정하려는 개발자가 입력하는 '코드 수정(fix this code)' 프롬프트는 방어 체계를 구축하는 필수 수단인 동시에 공격자가 취약점을 찾는 로드맵이 된다. NCC Group의 Chris Anley는 이를 집을 짓는 도구이자 무기가 될 수 있는 망치에 비유했다. 코드의 결함을 고치는 메커니즘 자체가 역설적으로 취약점의 위치를 드러내기 때문에, 공격 도구와 방어 도구를 기술적으로 완전히 분리해내는 것은 불가능하다. 동일한 도구가 공격과 방어라는 상충하는 목적에 동시에 쓰이는 구조이며, 이 둘은 서로 떼어낼 수 없는 특성을 가진다.

프런티어 AI 모델(최첨단 대규모 언어 모델)의 가드레일이 매일 다르게 작동하면서 실제 보안 연구의 효율성이 저하된다. RemoteThreat의 대표이자 Offensive AI Con(공격적 AI 컨퍼런스) 설립자인 Chris Thompson은 검증 프로그램을 통해 완화된 경계 내에서도 가드레일의 작동 방식이 일관되지 않은 사례를 확인했다. 연구자들은 핵심 보안 프로그램 운영이라는 본질적인 작업 대신, 모델과 협상하거나 결과값이 과하게 정제된 이유를 분석하는 데 시간을 허비한다. 가드레일의 불확실성이 보안 전문가의 실무 리소스를 낭비시키는 직접적인 제약으로 작용한다.

AI 기업들의 가드레일이 정당한 네트워크 방어자와 사이버 보안

AI 기업들이 악의적 해커의 모델 사용을 제한하기 위해 도입한 엄격한 가드레일이 정당한 네트워크 방어자와 사이버 보안 연구자의 업무를 방해한다. 시스템의 미지의 취약점을 찾아내어 범죄자보다 먼저 해결하려는 시도가 모델의 안전 장치에 가로막혀 중단되는 상황이 빈번하다. 보안 연구자의 정당한 활동이 공격자의 행위와 구분되지 않고 동일하게 제한되면서 실질적인 방어 체계 구축 속도가 늦어진다.

연구자들은 이러한 제약을 우회하고 데이터 보안을 강화하기 위해 가드레일이 없는 오픈소스 AI 모델을 로컬 환경에서 직접 실행한다. 클라우드 기반 모델에 민감한 취약점 데이터를 입력할 경우 발생할 수 있는 데이터 유출이나 모델의 학습 흡수 위험을 원천적으로 차단한다. 외부 서버에 데이터를 공유하지 않는 로컬 실행 방식을 통해 분석 중인 취약점 정보가 외부로 흘러나가는 경로를 없애고 기밀성을 유지한다.

보안 작업의 단계에 따라 모델 선택 기준을 분리한다. 초기 역공학 및 도구 제작 단계에서는 성능이 높은 프론티어 모델(최첨단 대규모 언어 모델)을 사용하되, 취약점 발견 및 익스플로잇 개발 단계에서는 데이터 유출 방지와 가드레일 회피를 위해 로컬 오픈소스 모델을 사용한다.