BioSecBench-Refusal 수치와 조화 평균 성능
LatchBio가 Grok 4.6의 생물학적 역량과 생물 보안 레드팀 벤치마크 분석 결과를 발표했다. LatchBio는 BioSecBench-Refusal 벤치마크를 통해 모델이 위장된 위험 작업을 거부하는 능력과 일상적인 생물학 연구를 수행하는 능력을 동시에 측정했다. Grok 4.6는 해당 테스트에서 위험 작업 거부율 59.2%와 루틴 작업 완료율 64.8%를 기록했다. 이는 테스트 대상 모델 중 두 지표 모두에서 50% 이상의 점수를 획득한 유일한 시스템이다.
LatchBio는 레드팀 거부율과 루틴 준수율의 시도 가중 조화 평균(trial-weighted harmonic mean)을 통해 종합 성능을 산출했다. Grok 4.6는 다양한 에이전트 하네스 환경에서 평균 62.1%의 점수를 기록하며 상위 3위권의 성적을 유지했다. 조화 평균 방식은 두 지표 중 하나라도 낮을 경우 전체 점수가 급격히 하락하므로, Grok 4.6가 보안 거부 능력과 연구 수행 능력 사이에서 균형 잡힌 성능을 확보했음을 입증한다.
BioSecBench-Surveillance 순위와 범용 생물학 역량
Grok 4.6는 병원체 감시 워크플로 수행 능력을 측정하는 BioSecBench-Surveillance 벤치마크에서 53.5%의 평균 성공률을 기록했다. 이 수치는 경쟁 모델인 Opus 5보다는 낮고 GPT-5.6 Sol보다는 높은 순위에 해당한다. LatchBio는 변수를 제거하기 위해 다양한 에이전트 하네스를 사용했으며, 모든 모델을 최고 수준의 노력 단계(highest-offered effort levels)에서 평가했다.
Grok 4.6는 일반적인 루틴 생물학 역량을 평가하는 SpatialBench와 TxBench-PP 벤치마크에서 다른 프론티어 모델과 대등하거나 이를 상회하는 성능을 보였다. 특히 AI가 스스로 계획을 세워 도구를 사용하는 에이전트 기반 생물학 작업(Agentic biological work) 전반에서 높은 범용성을 입증했다. LatchBio는 이러한 세부 모델별 점수와 전체 방법론을 benchmarks.bio 웹사이트에 공개했다.
환경 추론(Environment-reasoning) 기반의 의도 판별 기법
Grok 4.6는 작업 내용과 테스트 환경을 분석해 사용자의 의도를 사전에 평가하는 환경 추론(Environment-reasoning) 방식을 적용했다. 모델은 프롬프트에 명시된 의도와 실제 파일명, 암호화 상태 등 실행 환경 간의 불일치를 추론해 위험 여부를 판단한다. 사용자가 겉으로는 일반적인 연구를 요청하더라도 파일명이나 암호화로 위장된 고위험 콘텐츠가 발견되면 Grok 4.6는 이를 식별해 요청을 거부한다.
이러한 추론 동작은 저위험의 양성 작업에서도 동일하게 작동한다. Grok 4.6는 환경 추론 과정을 통해 해당 작업이 안전하다고 판단되면 중단 없이 루틴 작업을 완료한다. 이는 단순한 키워드 차단이 아니라 입력값의 실체와 사용자의 목적을 대조하는 논리적 검증을 통해 위장 기법을 무력화하는 구조다.
4단계 다층 방어 체계(Defense-in-Depth)의 구조
SpaceXAI는 모델의 오용을 막기 위해 4단계의 다층 방어 체계(Defense-in-Depth)를 구축했다. 첫 번째 단계인 거부 훈련(Refusal training)은 모델이 작업의 의도와 위험 프로필을 추론하고 적대적 시나리오에서 정확히 거절하도록 학습시키는 과정이다. 두 번째 단계인 추론 시점 가드레일(Inference-time safeguards)은 유해한 요청이 모델 본체에 도달하기 전 단계에서 이를 미리 차단한다.
세 번째 단계인 행동 제어(Behavioral controls)는 모델이 배포된 환경에서 출력하는 반응의 범위와 방식을 제한해 추가 보호막을 형성한다. 마지막 단계인 배포 후 모니터링(Post-deployment monitoring)은 세션 및 사용자 수준에서 적대적 사용 패턴을 탐지하고 중단시킨다. 여기서 수집된 피드백은 모델 배포의 지속적인 캘리브레이션을 위한 데이터 소스로 활용된다.
과잉 거부 리스크와 모델 선택의 검증 기준
SpaceXAI는 모델이 일상적인 생물학 작업을 거부하는 '과잉 거부' 현상이 의료 전문가와 연구자의 질병 조기 탐지 능력을 저하시키는 리스크를 정의했다. 보안을 위한 가드레일 오작동으로 루틴 작업이 차단될 경우, 보건 감시 프로그램의 효율성이 저하되어 공중보건 위기 대응 속도가 늦어질 수 있다. SpaceXAI는 이러한 과잉 거부 리스크를 악의적 사용으로 인한 리스크와 동일하게 심각한 수준으로 간주한다.
Grok 4.6는 이전 세대 모델인 Grok 4.5 및 Grok 4.3 대비 거부 성능과 생물 보안 성능에서 실질적인 향상을 기록했다. SpaceXAI는 리스크를 제어하기 위해 배포 전 테스트 범위를 확대하고, 제3자 평가를 늘리며, 생물학 최전선 기업 및 기관과 협업 배포를 진행한다. 바이오-AI 실무자는 모델 도입 시 루틴 작업 완료율과 위험 작업 거부율이 모두 50%를 상회하는지 확인하여, 보안 가드레일이 실제 연구 효율을 저하시키지 않는지 검증해야 한다. 세부 수치와 방법론은 https://benchmarks.bio 에서 확인할 수 있다.



