취약점 발견 및 패치 분야에서 프런티어 수준의 성능을 갖춘

입력 토큰 100만 개당 0.75달러, 출력 토큰 100만 개당 3.75달러의 비용 구조는 Gemini 3.7 Flash의 도입 가격을 그대로 유지하며 개발자의 진입 장벽을 낮춘다. 수백 명의 엔지니어가 놓친 13년 된 크롬 버그를 찾아낸 기술력은 이제 Gemini Enterprise와 다양한 API를 통해 Gemini 3.8 Flash와 Flash Cyber라는 두 가지 모델로 구체화된다. 개발자는 Google AI Studio, Google Antigravity, Android Studio, 그리고 UI 생성을 지원하는 Stitch를 통해 해당 모델을 즉시 업무에 적용할 수 있다. API 제공 방식은 기존 개발 워크플로우에 모델을 빠르게 통합하는 경로를 제공한다.

취약점 발견과 패치 성능에 특화된 Flash Cyber는 사이버 보안 분야에서 프런티어 수준의 성능을 기록했다. CyberGym(사이버 보안 벤치마크)에서 86.2%의 정답률을 보였으며, AI의 패치 능력을 정밀하게 평가하는 CWE-Bench에서는 47.2%를 획득했다. 이는 보안 취약점을 탐지하는 단계를 넘어 실제 코드를 수정하는 패치 능력까지 프런티어 수준으로 끌어올린 결과다.

구글 내부 벤치마크 결과는 Flash Cyber의 범용성을 보여준다. 20개 프로그래밍 언어 전체에 걸쳐 취약점 발견 성공률 70% 이상을 달성하며 특정 언어에 종속되지 않는 탐지 능력을 확보했다. 다양한 언어 환경에서 일관된 성능을 내는 특성은 여러 언어가 혼재된 대규모 코드베이스의 보안 검수를 자동화하는 실질적인 도구로 작동한다.

구글이 에이전트 작업과 사이버 보안에 특화된 Gemini

낮은 비용으로 고성능 코딩 결과물을 얻으려는 환경에서는 모델 선택의 분기가 나뉜다. 구글은 에이전트 작업과 소프트웨어 개발, 다단계 추론을 수행하는 표준 버전의 Gemini 3.8 Flash를 공개했다. 이와 동시에 취약점 탐지와 완화에 최적화한 Flash Cyber를 함께 내놓았다. 사용자는 범용적인 워크호스 모델과 보안 특화 모델 중 작업 목적에 맞는 버전을 선택해 적용한다. 특히 표준 버전은 반복적인 개발 사이클에서 중추적인 역할을 수행하도록 설계했다.

DeepSWE(소프트웨어 엔지니어링 벤치마크)에서는 기존의 대형 프런티어 모델보다 적은 비용으로 더 나은 성능을 기록했다. 또한 수학, 과학, 인문학 전반의 다단계 추론 능력을 측정하는 Humanity’s Last Exam (HLE)-Verified에서 54.9%의 득점을 올렸다. 이는 복잡한 논리 전개가 필요한 실무 코드 구현에서 비용 효율적인 대안을 확보했다는 결과다.

추가 추론 단계를 실행하는 더 높은 근면성(greater diligence)을 통해 복잡한 작업의 정밀도를 높인다. 이 구조는 추론의 깊이를 더하는 대신 토큰 사용량을 증가시킨다. 정밀한 결과가 필요한 에이전트 작업일수록 더 많은 토큰을 소비하며 단계적으로 정답에 접근하는 특성을 가진다. 추론 단계의 증가는 곧바로 리소스 소비량의 증가로 이어진다.

실제 환경의 취약점 탐지 및 패치 작업에서 높은 효율성

치명적인 기초 취약점을 찾아내는 데 수개월이 걸리던 작업 시간이 2시간 미만으로 단축했다. Google의 Cloud Vulnerability Research(클라우드 취약점 연구) 팀이 3.8 Flash Cyber를 활용해 거둔 성과다. Chrome(크롬) 취약점 패치 작업에서도 대형 상용 모델보다 2.6배 더 많은 정확한 패치를 생성하며 실제 환경의 취약점 탐지와 패치 작업에서 높은 효율성과 정확도를 동시에 입증했다.

보안상의 이유로 Fairwind Program(페어윈드 프로그램)을 통해 제한된 파트너에게만 모델을 우선 제공한다. 정부 당국과 핵심 인프라 운영자 등 신뢰할 수 있는 방어자(trusted defenders)에게 우선적으로 배포하는 방식이다. 이는 사이버 공격이나 CBRN(화학, 생물, 방사능, 핵) 분야의 오용을 방지하고 방어 역량을 강화하기 위한 필수적인 조치다.

추론 품질과 비용 및 지연 시간 사이의 모델 노력 수준(effort levels) 조정 가능 여부에 따라 3.7 Flash와 3.8 Flash 중 최적 모델을 선택하며, 입력 토큰 100만 개당 0.75달러와 출력 토큰 100만 개당 3.75달러의 가격 체계 및 1M 입력과 64K 출력 윈도우 제약 조건을 기준으로 인프라 비용과 성능을 산정한다.