3.7의 비용으로 프론티어 성능을 내는 Gemini 3.8 Flash
고성능 추론과 코딩 능력이 필요하면서도 운영 비용 부담을 획기적으로 줄여야 하는 개발자는 이제 Gemini 3.8 Flash를 선택할 수 있다. 구글은 3.7 Flash와 동일한 처리 속도와 저비용 구조를 그대로 유지하면서도, 추론 능력을 프론티어 모델(최첨단 성능을 가진 대규모 언어 모델) 수준으로 끌어올린 Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber 두 가지 버전을 출시했다. 3주 전 3.7 Flash의 출시 이후 6주 만에 세 번째 Flash 모델을 내놓으며 성능 개선 주기를 단축하고 효율성을 극대화했다.
Gemini 3.8 Flash는 전문 지식 영역에서 기업용 자율 에이전트가 갖춰야 할 높은 수준의 신뢰성과 안정성을 확보했다. STEM(과학, 기술, 공학, 수학), 인문학, 전문 분야를 아우르는 다단계 추론 능력을 측정하는 HLE-Verified 벤치마크에서 54.9%의 정답률을 기록했다. 이는 모델이 단순한 정보 인출을 넘어, 여러 단계의 복잡한 논리적 사고 과정을 거쳐 정답을 도출해야 하는 고난도 추론 과제에서 실질적인 성능 향상을 이뤄냈음을 보여준다. 특히 전문 지식 도메인 전반에서 비즈니스 핵심 업무를 자율적으로 수행할 수 있는 기반을 마련했다.
정량적 분석과 전문 보고서 작성이 필수적인 금융 및 법률 분야의 벤치마크에서도 성과가 뚜렷하게 나타났다. Vals Finance Agent V2와 Harvey's Legal Agent Benchmark에서 기존 3.7 Flash는 물론, 더 많은 연산 자원을 사용하는 다른 프론티어 모델들의 성능을 상회하는 결과를 냈다. 정량적 분석이 필요한 전문 분야에서 Flash 모델이 고가의 대형 모델이 전담하던 데이터 분석 및 법률 보고서 작성 작업까지 충분히 대체할 수 있는 수치를 증명한 것이다. 이는 저비용 모델로도 전문직 수준의 분석 결과물을 얻을 수 있음을 의미한다.
보안 특화 모델인 Gemini 3.8 Flash Cyber는 공격자보다 우위에 서는 방어자 역량 강화에 모든 개발 초점을 맞췄다. 구글은 시스템의 취약점을 이용해 내부로 침투하는 공격적 기능보다, 발견된 보안 허점을 근본적으로 해결하는 vulnerability fixing(취약점 수정) 능력을 개발 초기부터 최우선 순위에 두고 탑재했다. 이를 통해 보안 전문가가 시스템의 취약점을 빠르게 식별하고 즉각적인 보완 패치를 적용하는 방어 프로세스 전반에서 최적화된 성능과 전문성을 제공한다. 결과적으로 공격자의 속도보다 빠른 방어 체계를 구축하는 데 기여한다.
반복적 도구 호출과 추론 단계를 늘린 'Work Harder' 설계
모델이 스스로 내놓은 결과물을 다시 평가하고 수정하는 과정을 반복하는 구조를 채택했다. 이를 롱러닝 에이전틱 루프(long-running agentic loops, 장시간 스스로 판단해 작업을 수행하는 구조)라고 한다. 기존 모델이 입력값에 대해 즉각적인 답변을 내놓는 단발성 구조였다면, 이 방식은 정답에 도달할 때까지 내부적으로 검토와 수정을 반복하는 순환 구조를 가진다. 모델이 생성한 중간 결과물을 스스로 비판적으로 검토하고, 논리적 결함이 발견되면 이를 수정해 다시 출력하는 재귀적 과정을 거친다. 이러한 반복 수행은 모델이 복잡한 논리 체계를 스스로 정교화하게 만들어 최종 출력의 신뢰도를 높이며, 기반 모델의 지능을 실질적인 성능 향상으로 가속하는 역할을 한다.
난도가 높은 작업이 입력되면 모델은 추론 단계를 추가로 생성하고 외부 도구를 반복적으로 호출한다. 도구 호출은 모델이 직접 수행하기 어려운 수학적 계산이나 실시간 데이터 조회를 위해 외부 함수나 API를 요청하는 동작을 말한다. 단순히 도구를 한 번 사용하는 것에 그치지 않고, 호출 결과로 얻은 데이터를 다시 추론 과정에 입력해 다음 단계의 도구를 결정하는 연쇄적 흐름을 만든다. 예를 들어 코드 작성 작업 시 코드를 생성하고, 실행 도구로 검증하며, 에러 메시지를 다시 분석해 코드를 수정하는 과정을 반복한다. 이는 단순한 텍스트 생성을 넘어 모델이 환경과 상호작용하며 정답을 찾아가는 방식으로, 더 많은 사고 단계를 거쳐 문제 해결의 완결성을 확보하는 설계다.
성능을 극대화하기 위해 추론 단계를 늘리면 그만큼 더 많은 토큰을 소모하는 특성이 있다. 토큰은 모델이 텍스트를 읽고 쓰는 최소 단위이며, 내부적인 생각의 단계가 많아질수록 처리해야 할 토큰의 총량이 늘어난다. 이는 연산 자원 소모와 응답 지연 시간의 증가로 이어진다. 개발자는 이러한 토큰 오버헤드, 즉 성능 향상을 위해 추가로 발생하는 자원 비용을 관리하기 위해 노력 수준(effort levels) 설정을 조정할 수 있다. 단순한 작업에는 노력 수준을 낮게 설정해 빠른 응답과 낮은 비용을 유지하고, 고도의 추론이 필요한 작업에만 높은 수준을 할당해 자원 효율성을 최적화하는 방식이다. 이를 통해 개발자는 작업의 중요도에 따라 추론의 깊이와 비용 사이의 균형을 직접 제어할 수 있다.
대형 모델을 앞선 DeepSWE v1.1 및 보안 벤치마크 수치
DeepSWE v1.1(장기 소프트웨어 엔지니어링 벤치마크, 복잡한 코딩 문제를 끝까지 스스로 해결하는 능력을 측정하는 지표)에서 Gemini 3.8 Flash는 대부분의 대형 프론티어 모델보다 우수한 자율 문제 해결 능력을 보였다. 단순히 특정 함수를 구현하거나 코드 조각을 생성하는 수준을 넘어, 소프트웨어 엔지니어링 문제의 분석부터 구현, 검증까지 전 과정을 스스로 처리하는 능력이 검증된 것이다. 대형 모델과 대등하거나 더 나은 성능을 내면서도 운영 비용은 훨씬 낮은 수준으로 유지했다. 모델의 파라미터 규모가 성능의 절대적 기준이 아니라는 점을 실제 엔지니어링 작업 수치로 증명하며, 효율적인 추론 구조가 대형 모델의 성능을 추월할 수 있음을 보여주었다.
보안 특화 모델인 Gemini 3.8 Flash Cyber는 취약점 발견 표준 벤치마크인 CyberGym에서 3.5 Flash Cyber와 더 큰 규모의 프론티어 모델들을 모두 앞섰다. 구글 내부에서 진행한 20개 프로그래밍 언어 대상의 취약점 발견 테스트에서도 성공률 70%를 넘겼다. 기존의 보안 벤치마크들이 주로 C/C++ 코드베이스에 집중하여 평가했던 것과 달리, 다양한 언어가 섞인 복잡한 실제 코드 환경에서 취약점을 찾아내는 능력이 이전 모델보다 크게 도약했다. 이는 실무 보안 환경에서 마주하는 다국어 코드베이스의 복잡성을 처리하는 능력이 실질적으로 강화되었으며, 자율적인 취약점 발견 능력이 프론티어 수준에 도달했음을 의미한다.
패치 능력(발견된 보안 약점을 수정하는 코드 작성 능력)을 측정하는 외부 벤치마크 CWE-Bench에서는 pass@1 47.2%를 기록했다. pass@1은 모델이 첫 번째로 제시한 답안이 정답일 확률을 뜻하며, 이 수치가 높을수록 모델의 일관된 정확도가 높음을 나타낸다. 선도적인 프론티어 모델이 기록한 47.8%와 비교했을 때 수치상으로는 거의 차이가 없는 유사한 성능을 보였으나, 이를 달성하는 데 투입되는 비용은 현저히 낮다. 성능과 비용의 최적 지점인 파레토 프런티어(Pareto frontier, 한 쪽의 성능을 떨어뜨리지 않고 다른 쪽을 개선할 수 없는 최적의 상태)에 도달하며, 저비용으로 고성능 보안 패치를 수행할 수 있는 기술적 근거를 확보했다.
이러한 결과는 Gemini 3.8 Flash 시리즈가 단순한 경량화 모델을 넘어, 특정 전문 영역에서는 대형 모델의 자원을 소모하지 않고도 동일한 수준의 결과물을 낼 수 있음을 보여준다. 특히 보안 취약점 발견과 같은 고도의 정밀함이 요구되는 작업에서 70% 이상의 성공률과 프론티어급 패치 능력을 동시에 확보한 점이 핵심이다. 이는 대규모 연산 자원을 투입하는 방식 대신, 최적화된 모델 설계와 특화 튜닝을 통해 전문 엔지니어링 영역의 진입 장벽을 낮춘 사례다.
3D 시각화부터 구글 내부 코드 보안까지의 적용 사례
Google Antigravity를 사용하는 개발자는 단일 프롬프트만으로 3D 게임과 DOS 버전의 구글 맵을 구축할 수 있다. Google Antigravity는 구글 내부에서 사용하는 신속한 프로토타이핑 도구다. 3D 게임 구현 사례에서는 루핑 지침, 즉 반복적인 명령 구조를 사용하여 퍼즐과 환경 스토리텔링이 포함된 성 내부 마법사 모험 레벨을 생성했다. 특히 Nano Banana라는 텍스처 생성 도구를 결합해 시각적 몰입감이 높은 3D 환경을 구축했다. DOS 버전 구글 맵의 경우 위치 검색, 경로 안내, 스트리트 뷰라는 세 가지 핵심 기능을 모두 포함한 완전한 작동 상태의 프로그램을 단 한 번의 요청으로 완성했다. 이는 복잡한 UI 구조와 데이터 연결 로직을 모델이 한 번에 설계하고 구현할 수 있는 능력을 입증하며, 아이디어의 시제품화 단계를 획기적으로 단축한다.
Google AI Studio에서는 Three.js를 기반으로 한 Hardware Anatomy 3D 시각화 도구가 구현되었다. Three.js는 웹 브라우저에서 별도의 플러그인 없이 3D 그래픽을 렌더링하는 자바스크립트 라이브러리다. 이 도구는 실제 하드웨어 기기의 물리적 비율을 정밀하게 반영한 분해도, 즉 티어다운 렌더링을 생성하여 시각화한다. 사용자는 디컨스트럭션 슬라이더라는 인터랙티브 조절 바를 통해 기기를 층별로 분리하는 폭발 뷰를 구현하고 내부 부품의 배치를 상세히 점검할 수 있다. 하드웨어의 물리적 구조를 이해하고 이를 웹 기반 3D 코드로 변환하는 작업이 자동화되면서, 엔지니어는 설계 검토 시간을 줄이고 시각적 분석에 집중할 수 있는 환경을 갖게 되었다.
Gemini 3.8 Flash Cyber 모델은 구글 내부의 코드 보안 시스템에 실제 적용되어 실시간으로 운영되고 있다. 이 모델은 Gray Swan이라는 보안 측정 기준에서 프롬프트 인젝션에 대한 방어 성능이 유의미하게 향상되었다. 프롬프트 인젝션은 사용자가 정교하게 설계된 악의적 입력을 주입해 모델의 시스템 프롬프트를 무력화하고 제어권을 뺏는 공격 기법이다. 보안 특화 모델이 코드 내의 취약점을 찾아내는 공격적 능력뿐만 아니라, 외부의 조작 시도를 차단하여 사용자를 보호하는 방어적 능력까지 동시에 확보한 상태다. 이는 기업용 보안 시스템에서 모델이 관리자 권한을 오용하거나 내부 기밀 정보를 유출할 위험을 낮추는 핵심적인 안전장치로 작동하며, 실제 운영 환경에서의 모델 신뢰도를 높이는 결과로 이어진다.
한국 AI 실무자를 위한 모델 선택 및 도입 기준
Gemini 3.8 Flash는 복잡한 작업에서 추가 추론 단계를 실행하고 도구를 반복 호출하며 더 많은 토큰을 소비한다. 이는 모델이 더 성실하게 작동하도록 설계된 결과로, 설정된 노력 수준(effort levels, 모델이 문제 해결을 위해 투입하는 연산량)에 따라 토큰 사용량이 직접적으로 변한다. 단순 응답이나 빠른 처리 속도가 중요한 효율성 우선 워크로드(efficiency-first workloads, 비용 대비 성능 최적화 작업)를 운영하는 실무자라면 기존 3.7 Flash를 유지하는 것이 운영 비용 측면에서 유리하다. 반면 다단계 추론이 필수적인 에이전트 구현 시에는 3.8 Flash를 도입하되, 무분별한 토큰 소비를 막기 위해 노력 수준 설정을 서비스 성격에 맞게 세밀하게 조정하는 과정이 필요하다.
보안 특화 기능이 필요한 기업이나 연구소는 Fairwind Program(신뢰할 수 있는 방어자 대상 프로그램)을 통해 Gemini 3.8 Flash Cyber 모델의 접근 권한을 확보해야 한다. 이 모델은 일반 모델에 적용된 사이버 보안 관련 완화 조치가 더 유연하게 적용되어, 전문적인 보안 분석과 취약점 탐지 같은 고난도 작업에 최적화되어 있다. 구글은 이미 내부 코드 보안 강화에 이 모델을 실전 배치하여 활용하고 있으며, Flash 모델 특유의 빠른 속도와 낮은 비용 구조를 통해 신속한 반복 테스트가 가능하다. 보안 전문가가 아닌 일반 개발자나 일반 기업 서비스의 경우, 표준 3.8 Flash 모델이 제공하는 기본 보안 기능과 세이프가드 범위 내에서 기능을 구현하는 것이 적절하다.
모든 3.8 Flash 모델에는 CBRN(화학, 생물, 방사능, 핵) 및 사이버 공격 방지를 위한 세이프가드(safeguards, 유해 콘텐츠 생성을 막는 안전장치)가 기본적으로 적용되어 있다. 이는 구글의 프론티어 안전 프레임워크(Frontier Safety Framework, 최첨단 모델의 위험을 관리하는 기준)에 따라 모델의 오남용을 원천적으로 방지하기 위한 필수 조치다. 3.8 Flash Cyber 모델은 사이버 보안 역량을 포괄적으로 제공해야 하는 특성상 일부 제한이 완화되어 제공되지만, 이 역시 엄격한 신원 확인을 거친 신뢰할 수 있는 방어자에게만 제한적으로 공개된다. 따라서 엔터프라이즈 환경에서 모델을 도입할 때는 구현하려는 서비스의 도메인이 이러한 안전 제한 범위에 저촉되는지, 혹은 특수 모델의 권한 획득이 필요한지 사전에 검토해야 한다.
추론 깊이가 필요한 복잡한 에이전트 작업에는 3.8 Flash를, 토큰 비용 절감이 최우선인 단순 작업에는 3.7 Flash를 선택한다.




