발표에서 확인된 핵심 사실
해당 클래스에서 가장 비용 효율적인 모델의 등장은 대규모 추론 비용을 절감하려는 기업의 선택지를 넓힌다. Gemini 3.5 Flash-Lite는 비용 효율성을 극대화하여 해당 클래스 내에서 가장 낮은 비용으로 운용할 수 있도록 설계되었다. 이와 함께 출시된 Gemini 3.5 Flash Cyber는 사이버 보안 취약점을 탐지하고 이를 수정하는 작업에 최적화된 특수 모델이다. Gemini 3.5 Flash Cyber는 적절한 가격대(decent price point)에서 보안 취약점 해결 능력을 제공하도록 미세 조정(fine-tuned)된 것이 특징이다. 다만 이 모델은 일반 공개되지 않으며 정부 및 신뢰할 수 있는 파트너만을 대상으로 하는 제한적 액세스 파일럿 프로그램(limited access pilot program)을 통해서만 제공된다.
Logan Kilpatrick(로건 킬패트릭) Google DeepMind 제품 리드는 Gemini 3.5 Pro가 현재 파트너들과 함께 테스트를 진행 중이며 조만간 출시되기를 희망한다고 밝혔다. 플래그십 모델의 업데이트 준비와 더불어 차세대 모델인 Gemini 4를 위한 사전 학습(pre-training run) 작업도 이미 시작된 상태다. Google DeepMind 팀은 이번 Gemini 4 사전 학습을 지금까지 진행한 모든 사전 학습 시도 중 가장 야심 찬 규모의 작업으로 정의했다. 이는 Gemini 4의 성능 기반을 구축하기 위해 이전보다 확장된 규모의 사전 학습을 수행하는 과정이다.
기술이 실제로 작동하는 방식
2월 이후 업데이트가 중단된 상태인 Gemini Pro는 이번 업데이트 명단에서 빠졌다. 는 Google이 내부 성능 목표를 달성하는 데 어려움을 겪으며 3.5 Pro 출시가 지연되고 있다고 보도했다. 플래그십 모델의 갱신 주기가 정체된 상태다.
GPT-5.5를 출시하고 GPT-5.6 배포를 시작한 OpenAI는 신규 모델 출시 속도를 높이고 있다. 최신 버전의 모델을 연속적으로 시장에 내놓으며 배포 주기를 단축했다.
Claude Opus 4.8과 Claude Sonnet 5를 출시한 Anthropic은 프런티어 모델인 Fable 5(최첨단 성능을 지향하는 모델)의 접근 권한을 확대했다. 경쟁사들이 신규 모델 출시 공세를 강화하며 Google과 대비되는 출시 속도를 보이고 있다.
Gemini 3.6 Flash, 3.5 Flash-Lite
최대 17%의 토큰 사용량 절감으로 비용 효율을 높인 모델이 추가됐다. Gemini 3.6 Flash는 코딩 능력과 지식 작업 처리, 멀티모달 성능을 개선하며 이전 세대인 3.5 Flash보다 저렴한 비용으로 작동한다. Google은 이 모델을 다양한 환경에서 범용적으로 활용하는 워크호스 모델(workhorse model)로 정의했다. 토큰 사용량의 수치적 감소는 대규모 AI 에이전트 운영 시 발생하는 비용 부담을 직접적으로 낮춘다.
Google DeepMind는 Gemini 3.6 Flash와 함께 3.5 Flash-Lite, 3.5 Flash Cyber 세 가지 모델을 시장에 내놓았다. 이번 라인업은 대규모 AI 에이전트를 구축하는 고객이 요구하는 효율성과 낮은 지연 시간, 신뢰성 확보에 초점을 맞췄다. 에이전트 규모가 확장될 때 발생하는 리소스 낭비를 줄이고 응답 속도를 최적화하여 실무 적용 가능성을 높인 구성이다. 이는 단순한 성능 향상을 넘어 실제 서비스 운영 단계에서의 안정적인 구동을 목표로 한다.
범용적인 효율성과 성능이 필요할 때는 3.6 Flash를, 비용 최소화가 최우선인 환경에서는 3.5 Flash-Lite를, 보안 특화 기능이 요구되는 워크로드에는 3.5 Flash Cyber를 적용한다.



