Gemini 3.6 Flash, Gemini 3.5
롱호라이즌 엔지니어링 작업(복잡하고 단계가 많은 소프트웨어 개발 작업)의 토큰 비용을 최대 65%까지 덜어낼 수 있게 됐다. DeepSWE 벤치마크 기준으로 Gemini 3.6 Flash가 이전 세대 대비 출력 토큰 사용량을 17% 줄이고 추론 단계와 도구 호출을 최적화하며 도출한 결과다. AI 에이전트의 운영 비용을 낮추고 처리 속도를 높여 실질적인 구동 효율을 개선했다.
Google DeepMind가 역대 가장 토큰 효율적인 모델 중 하나라고 밝힌 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber 세 가지 독점 AI 모델을 출시했다. Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite는 즉시 사용 가능하며, Gemini 3.5 Flash Cyber는 곧 특정 파트너들에게 제공될 예정이다. AI 에이전트를 더 빠르고 스마트하며 저렴하게 확장하는 것을 목표로 한다.
API 가격은 모델의 체급과 용도에 따라 세분화됐다. Gemini 3.6 Flash는 100만 입력 토큰당 1.50달러, 출력 토큰당 7.50달러로 책정됐다. Gemini 3.5 Flash-Lite는 입력 0.30달러, 출력 2.50달러로 매우 저렴한 가격에 제공된다. 사용자는 비용 부담을 줄이면서 AI 에이전트의 규모를 확장할 수 있는 선택지를 갖게 됐다.
이전 모델 대비 토큰 효율성을 크게 개선했다
출력 토큰 사용량이 이전 버전보다 17% 줄어들며 효율성이 높아졌다. 특히 DeepSWE(에이전트가 처음부터 다단계 엔지니어링 작업을 수행하는 능력을 측정하는 벤치마크)와 같은 장기 소프트웨어 엔지니어링 환경에서는 토큰 절감률이 최대 65%에 달한다. 추론 단계와 도구 호출 횟수를 줄이고 답변의 장황함을 감소시켜 토큰 소모를 억제한 결과다.
주요 벤치마크 성능 수치도 이전 모델보다 상승했다. DeepSWE 점수는 37%에서 49%로, MLE-Bench(머신러닝 엔지니어링 성능 측정 지표)는 49.7%에서 63.9%로 올랐다. OSWorld-Verified(운영체제 환경에서의 작업 수행 능력을 검증하는 지표) 점수 또한 78.4%에서 83.0%로 증가하며 작업 수행 능력이 향상됐다.
구글은 Gemini API와 Gemini Enterprise를 통해 컴퓨터 사용 기능을 내장 클라이언트 측 도구로 통합했다. 모델이 직접 OS를 제어하는 기능을 API와 엔터프라이즈 환경에 내장하여 활용도를 높인 조치다. 추론 단계의 효율화와 도구 호출 최적화가 실제 OS 제어 성능의 수치 상승으로 이어졌다.
확인해야 할 핵심 지점
100만 토큰의 입력 컨텍스트 창과 최대 64,000 토큰의 출력 제한은 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite가 동일하게 공유하는 사양이다. 두 모델의 지식 컷오프 날짜는 2026년 3월로 같다. 입력 데이터의 규모와 정보의 최신성 기준은 두 모델 사이에 차이가 없다.
사이버 보안 연구자와 레드팀(보안 취약점을 찾아 공격하는 팀)의 버그 패치를 위해 설계된 Gemini 3.5 Flash Cyber가 출시된다. 이 모델은 Google의 독점 AI 코드 버그 수정 에이전트인 CodeMender를 통해 제공될 예정이다. 정부와 신뢰할 수 있는 파트너에게만 독점적으로 제공된다.
복잡한 추론이 필요한 고성능 작업에는 Gemini 3.6 Flash를, 초저지연 대량 처리 작업에는 Gemini 3.5 Flash-Lite를 선택하라.




