Gemini 3.6 Flash, 토큰 17% 절감과 가격 인하

Gemini 3.6 Flash는 3.5 Flash 대비 출력 토큰 소비량을 17% 줄였다. Artificial Analysis Index 기준, 동일한 결과물을 낼 때 모델이 생성하는 텍스트 양이 감소했다. 이는 AI가 스스로 계획을 세워 목표를 달성하는 에이전트 작업의 운영 비용을 낮춘다. 가격은 입력 토큰 100만 개당 1.50달러, 출력 토큰 100만 개당 7.50달러다. 토큰 효율 개선과 가격 인하로 복잡한 에이전트 워크플로우의 운영 비용 효율성이 높아졌다.

모델 내부의 추론 단계와 외부 도구 호출 횟수도 줄어들었다. AGY 환경에서 멀티 에이전트 오케스트레이션으로 코드 마이그레이션을 수행한 결과, 3.5 Flash보다 지연 시간이 짧고 품질이 높았다. 개발자는 코드 변환 시 대기 시간을 줄이면서 수정 사항을 최소화할 수 있다. 또한 Gemini 앱의 캔버스 기능을 통해 3D 워크플로우용 사진 텍스처 추출 도구 개발에 적용했으며, 금융 데이터 분석 등 정밀 작업에서도 적은 토큰으로 처리 속도를 높였다.

보안 영역에서는 CBRN(화학, 생물, 방사능, 핵) 정보 유출과 사이버 공격 오용을 막는 프론티어 세이프티 장치를 강화했다. 이를 통해 가이드라인을 우회하는 탈옥(jailbreak) 시도에 대한 저항력을 높였다. 동시에 정상적인 요청에 대해 불필요하게 답변을 거부하는 사례를 줄여 사용성을 높였으며, 개발자용 기술 정보 접근성은 유지했다. 모델의 상세 스펙과 벤치마크 결과는 3.6 Flash model card에서 확인할 수 있다.

Gemini 3.5 Flash-Lite의 초당 350토큰 처리 구조

Artificial Analysis 측정 결과 Gemini 3.5 Flash-Lite는 초당 350개의 출력 토큰을 생성한다. 토큰(token)은 모델이 텍스트를 처리하는 최소 단위다. 가격은 입력 토큰 100만 개당 0.3달러, 출력 토큰 100만 개당 2.5달러로, 3.1 Flash-Lite보다 품질을 높이면서 가격 경쟁력을 확보했다. 대규모 트래픽을 처리하는 프로덕션 환경에서 낮은 비용으로 고처리량 시스템을 운영할 수 있다.

에이전트 확장을 위해 사고 수준(thinking levels) 설정 기능을 도입했다. 개발자는 작업 성격에 따라 추론 단계의 깊이를 조절할 수 있다. 단순 반복 작업이나 대량 데이터 처리에는 minimal 또는 low 수준을 선택해 지연 시간과 비용을 줄인다. 여러 하위 에이전트가 협업하는 멀티스텝 워크로드에서는 사고 수준을 높여 정답률을 확보한다.

컴퓨터 제어(computer use) 도구가 내장되어 모델이 화면의 시각 정보를 인식하고 마우스 클릭이나 키보드 입력을 직접 수행한다. 외부 도구 연결 없이 모델 자체적으로 화면 인식과 조작을 수행하므로, 다양한 소프트웨어 인터페이스를 넘나드는 에이전트 작업을 안정적으로 지원하며 OS 환경에서 직접 동작하는 실행 주체로 작동한다.

멀티모달 이해 능력을 통해 시각 정보 처리 속도를 높였다. 수많은 영수증 이미지를 텍스트로 번역하고 요약하는 작업을 대규모로 수행하거나, 게임 제작 시 구성 옵션을 즉각 생성하고 수정해 빌드 시간을 단축한다. 상세 기술 사양은 3.5 Flash-Lite model card에서 확인할 수 있다.

3.5 Flash-Lite, 기존 Flash 모델을 상회하는 벤치마크

이러한 구조적 효율성은 실제 벤치마크 성능 향상으로 이어졌다. 3.5 Flash-Lite는 소프트웨어 엔지니어링 능력을 측정하는 SWE-Bench Pro에서 54.2%의 정답률을 기록하며 3 Flash(49.6%)를 앞질렀다. 운영체제 조작 능력을 검증하는 OSWorld-Verified에서도 74.0%를 달성해 3 Flash(65.1%)보다 높은 수치를 보였다. 이는 경량 모델임에도 특정 에이전트 작업과 코딩 평가에서 상위 모델보다 정교한 작업 수행 능력을 갖췄음을 보여준다.

이전 버전인 3.1 Flash-Lite와 비교하면 실행 정확도가 크게 상승했다. 터미널 명령 실행 능력을 보는 Terminal-Bench 2.1에서 성공률이 31%에서 54%로 올랐으며, 긴 문맥 처리 능력을 평가하는 GDM-MRCR v2는 60.1%에서 72.2%로 상승했다. 실제 작업 수행력을 측정하는 GDPval-AA v2 점수는 642점에서 1140점으로 약 두 배 가까이 뛰었다.

이 모델은 지연 시간을 낮추고 처리량을 극대화해야 하는 개발자 워크플로우에 최적화되었다. 특히 에이전트 기반 검색이나 대규모 문서 처리처럼 많은 데이터를 빠르게 훑고 결과를 내야 하는 작업에 적합하다. 연산 비용을 낮추면서도 스스로 계획을 세우고 도구를 사용하는 에이전트 기능을 유지하도록 설계되었다. 벤치마크 수치의 상승은 이 모델이 단순 텍스트 생성을 넘어 실제 컴퓨터 환경에서 독립적으로 작업하는 에이전트로 기능할 수 있음을 증명한다.

모델 체급을 낮추면서 성능을 올림으로써 기존에 무거운 상위 모델이 필요했던 복잡한 코딩이나 시스템 제어 작업을 3.5 Flash-Lite만으로 수행할 수 있게 되었다. 특히 OSWorld-Verified 결과는 가상 환경 조작 능력이 실질적으로 개선되었음을 보여주며, 낮은 비용과 빠른 속도에 정밀한 작업 수행력을 결합한 형태다.

Gemini 3.5 Flash Cyber의 보안 취약점 패치 특화

Gemini 3.5 Flash Cyber는 3.5 Flash를 기반으로 사이버 보안 취약점 탐지와 패치 작업에 특화된 미세 조정 모델이다. AI가 보안 허점을 발견하는 속도가 수정 속도보다 빨라짐에 따라, 대규모 코드베이스에서 보안 이슈를 빠르게 탐지하고 패치까지 연결하는 흐름을 자동화해 보안 공백을 줄이는 것이 목적이다.

실제 구현 단계에서는 여러 AI 에이전트가 분석, 검증, 작성을 나누어 협력하는 CodeMender(멀티 에이전트 보고서 생성 도구) 내에서 작동한다. 이 모델은 사이버 보안 모델의 실제 환경 해결 능력을 측정하는 CyberGym 벤치마크에서 경쟁력을 확보했다. 이를 통해 소스 코드 사이의 논리적 결함을 식별하고, 이를 해결하기 위한 최적의 수정 코드를 생성한다.

해당 모델은 일반 사용자에게 공개되지 않으며 정부 및 신뢰 파트너에게만 제한적인 파일럿 프로그램으로 제공된다. 이는 강력한 기능의 악용을 방지하고 운영 환경의 안정성을 확인하기 위한 절차다. 경제적으로는 대형 모델보다 낮은 단가로 수백만 줄의 코드를 전수 조사하는 대규모 보안 감사 작업에서 비용 효율성을 극대화할 수 있어, 보안 엔지니어가 인프라 비용 부담 없이 상시 점검 체계를 구축하고 대응 속도를 높일 수 있다.

한국 AI 실무자를 위한 에이전트 모델 선택 기준

Gemini 3.6 Flash는 고품질 지식 작업이 필요한 비용 효율적 에이전트에 적합하고, Gemini 3.5 Flash-Lite는 대량의 문서 처리와 실시간 응답이 핵심인 검색 에이전트에 최적화되어 있다. 실무자는 작업 복잡도와 요구 응답 속도에 따라 두 모델을 분리 배치하여 지연 시간을 줄이고 운영 비용을 최적화할 수 있다.

3.5 Flash-Lite는 내장된 computer use 기능을 통해 복잡한 자동화 워크플로우를 구현한다. 예를 들어 3.6 Flash가 강한 시각 이해 능력을 바탕으로 tldraw 같은 편집기에서 인터랙티브 테마 스튜디오를 구축하는 마스터 에이전트 역할을 수행한다면, 3.5 Flash-Lite는 하위 작업자로 붙어 25개의 웹 디자인 컨셉을 즉시 생성하거나 이커머스 데이터셋에서 제품 특징을 빠르게 추출해 합성하는 작업을 담당한다. 복잡한 판단과 조율은 상위 모델에, 단순 실행과 대량 데이터 추출은 경량 모델에 배분해 전체 시스템 처리량을 극대화하는 방식이다.

보안 특화 모델인 Gemini 3.5 Flash Cyber는 일반 공개 없이 정부 및 신뢰 파트너에게만 CodeMender를 통해 제공된다. 이는 사이버 공격 오용 가능성을 차단하고 보안 전문가가 취약점을 먼저 수정하도록 돕기 위한 조치다. 일반 개발자는 공개된 Flash 라인업으로 서비스를 구축하며, 향후 출시될 Gemini 3.5 Pro와 Gemini 4의 일정을 통해 성능 확장 시점을 가늠해야 한다. 모델 체급에 따라 추론 깊이가 달라지므로 고성능 모델로의 전환 가능성을 파이프라인 설계에 반영해야 한다.

추론의 정밀도와 지식 작업의 품질이 우선인 에이전트에는 3.6 Flash를, 단순 반복 작업의 처리 속도와 극도의 비용 절감이 필요한 검색 및 자동화 에이전트에는 3.5 Flash-Lite를 선택하는 것이 최적의 배치 기준이다.