토큰 88% 절감과 정확도 7% 향상을 달성한 Gemini Flash 라인업
비디오 분석 시 토큰 소비를 최대 88% 줄여 비용을 최대 66% 절감하고 정확도는 최대 7% 높였다. 구글은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 모델에 에이전틱 비디오 이해(모델이 스스로 판단해 필요한 영상 구간을 탐색하는 기능)를 도입했다. 모델이 영상 전체를 읽는 대신 필요한 부분만 골라내어 긴 영상 분석 비용을 낮췄다.
이 기능은 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API를 통해 즉시 사용할 수 있다. 사용자가 업로드한 비디오 파일과 YouTube 비디오 모두에 적용된다. {{IMG:https://storage.googleapis.com/gweb-uniblog-publish-prod/images/agentic-video___keyword__blog-hea.width-200.format-webp.webp}} 비용은 표준 Gemini API 토큰 가격을 적용하며 에이전틱 기능에 대한 별도 추가 이용료는 없다. 기업 사용자는 Gemini Enterprise Agent Platform을 통해 전사적 비디오 분석 워크플로우에 이 기능을 통합해 운영한다.
고정 FPS를 벗어난 동적 스캔과 에이전틱 루프(Agentic Loop)의 작동
기존 정적 처리(Static processing) 방식은 초당 1프레임(FPS)의 고정 속도로 영상을 읽어 들였다. 반면 에이전틱 비디오 이해는 모델의 추론 능력과 네이티브 비디오 도구를 결합해 타겟 세그먼트를 동적으로 검색하고 스캔한다. 시각 프레임뿐 아니라 오디오와 트랜스크립트를 선택적으로 활용해 필요한 신호만 읽는다.
이 동작은 에이전틱 루프(Agentic Loop) 구조로 구현된다. 모델이 목표 달성을 위해 필요한 단계를 스스로 결정하고 반복 수행하는 제어 체계다. 모델은 내부 도구를 호출해 비디오 파일의 관련 부분만 로드하며, 어떤 모달리티를 사용할지와 영상 읽기 속도를 실시간으로 결정한다. 개발자가 수동으로 영상을 잘라 전달하던 작업을 모델이 스스로 처리한다.
작동 순서는 검색, 스캔, 검사 단계로 나뉜다. 먼저 트랜스크립트나 저해상도 프레임으로 정보 구간을 검색하고, 해당 구간을 빠르게 훑는 스캔을 거쳐 정밀 분석 지점을 특정한다. 마지막으로 해당 지점의 프레임을 고해상도로 읽거나 오디오를 세밀하게 분석하는 검사를 수행한다. 네이티브 비디오 도구는 모델의 추론 결과와 실제 비디오 파일 사이에서 필요한 데이터만 추출하는 인터페이스 역할을 한다.
구현을 위해서는 API 구성의 `processing` 설정을 `agentic`으로 지정하면 된다.
{
"processing": "agentic"
}
이 설정으로 모델은 목표 지향적으로 분석한다. 영상의 전체 흐름을 파악한 뒤 의심 구간을 정밀하게 다시 읽거나 오디오 트랙에서 특정 키워드를 찾는 탐색이 가능하다. 이는 모델이 데이터의 필요성을 판단해 요청하는 방식으로 처리하는 것이다.
이러한 동적 처리 방식은 실제 벤치마크에서 비용과 성능의 유의미한 개선으로 이어졌다.
기존 방식과 달라진 지점
10분 분량의 가이드 영상부터 90분 강의, 수 시간 분량의 녹화물 같은 장편 비디오에서 효율이 높다. 기존 정적 처리 방식에서는 높은 토큰 비용을 지불하거나, 프레임을 과도하게 생략해 세부 정보를 놓치는 상황 중 하나를 선택해야 했다. 영상 길이가 길어질수록 토큰 양이 선형적으로 증가해 비용 부담이 컸으나, 에이전틱 방식은 이를 해결했다.
장편 비디오 이해 성능 측정 지표인 LongVideoBench에서 토큰 소비 감소와 정확도 향상을 확인했다. Gemini 3.7 Flash는 정적 분석 방식보다 적은 토큰을 사용하면서도, 영상의 서로 다른 시점에 흩어진 정보를 조합해 결론을 내는 고난도 추론 작업에서 정확한 답변을 내놓았다. 목표에 맞는 핵심 구간만 선택적으로 처리해 자원 낭비를 줄인 결과다.
Gemini 3.7 Flash는 분석 정확도와 토큰 비용을 기준으로 한 파레토 프런티어(Pareto Frontier)에 위치한다. {{IMG:https://storage.googleapis.com/gweb-uniblog-publish-prod/images/agentic-video__evals.width-1200.format-webp.webp}} 일반적으로 정확도를 높이면 비용이 상승하지만, Gemini 3.7 Flash는 정확도와 비용 효율성을 동시에 확보했다. {{IMG:https://storage.googleapis.com/gweb-uniblog-publish-prod/images/agentic-video__evals_table2.width-1200.format-webp.webp}} 이는 대규모 영상 데이터를 처리하는 엔터프라이즈 환경에서 비용 효율적인 선택지가 된다.
초 단위 순간 검색과 정밀 카운팅 등 확장된 분석 가능 범위
모델이 1초 미만의 찰나를 포착하는 초 단위 순간 검색(sub-second moment retrieval)을 수행한다. 이를 통해 짧은 순간에 발생하는 이상 징후를 탐지하거나 특정 객체의 개수를 정확하게 세는 작업이 가능하다. 분석 범위가 픽셀 단위의 변화나 찰나의 동작으로 세분화되었다.
빠른 동작을 분석할 때는 초당 프레임 수(FPS)를 동적으로 변경하며 영상을 다시 스캔한다. 빠른 움직임을 감지하면 해당 구간의 FPS를 높여 세밀하게 관찰함으로써 정확한 동작 횟수를 측정한다. 이는 스포츠 경기 분석이나 공정 라인의 기계 작동 영상에서 데이터 누락 없이 횟수를 측정하는 기반이 된다.
방대한 데이터 속에서 작은 특정 정보를 찾는 니들-인-어-헤이스택(Needle-in-a-haystack) 검색 시 정적 분석보다 적은 토큰을 사용한다. 전체 영상을 일괄 처리하지 않고 필요한 부분만 선택적으로 탐색해 답변을 생성하므로 연산 자원 낭비를 줄인다. 수 시간 분량의 대규모 영상 데이터셋에서도 정밀한 답변을 빠르게 도출할 수 있다.
{{IMG:https://storage.googleapis.com/gweb-uniblog-publish-prod/images/agentic-video__diagram.width-1200.format-webp.webp}} API 호출 시 발생하는 기본 토큰 비용만으로 초 단위 검색과 동적 FPS 스캔 기능을 모두 활용할 수 있어 보안 관제나 품질 검수 등 실시간 정밀 분석 현장에 적용 가능하다.
Gemini 앱과 YouTube 'Ask YouTube'로 이어지는 실무 적용
에이전틱 비디오 이해 기능은 API를 넘어 일반 사용자 서비스로 적용된다. 구글은 Gemini 앱 내 Flash 및 Flash-Lite 모델 사용자에게 이 기능을 순차적으로 적용한다. API의 토큰 절감과 정확도 향상 기능이 일반 사용자 인터페이스로 직접 적용되어, 모델이 영상의 핵심 구간을 스스로 탐색해 답변한다.
유튜브 시청 페이지의 Ask YouTube 기능에도 향후 몇 달 내에 도입된다. 기존 텍스트 기반 자막 분석을 넘어 시각적 프레임과 오디오를 동적으로 스캔한다. 모델은 영상 속 객체의 움직임이나 화면 변화를 추론에 반영해 답변하며, 튜토리얼이나 리뷰 영상에서 답변의 신뢰도를 높인다.
한국의 AI 실무 환경에서는 기술 강의나 튜토리얼 영상을 처리하는 작업에 활용할 수 있다. 에이전틱 루프를 통해 필요한 구간만 선택적으로 로드하여 인덱싱하고 특정 장면을 추출하는 과정을 자동화한다. 이는 영상 분석 파이프라인의 운영 비용을 낮추고 처리 속도를 높인다. 특히 교육 콘텐츠나 매뉴얼 영상이 많은 기업 환경에서 영상 기반 지식 베이스 구축 비용을 낮추며, 수작업으로 진행하던 영상 구간 마킹 업무를 자동화한다. 대규모 영상 라이브러리를 전수 조사해야 하는 경우, 동적 스캔으로 처리 시간을 단축하고 GPU 자원 소모를 줄인다.
10분 이상의 가이드 영상이나 수 시간 분량의 강의 영상을 분석할 때는 Google AI Studio 또는 Gemini Enterprise Agent Platform의 API 설정에서 processing 값을 `agentic`으로 설정하여 비용 효율성과 정확도 사이의 최적점을 선택한다.




