토큰 비용 50% 절감한 Gemini 3.7 Flash와 3.5

Gemini 3.7 Flash는 Gemini 3.6 Flash 출시 3주 만에 100만 토큰당 비용을 50% 수준으로 낮춰 공개되었다. 토큰(Token, 모델이 텍스트를 처리하는 기본 단위) 비용의 급격한 하락은 대규모 데이터를 처리해야 하는 에이전트 개발자의 운영 비용 계산 방식을 바꾼다. 구글은 3.6 Flash의 성능을 기반으로 비용 효율성을 극대화한 모델을 매우 짧은 주기로 시장에 투입했다. 특히 도입 가격을 기존 모델의 절반으로 설정해 고성능 모델을 유지하면서도 API 호출 비용 부담을 줄여야 하는 기업용 서비스 구축 환경에서 경제적 진입 장벽을 낮추는 선택지가 된다.

Gemini 3.7 Flash는 코딩과 에이전트 작업에 최적화된 워크호스(Workhorse, 대량의 작업을 안정적으로 수행하는 주력 모델) 모델로 설계되었다. 소프트웨어 엔지니어링과 지식 작업, 웹 개발 워크플로우 전반에서 실질적인 성능 개선을 이루었다. 에이전트(Agent, 사용자의 목표를 달성하기 위해 스스로 계획을 세우고 외부 도구를 사용하는 AI) 구현 시 필수적인 반복 호출 비용을 절반으로 줄이면서도 추론 지능은 유지했다. 개발자는 동일한 예산으로 두 배 더 많은 요청을 처리하거나, 기존보다 더 많은 단계의 논리적 추론 과정을 설계에 포함해 복잡한 지식 작업의 자동화 수준을 높일 수 있다.

음성 처리 영역에서는 Gemini 3.5 Transcribe가 실시간 음성-텍스트 변환(STT, Speech-to-Text)을 위해 도입되었다. 이 모델은 주변 소음이나 전문 용어 처리에서 정확도가 떨어지던 기존 방식과 달리, 원시 오디오 데이터를 문맥을 인식한 정제된 텍스트로 직접 변환한다. 오디오 신호에서 텍스트를 추출하는 과정에 지능형 문맥 이해를 결합해 단순한 전사 수준을 넘어선 결과물을 생성하는 구조다. 이는 소음이 심한 실제 현장이나 전문 용어가 빈번한 기술 상담 환경에서 AI가 사용자의 발화를 정확히 인식해야 하는 기술적 제약을 완화하고 데이터의 신뢰도를 높인다.

Gemini 3.5 Transcribe는 보이스 에이전트와 라이브 캡셔닝, 통화 후 분석(Post-call analytics, 통화 종료 후 대화 내용을 분석해 핵심 정보를 도출하는 작업)에 적용된다. 실시간으로 텍스트를 생성하는 라이브 캡셔닝은 방송이나 화상 회의의 실시간 접근성을 높이는 도구로 활용된다. 통화 후 분석의 경우 방대한 양의 고객 상담 녹취록을 빠르게 텍스트화하여 상담 품질을 평가하거나 고객의 요구 사항을 자동 분류하는 공정을 최적화한다. 음성 데이터의 텍스트 변환 정밀도가 높아짐에 따라 텍스트 기반의 후속 분석 단계에서 발생하는 데이터 왜곡과 오류율이 낮아지는 결과로 이어진다.

Tensor G6 칩셋 기반 Pixel 11의 온디바이스 AI 구현

Pixel 11, Pixel 11 Pro, Pixel 11 Pro XL, Pixel 11 Pro Fold 총 4종의 기기가 공개되었다. 이 제품들은 Google Tensor G6 칩셋을 핵심 하드웨어로 탑재했다. 칩셋은 스마트폰의 두뇌 역할을 하는 통합 회로로, 이번 G6 버전은 최신 Gemini Nano 모델을 온디바이스 방식으로 구동한다. 온디바이스는 데이터를 외부 클라우드 서버로 보내지 않고 기기 내부의 연산 장치에서 직접 처리하는 기술이다. 서버를 거치지 않으므로 데이터 전송에 드는 시간이 사라져 처리 속도가 비약적으로 상승하며 데이터 유출 위험이 줄어든다.

Gemini Nano는 기기의 제한된 메모리와 전력 환경에서 작동하도록 최적화된 소형 언어 모델이다. Tensor G6 칩셋은 이 모델이 요구하는 대규모 행렬 연산을 효율적으로 처리하여 응답 지연을 최소화한다. 하드웨어 수준에서 모델 실행 경로를 최적화함으로써 사용자는 인터넷 연결 없이도 AI 기능을 즉각적으로 사용할 수 있다. 이러한 구조는 카메라 시스템의 대대적인 업그레이드와 Gemini Intelligence 기반의 개인 비서 기능을 가능하게 한다. Gemini Intelligence는 사용자의 기기 내 활동 맥락을 파악해 개인화된 도움을 제공하는 지능형 시스템으로, 칩셋의 연산 능력을 통해 실시간으로 정보를 처리한다.

Tensor G6 칩셋 내부에 설계된 NPU(Neural Processing Unit, 인공지능 연산 전용 가속기)가 Gemini Nano의 추론 과정을 전담한다. NPU는 일반적인 CPU보다 AI 연산에 특화된 병렬 처리 구조를 가져 전력 소모를 줄이면서도 데이터 처리량은 높인다. 카메라 기능의 경우, 셔터를 누르는 순간 NPU가 이미지 데이터를 분석해 실시간으로 화질을 개선하거나 불필요한 요소를 제거하는 연산을 수행한다. 개인 비서 기능 역시 기기 내부에 저장된 일정이나 메시지 데이터를 외부 유출 없이 분석하여 사용자에게 최적의 답변을 제시하는 방식으로 작동하며, 이는 NPU의 빠른 데이터 처리 속도에 기반한다.

하드웨어와 소프트웨어의 결합은 온디바이스 AI의 실행 효율을 결정하는 핵심 요소다. Tensor G6는 모델의 가중치를 효율적으로 메모리에 배치하여 데이터 읽기 쓰기 속도를 높였다. 이는 대형 모델을 클라우드에서 실행할 때 발생하는 네트워크 병목 현상을 완전히 제거하는 결과로 이어진다. Pixel 11 시리즈는 이러한 칩셋 설계를 통해 AI 모델이 OS(Operating System, 운영체제) 수준에서 상시 대기하며 사용자의 요청에 즉각 반응하는 환경을 구축했다. 전용 칩셋의 도입은 Gemini Nano가 기기 내부 자원만으로 고성능 추론을 수행하게 하여 실질적인 구동 성능과 사용자 경험의 속도를 정의하며, 전력 효율과 연산 속도의 균형을 맞춘 설계가 적용되었다.

4K 업스케일링을 지원하는 Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash는 4K 업스케일링(저해상도 영상을 고해상도로 변환하는 기술)을 통해 스튜디오 수준의 비디오 제작물을 생성한다. 이 모델은 비디오 생성의 정밀도와 제어권을 높여 사용자가 영상의 세부 요소를 직접 조정할 수 있도록 설계되었다. 기존 AI 비디오 생성 모델이 입력 프롬프트에 따른 무작위 결과물에 의존했다면 Omni 1.1 Flash는 제작자가 의도한 구도와 움직임을 구현하기 위한 정밀 제어 도구를 제공한다. 4K 고해상도 출력은 상업적 영상 제작 환경에서 요구하는 최소 규격을 충족하며 최종 결과물의 시각적 선명도를 확보하는 핵심 장치다.

핵심 기능인 장면 확장(scene extension)은 기존 영상의 시각적 맥락과 화풍을 유지하면서 물리적인 길이를 늘리는 동작을 수행한다. 이는 영상의 특정 구간이 짧아 편집이 어려운 상황에서 배경과 피사체의 일관성을 유지하며 분량을 확보하는 기술이다. 첫-마지막 프레임 보간(interpolation, 두 지점 사이의 빈 프레임을 생성해 움직임을 매끄럽게 잇는 기술) 역시 함께 제공된다. 사용자가 영상의 시작 프레임과 끝 프레임을 명확히 정의하면 모델이 그 사이의 픽셀 변화 경로를 계산해 자연스러운 움직임을 생성한다. 이러한 보간 기술은 프레임 단위의 수작업 편집 시간을 획기적으로 줄여 아이디어를 빠르게 검증하는 프로토타이핑(시제품 제작) 단계를 단축한다.

모델의 접근성은 개발자와 일반 사용자를 모두 아우르는 네 가지 플랫폼을 통해 확보된다. 개발 환경인 Google AI Studio와 워크플로우 도구인 Google Flow에서는 모델의 세부 설정을 조정해 정밀한 영상을 생성할 수 있다. 기업 환경을 위한 Gemini Enterprise Agent Platform과 일반 소비자용 Gemini 앱에서도 동일한 기능을 지원하여 사용 환경의 제약을 없앴다. 이는 단순한 챗봇 인터페이스를 넘어 전문적인 영상 제작 파이프라인에 AI 모델을 직접 통합하려는 구성이다. 사용자는 각 플랫폼의 특성에 맞춰 API 호출이나 UI 조작을 통해 4K 업스케일링과 프레임 제어 기능을 실제 제작 공정에 적용하여 작업 효율을 높인다.

Gemma 10억 다운로드와 WeatherNext 2 오픈소스화

Gemma(개발자가 자유롭게 수정하고 배포할 수 있는 오픈 모델)의 누적 다운로드 횟수가 10억 회를 돌파했다. 이 모델은 스마트폰과 에지 인프라(중앙 서버가 아닌 데이터 발생 지점에서 즉시 처리하는 컴퓨팅 환경)는 물론 우주와 수중 같은 극한 환경에서도 구동된다. 사용자들은 Gemma를 활용해 종 간 커뮤니케이션 연구나 의료 분야의 기술적 돌파구를 찾는 작업에 투입하고 있다. 기상 예측 모델 WeatherNext 2는 사이클론의 경로와 강도 그리고 풍속 구조를 예측하며 Nature 논문을 통해 그 정확도를 입증했다. 10년 치의 기상학적 발전을 단일 모델로 구현한 WeatherNext 2는 현재 연구 커뮤니티에 오픈소스로 공개되어 전 지구적 기후 회복력 구축에 활용된다.

Gemini 앱의 월간 사용자 수는 10억 명을 넘어섰으며 이는 구글 역사상 가장 빠르게 성장한 제품이라는 기록으로 남았다. 매일 1억 5천만 건 이상의 이미지가 생성되며 소규모 사업자들이 마케팅 자료 제작을 위해 이미지와 비디오 그리고 오디오 생성 기능을 통합해 사용하는 경향이 강하다. 전체 사용자의 63%는 텍스트 입력 대신 음성으로 직접 대화하는 방식을 선택하며 이 중 음성 전용 사용자의 비중이 지속적으로 늘고 있다. 특히 학부모 사용자의 43%가 일상적인 작업 처리에 Gemini를 활용하며 실생활 밀착형 도구로서의 사용성을 확보했다. 교육 현장 확장을 위해 전 세계 대상 대학생에게 1년간의 AI 플랜을 무료로 제공하며 전용 학생 허브와 교사 주도 도구 그리고 SAT 시험 준비 기능을 추가했다.

범용 모델의 보급과 특정 도메인 모델의 공개는 AI 구현의 진입 장벽을 낮춘다. Gemma처럼 경량화된 모델이 에지 환경에서 작동하면 네트워크 연결이 제한된 산업 현장이나 특수 환경에서도 실시간 추론이 가능하다. WeatherNext 2와 같은 고정밀 도메인 모델의 오픈소스화는 기상 데이터 분석 같은 전문 영역의 AI 도입 비용을 직접적으로 줄인다. 이는 기업이 모든 모델을 처음부터 학습시키지 않고 공개된 전문 모델을 미세 조정(특정 목적에 맞게 추가 학습시키는 과정)하여 사용하는 전략을 가능하게 한다. 전문 모델의 공개는 데이터 수집과 기초 학습에 드는 막대한 컴퓨팅 자원 소모를 방지하는 실질적인 수단이 되며 이는 개발자가 인프라 구축보다 서비스 로직 설계에 집중하게 만든다.

온디바이스 AI 하드웨어 스펙과 Gemma의 경량화 수치를 대조해 서비스 구현 가능성을 판단하고, 도메인 특화 오픈소스 모델의 가용 여부에 따라 자체 학습 비용을 산정해야 한다.