Gemini 3.6 Flash를 대체하는 Gemini 3.7

출시된 지 단 3주 만에 이전 모델을 대체하는 빠른 교체가 이뤄졌다. Google이 Gemini 3.6 Flash를 밀어내고 Gemini 3.7 Flash를 전격 배포하며 업데이트 주기를 극도로 단축했다. 최신 모델을 즉시 적용해 성능을 높이려는 개발자들의 선택지가 빠르게 바뀌고 있다.

이번 모델은 핵심 최적화와 개발자 피드백을 반영해 만든 워크호스(workhorse, 궂은일을 도맡아 하는 핵심 모델)다. 모델의 뼈대라고 할 수 있는 핵심 구조를 최적화해 연산 효율을 끌어올렸다. 실제 사용자인 개발자들이 현장에서 겪은 불편함과 요구사항을 수집해 모델의 작동 방식에 직접 녹여낸 결과물이다. 불필요한 과정을 덜어내고 꼭 필요한 성능을 강화하는 데 집중했다.

특히 코딩과 에이전트 성능(agentic performance, 스스로 목표를 설정하고 작업을 수행하는 능력)이 향상되었다. 복잡한 프로그래밍 코드를 작성하는 정확도가 높아졌으며, 주어진 목표를 달성하기 위해 스스로 단계를 나누어 실행하는 능력이 강화되었다. 단순히 질문에 답하는 수준을 넘어, 사용자가 원하는 결과물을 얻을 때까지 스스로 판단하고 움직이는 실행력을 높였다. 실질적인 업무를 수행하는 도구로서의 성능을 개선해 실무 활용도를 높였다.

경쟁 모델의 낮은 가격에 대응하기 위해 Gemini 3.7

FrontierCode 1.1 Main 점수가 34.4%에서 43.6%로 뛰었고, DeepSWE v1.1은 49%에서 65.3%로 올랐다. AI가 얼마나 정확하게 코드를 작성하는지 측정하는 지표와 실제 소프트웨어 개발 과정의 복잡한 문제를 해결하는 능력을 보는 테스트에서 모두 성적이 좋아진 셈이다. WebDev Arena라는 웹 개발 실무 평가 점수 역시 1,538점에서 1,588점으로 상승했다. 실제 웹사이트를 만들 때 필요한 기술적 완성도가 높아졌으며, Gemini 3.7 Flash가 이전 버전보다 더 정교하게 코드를 짤 수 있게 됐다.

이런 성능 향상과 함께 Google은 낮은 도입 가격(처음 서비스를 출시할 때 한시적으로 낮게 책정하는 가격) 전략을 택했다. 일부 경쟁 모델들이 공격적으로 비용을 낮추는 상황에 대응하기 위해서다. 사용자가 처음 서비스를 접할 때 느끼는 비용 부담을 줄여 더 많은 개발자가 Gemini 3.7 Flash를 선택하게 만들려는 의도다. 이는 시장 진입 초기 단계에서 사용자 기반을 빠르게 확보하려는 가격 전략이다.

고성능 코딩 능력과 낮은 가격이라는 두 가지 조건을 동시에 제시했다. 성능 지표의 상승폭이 큰 만큼, 저렴한 비용으로 전문적인 코딩 보조 도구를 사용할 수 있는 환경을 구축했다.

복잡한 문서 처리 능력을 측정하는 GDP.pdf 벤치마크

22%에 머물렀던 GDP.pdf(복잡한 문서 처리 능력을 측정하는 시험) 점수가 Gemini 3.7 Flash에서 34%로 뛰었다. 수십 페이지의 보고서나 표가 복잡하게 얽힌 서류에서 필요한 정보를 정확히 짚어내는 능력이 개선된 결과다. 텍스트가 빽빽한 문서 속에서도 맥락을 놓치지 않고 정답을 찾아내는 정확도가 높아졌다. 이제 더 길고 복잡한 전문 문서를 처리할 때 발생하는 누락이나 오류가 줄어들 가능성이 크다.

17%를 기록했던 Gemini 3.6의 AutomationBench(일반적인 비즈니스 업무 흐름 실행 능력을 테스트하는 도구) 성적은 Gemini 3.7 Flash에 이르러 30.4%까지 올랐다. 단순한 질문 답변을 넘어 실제 비즈니스 업무 단계를 순서대로 처리하는 실행력이 강화됐다. 이메일을 확인하고 일정을 잡는 것처럼 여러 도구를 사용해 업무를 완수하는 자동화 과정에서 모델이 길을 잃지 않고 끝까지 작업을 수행하는 비율이 늘어난 셈이다. 복잡한 워크플로우를 설계하는 개발자에게는 모델의 판단 미스로 인한 작업 실패 확률이 낮아진 지점이다.

코딩 에이전트나 복잡한 문서 기반 자동화 툴을 만드는 실무자는 이번에 인하된 가격과 성능 향상 폭을 비교해 모델 교체 시점을 결정하면 된다.