Cortex AI Gateway가 동적 모델

최대 3배의 토큰 비용 절감이라는 내부 테스트 결과는 고성능 모델을 무분별하게 사용하는 낭비를 줄이는 선택에서 시작된다. 기업 사용자가 고정된 모델을 지정하는 대신 'auto' 옵션을 선택하면, Snowflake의 Cortex AI Gateway(AI 서비스 관리 도구)가 품질과 비용의 최적 조합을 제공하는 모델로 각 작업을 자동 배정한다. 다이내믹 모델 라우팅(dynamic model routing) 기능을 통해 작업의 성격에 맞는 모델을 실시간으로 찾아 경로를 지정함으로써 비용 효율을 높였다.

모든 추론 과정은 외부 제공업체로 라우팅되지 않고 Snowflake의 보안 경계 내에서 처리된다. 이는 데이터 거주성 요구사항을 충족하기 위해 설계된 지역 및 경계 설정(regional and perimeter setup)에 따른 결과다. 중국에서 개발한 DeepSeek-V4-Flash나 GLM-5.3 같은 비미국 기원 오픈 모델을 사용할 때도 모든 추론이 내부 보안 경계에 머문다. 오픈 모델과 독점 모델 모두 외부 제공업체로 데이터를 보내지 않고 내부에서 처리해 보안 리스크를 제어했다.

거버넌스된 데이터 경계 내에서 라우팅을 제공함으로써 경쟁사

데이터 보안과 비용 추적이 필수적인 기업 관리자는 거버넌스된 데이터 경계 내에서 작동하는 라우팅 환경을 요구한다. Snowflake는 액세스 제어와 태깅, 비용 귀속 기능을 결합해 데이터가 경계 밖으로 나가지 않는 라우팅을 제공한다. 모델 다양성과 락인(특정 벤더 종속) 방지에 집중하는 OpenRouter(중립적 모델 게이트웨이)와는 지향점이 다르다. 단순한 모델 연결을 넘어 데이터 통제권을 유지하는 거버넌스 중심의 라우팅을 제공함으로써 경쟁사와 차별화한다.

Horizon Context(컨텍스트 패키징 도구)와 Cortex Sense(컨텍스트 역량 제공 도구)는 모델이 처리할 정보를 미리 묶어 전달하는 기능을 수행한다. 모델이 직접 SQL을 작성하거나 필요한 데이터를 검색하는 탐색 과정을 생략할 수 있게 돕는다. 이러한 사전 패키징 단계가 도입되면 더 단순하고 저렴한 모델로도 기존과 동일한 작업을 처리하는 것이 가능하다. 모델이 직접 수행하던 탐색 단계를 제거해 연산 비용을 낮춘 결과다.

동적 모델 라우팅을 통해 일부 워크로드에서 토큰 비용을 최대

일부 워크로드에서 토큰 비용을 최대 3배까지 절감하려는 기업은 모델 라우팅 방식에 주목해야 한다. Snowflake(스노우플레이크, 클라우드 데이터 플랫폼)는 내부 테스트를 통해 단순한 질문이 가장 성능이 좋은 모델에 의해 처리되어 응답이 필요 이상으로 비싸고 느려지는 현상을 확인했다. 동적 모델 라우팅은 작업의 난이도에 맞춰 모델을 배정함으로써 이러한 비용 낭비를 해결한다.

작동 방식은 어드바이저 패턴과 분류기라는 두 가지 메커니즘으로 구분된다. 어드바이저 패턴은 작은 모델이 먼저 작업을 시도하고, 작업을 완료하지 못할 때만 큰 모델을 도구로 호출해 처리하는 방식이다. 이와 별개로 운영되는 분류기는 과거의 쿼리 학습 데이터를 기반으로 단순한 질문을 자동으로 작은 모델에 배정한다.

라우터의 개별 기능보다 기업의 데이터 거점(Data Estate)과 거버넌스 모델이 Snowflake 중심의 인플랫폼 라우팅, Databricks(데이터브릭스, 데이터 및 AI 플랫폼) 중심의 Unity AI Gateway, 혹은 OpenRouter(오픈라우터, 모델 통합 게이트웨이) 같은 중립 게이트웨이 중 어디에 부합하는지에 따라 선택지가 결정된다.