발표에서 확인된 핵심 사실
토큰 비용과 추론 속도의 제약 없이 애플리케이션의 모든 상호작용에 인공지능을 내장하기 위해 유럽 인공지능 연구소 데저트 앤트 랩스(Desert Ant Labs)가 기기 내에서 직접 음성과 이미지, 텍스트를 처리하는 소형 특화 모델 18개를 공개했다. 이번에 공개된 모델은 안정 버전 12개와 베타 버전 6개로 구성되어 있으며 작업마다 전용 모델을 제공한다. 스위프트(Swift), 코틀린(Kotlin), 자바스크립트(JavaScript) 소프트웨어 개발 Kit를 활용해 애플리케이션에 통합할 수 있으며 월간 활성 기기 10만 대까지 무료로 제공된다.
오디오 개선 모델인 클리어(Clear)는 9메가바이트 크기로 5분 분량의 노트북 녹음 파일을 1초 만에 스튜디오 품질로 바꿀 수 있다. 기기 자체에서 음질 개선과 마스터링, 재인코딩을 수행하며 5분 오디오를 대상으로 한 벤치마크에서 아이폰 16 프로는 실시간 대비 302배, 맥북 프로 M5 칩 탑재 모델은 345배의 성능을 기록했다.
개인정보 가리기 모델 Redact는 12MB 크기로 27개
텍스트 보안을 다루는 개발자라면 주목할 수 있는 Redact는 12MB 크기의 소형 모델로 설계되었다. 이 모델은 27개 언어에서 이름, 주소, 카드 번호를 실시간으로 탐지한다. 입력된 텍스트 내 개인정보의 88.8%를 스스로 가려내어 데이터가 서버에 도달하는 것을 원천 차단한다. 비교 대상인 GLiNER-PII는 2.3GB 크기에 91.1%의 탐지율을 보이고, Rampart는 14.7MB 크기에 61.4%를 기록했으며, OpenAI filter는 3GB 크기로 60.2%의 탐지 성능을 낸다.
영상 앱 Detail은 인기가 높아짐에 따라 늘어난 인프라 비용과 로컬 모델 부족 문제를 동시에 마주했다. 개발팀은 수개월 동안 Hugging Face에서 군더더기 발화 탐지나 녹음 정리에 쓸 수 있는 모델을 찾아 나섰으나 제품에 곧바로 적용할 대안이 부족했다. 이에 따라 자체 모델 개발을 시작하여 기존에 쓰던 Dolby의 오디오 개선 기능을 Clear로 대체했다. 또한 Claude Sonnet을 284MB 크기의 자체 모델인 Clips로 교체하여 속도와 에너지 효율을 모두 높였다. Detail 6는 iOS 27과 함께 출시되며 모든 클라우드 API를 기기 실행 모델로 전면 교체할 예정이다.
대표 모델인 Voz는 iPhone에서 10분 오디오를 2초
Voz는 iPhone에서 10분 오디오를 2초 만에 전사하며 Whisper보다 4.7배 빠른 성능을 증명한다. 각 단어의 시작과 종료 시각을 정확히 제공하는 이 모델은 M3 Ultra에서 연속 30분 오디오 처리 시 실시간 대비 319배의 배속을 기록했다. Apple SpeechAnalyzer가 78배, Whisper large-v3-turbo가 50배를 기록한 것과 비교하면 압도적인 연산 효율을 보여준다. iPhone 17 Pro 환경에서는 실시간 대비 298배에 달하는 처리 속도를 달성한다.
NVIDIA 연구진의 분석에 따르면 에이전트 시스템 3개에서 대형 모델 호출의 40~70%를 소형 특화 모델로 전환할 수 있다. 반복 작업마다 거대 모델의 API를 호출하는 대신 작업에 최적화된 작은 모델을 로컬에서 실행하면 서버 왕복 비용과 지연 시간을 없앤다. 세계적으로 휴대전화, 태블릿, 노트북이 10억 대 이상 출하되는 조건에서 사용자 손안의 기기 연산 자원이 AI 데이터센터를 웃돈다는 점이 이러한 전환을 뒷받침한다. 반복 작업에 대형 모델 API를 쓸지 기기 내 소형 모델로 대체할지 판단하는 기준은 서버 왕복 비용과 로컬 기기의 실시간 처리 배속에 있다.




