646개 언어 지원과 로컬 실행의 경제적 실익

유료 플랜의 비용 부담과 API 키 제약 없이 개인 사용자가 무료로 음성 AI를 사용할 수 있는 환경이 구축됐다. OmniVoice Studio는 모든 기능을 사용자의 기기에서 직접 실행하는 구조를 택해 API 키 발급 과정과 매달 지불하는 구독료를 없앴다. 사용량에 따른 제한이 없어 대량의 오디오 생성 작업에서도 비용 압박 없이 작업을 지속할 수 있다.

지원 언어의 범위는 기존 클라우드 서비스와 뚜렷한 수치 대비를 보인다. 32개 언어를 지원하는 ElevenLabs와 비교해 OmniVoice Studio는 646개 언어를 지원한다. 보이스 클로닝, 비디오 더빙, 실시간 받아쓰기, 보이스 디자인 등의 기능을 외부 서버 연결 없이 로컬에서 처리하며, 보이스 디자인 기능을 통해 새로운 음성 특성을 직접 설계할 수 있다. 이는 다국어 콘텐츠 제작 시 서비스 제공자가 정의한 언어 목록에 의존하지 않고 넓은 범위의 언어적 선택지를 확보했음을 의미한다.

데이터 프라이버시는 로컬 실행의 직접적인 이점이다. 음성 복제에 필요한 참조 오디오와 입력 스크립트, 생성된 오디오 파일이 외부 서버로 전송되지 않고 사용자의 로컬 저장소에만 저장된다. 이러한 보안성과 확장성 덕분에 프로젝트는 GitHub에서 스타 7.1k, 포크 1.1k를 기록했다. 개발자들은 외부 API 의존성 없이 독립적인 음성 합성 파이프라인을 구축할 수 있다.

최신 버전인 v0.2.7은 2026년 5월 3일에 릴리스됐다. macOS, Windows, Linux 각 운영체제 환경을 위한 사전 빌드 설치 프로그램을 포함하고 있어 복잡한 의존성 설치 과정 없이 즉시 실행이 가능하다. 고성능 GPU를 보유한 사용자는 클라우드 서비스의 처리 속도나 큐 대기 시간 없이 즉각적으로 결과물을 얻을 수 있으며, 생성된 결과물에 대한 완전한 소유권과 제어권을 가진다.

Tauri와 FastAPI 기반의 AI 파이프라인 구조

97개의 API 엔드포인트를 통해 모든 기능을 제어하는 구조를 갖췄다. 전체 앱은 Rust 기반의 Tauri가 셸 역할을 수행하며, 내부에 React 프론트엔드와 FastAPI 백엔드를 결합했다. Rust는 시스템 자원 효율을 높여 데스크톱 앱의 구동 속도를 올리고, Python 기반의 FastAPI는 AI 라이브러리와의 호환성을 통해 모델 제어를 수행한다. 사용자가 React 화면에서 명령을 내리면 Tauri가 이를 전달하고 FastAPI가 실제 AI 연산을 수행하는 계층 구조다.

앱의 설정값이나 작업 이력 같은 상태 유지 작업은 SQLite 로컬 관계형 데이터베이스가 담당한다. 실제 음성 처리 파이프라인은 OmniVoice(확산 모델 기반 음성 생성), WhisperX(전사 도구), Pyannote(화자 분리 도구)의 조합으로 구동된다. 이 도구들이 순차적으로 작동하며 입력된 오디오에서 화자를 식별하고, 텍스트를 추출한 뒤, 특정 목소리로 합성하는 과정을 처리한다.

그래픽 사용자 인터페이스 없이 백엔드 기능만 활용하려는 사용자를 위해 Docker 기반의 단독 실행 경로를 제공한다. 이를 통해 데스크톱 GUI를 띄우지 않고도 서버 환경에서 FastAPI 백엔드와 97개의 API 엔드포인트를 그대로 사용할 수 있다.

bash
docker run -p 8000:8000 omnivoice-studio-backend

백엔드가 실행되면 `http://localhost:8000` 주소를 통해 외부에서 API 요청을 보낼 수 있다. 상세한 API 명세는 저장소의 docs 디렉토리에 정리되어 있어, 개발자가 자신의 서비스 파이프라인에 OmniVoice의 기능을 직접 통합하기 용이하다.

하드웨어 가속 및 VRAM 용량별 성능 차이

VRAM 용량이 8GB 미만인 환경에서는 TTS 모델이 자동으로 CPU로 오프로드되어 합성 속도가 저하된다. 시스템은 실행 시 하드웨어 가속기를 자동으로 감지하며 CUDA(NVIDIA), MPS(Apple Silicon), ROCm(AMD), CPU 순으로 처리 경로를 라우팅한다. GPU 없이 CPU만으로 실행할 경우 TTS 합성 속도는 GPU 대비 약 3배 느려지며, 특히 길이가 긴 영상의 전사 작업에서 처리 시간이 크게 늘어난다. 다만 파이프라인 전체가 중단되지 않고 CPU로 전환되어 작동하므로 짧은 음성 복제나 단순 받아쓰기 작업은 수행 가능하다.

Apple Silicon 기반 맥 기기는 MLX(애플 실리콘 전용 머신러닝 프레임워크) 기반의 Whisper와 TTS 백엔드를 자동으로 선택하여 자원을 최적화한다. AI 연산 전용 가속기인 애플 뉴럴 엔진과 GPU 가속 API인 Metal Performance Shaders를 동시에 활용해 연산 부하를 분산하며, 일반적인 CPU 전용 경로를 사용할 때보다 약 2배 높은 처리량을 기록한다.

Windows 환경에서 VRAM이 16GB 미만인 기기는 특정 TTS 엔진의 커널 컴파일 과정에서 메모리 부족 현상이 발생한다. 특히 CosyVoice 경로를 사용할 때 `torch.compile`이 커널 컴파일을 트리거하며 일시적으로 VRAM 점유율이 급증하고, 가용 메모리가 부족하면 `OutOfMemoryError: CUDA out of memory`와 함께 프로세스가 강제 종료된다. 이를 해결하기 위해 설정의 성능 메뉴에서 'Disable torch.compile (Windows)' 토글를 켜서 컴파일 과정을 비활성화해야 한다.

OS별 설치 경로와 Hugging Face 인증 절차

최초 실행 시 약 2.4GB의 모델 가중치를 다운로드해야 한다. 모든 운영체제에서 설치 순서는 저장소 클론, Bun(자바스크립트 런타임)을 이용한 프론트엔드 의존성 설치, 실행 순으로 동일하다. 현재 v0.2.7 베타 버전으로 릴리스 간 기능 변동 가능성이 크므로, 소스 코드를 직접 클론하여 `bun run desktop-prod` 명령어로 실행하는 경로를 권장한다.

Windows 환경에서는 관리자 권한이 없는 일반 PowerShell에서 다음 명령어로 설치를 진행한다.

bash
git clone ... && bun install && bun run desktop-prod

macOS에서는 애플의 보안 정책으로 인해 외부 앱 실행이 차단될 수 있으며, 터미널에서 다음 명령어로 격리 속성을 제거해야 한다.

bash
xattr -d com.apple.quarantine /Applications/OmniVoice\ Studio.app

Linux 배포판은 시스템 라이브러리 구성에 따라 필수 패키지를 별도로 설치해야 한다. Debian이나 Ubuntu 환경에서는 libwebkit2gtk-4.0-37와 libgtk-3-0 패키지가 필요하며, Fedora 환경에서는 webkit2gtk3 패키지를 설치해야 한다. 이 라이브러리들은 Tauri 셸이 웹 뷰를 렌더링하는 데 사용되는 필수 구성 요소다.

화자 분리와 대형 음성 설계 엔진을 사용하려면 Hugging Face의 인증 절차가 필수적이다. pyannote/speaker-diarization-3.1 모델은 게이트 모델로 운영되므로, 사용자는 Hugging Face 계정 생성 후 해당 모델 페이지에서 이용 약관에 동의하고 접근 권한을 승인받아야 한다. 승인 후 계정 설정에서 생성한 read token을 프로그램에 입력해야 모델 가중치를 내려받을 수 있다.

제로샷 보이스 클로닝과 더빙 워크플로우

제로샷(Zero-shot) 기반의 보이스 클로닝은 별도의 파인튜닝 없이 3~10초 분량의 참조 오디오만으로 화자의 음색을 복제한다. 추론 시점에 참조 클립을 입력하면 모델이 즉석에서 화자의 주파수 특성과 톤을 분석해 적용하는 구조다. 이는 데이터 수집 비용을 낮추고 즉각적인 다국어 음성 생성을 가능하게 하여 콘텐츠 제작 시간을 단축한다.

더빙 파이프라인은 외부 입력물을 최종 영상으로 변환하는 자동화 공정으로 구성된다. YouTube URL이나 로컬 파일을 입력하면 WhisperX가 내용을 추출하고, 이를 대상 언어로 번역한다. 이후 Pyannote가 오디오 신호를 분석해 화자별 구간을 정밀하게 나눈다. 분리된 텍스트와 화자 정보는 OmniVoice 모델을 통해 해당 화자의 음색으로 합성되며, 최종적으로 원본 영상의 타임코드에 맞춰 오디오를 배치하고 MP4 파일로 믹싱되어 출력된다.

합성 품질은 참조 오디오의 순도에 결정된다. 배경 음악이나 주변 소음이 섞인 클립은 복제 품질을 떨어뜨리므로, 조용한 환경에서 녹음된 데이터를 사용하는 것이 권장된다. 소음 제거가 필요한 경우 Vocal Isolation 탭을 사용하여 배경음을 제거한 뒤 참조 파일로 등록해야 최적의 품질을 얻을 수 있다. 최종 결과물은 MP3, WAV, FLAC 포맷 중 선택하여 내보낼 수 있다.