facts

NVIDIA H100 GPU 환경에서 최적화된 패스트 패스(Fast Path)를 적용했을 때, 첫 오디오 출력 시간(TTFA, Time to First Audio)은 40ms 미만으로 측정됐다. 이는 사용자의 발화 종료 후 시스템이 첫 소리를 내뱉기까지의 지연 시간을 극도로 낮춘 수치다. 실시간 계수(RTF, Real-Time Factor)는 0.32를 기록했다. RTF 0.32는 1초 분량의 오디오를 생성하는 데 약 0.32초가 소요됨을 의미하며, 실제 오디오 길이보다 약 3.1배 빠른 속도로 음성을 처리한다.

메모리 점유율은 추론 방식에 따라 차이를 보인다. 일반적인 추론 시에는 약 7.7 GiB의 GPU 메모리를 사용하며, 이를 위해 최소 12 GB 메모리를 갖춘 GPU가 필요하다. 모든 과정을 최적화하는 `--fast-all` 옵션을 활성화할 경우 메모리 소요량은 약 14.4 GiB로 증가하며, 이 설정에서는 24 GB 메모리를 갖춘 GPU 사용이 권장된다.

언어 지원 범위는 영어와 중국어를 동시에 처리하는 이중 언어 모델 구조로 구축됐다. 라이선스의 경우 소스 코드는 Apache 2.0을 따르지만, 모델 가중치와 이를 통해 생성된 파생 모델 및 출력물은 연구 및 비상업적 용도로만 제한된다.

how-it-works

음성 제어 방식은 참조 오디오의 유무와 지시어 입력 형태에 따라 세 가지 경로로 나뉜다. 첫째는 보이스 클론(Voice Clone)으로, 깨끗한 참조 오디오와 정확한 전사 텍스트를 입력값으로 받아 화자의 음색, 리듬, 감정, 스타일을 보존해 출력한다. 둘째는 보이스 디자인(Voice Design)이다. 참조 오디오 없이 자연어 설명만으로 새로운 목소리를 생성하며, 이때 `--cfg-scale 4` 옵션을 통해 텍스트 지시어에 대한 준수 강도를 조절할 수 있다.

셋째는 보이스 디렉션(Voice Direction)으로, 특정 목소리를 복제함과 동시에 톤, 감정, 속도, 전달 방식을 사용자가 지정한 방향으로 조정하는 처리 과정을 거친다. 특히 텍스트 사이에 특정 표식을 삽입해 비언어적 요소를 출력하는 보컬 이벤트(Vocal Events) 기능을 지원한다. 영어의 경우 `(laugh)`, `(cough)`, `(clears throat)`, `(sigh)` 등의 괄호 표기를 사용하며, 중국어는 대괄호를 통해 웃음이나 한숨 같은 인간적인 요소를 음성에 삽입한다.

Artificial Analysis의 TTS 리더보드 측정 결과, Breeze TTS 2는 가중치 공개 모델 중 1위를 기록했다. 일부 폐쇄형 상용 시스템과 비교해도 경쟁력 있는 수치를 보였으나, 이는 특정 벤치마크 하네스 기반의 결과다.

implementation-impact

환경 구축은 GitHub 저장소 복제와 의존성 설치를 통해 수행한다.

bash
git clone https://github.com/breezeblue-ai/breeze-tts.git
cd breeze-tts
python -m pip install -r requirements.txt

CUDA 환경 최적화를 위해 제공되는 도커(Docker) 이미지를 빌드하여 사용할 수도 있다.

bash
bash docker/build.sh

추론 단계에서 보이스 클론과 보이스 디자인을 구현하는 코드는 다음과 같다. 보이스 클론은 참조 오디오와 텍스트를 함께 전달하며, 보이스 디자인은 지시어만으로 작동한다.

python

English Voice Clone 예시

python infer.py ../breeze-tts-2 \

--ref-audio reference_en.wav \

--ref-text "This is the exact transcript of the English reference audio." \

--text "(sigh) It is good to hear your voice again after all this time." \

--output outputs/voice_clone_en.wav

English Voice Design 예시

python infer.py ../breeze-tts-2 \

--text "Hello, I am a voice created from a description. I sound professional and calm." \

--cfg-scale 4 \

--output outputs/voice_design_en.wav

실무 수준의 대화형 AI를 설계하는 엔지니어는 TTFA 40ms라는 지연 시간과 보컬 이벤트 기능을 결합해 게임 NPC의 실시간 대화나 개인화된 가상 비서의 응답성을 검토해야 한다. 특히 `--fast-all` 옵션 사용 시 GPU 메모리 요구량이 14.4 GiB로 상승하므로, 배포 환경의 VRAM 용량에 따라 최적화 옵션 적용 여부를 결정해야 한다.