기술 제원 및 공개 범위

HuggingFace를 통해 공개된 이번 모델의 파일 크기는 약 744MB 수준이다. bf16(Bfloat16, 딥러닝 학습 시 수치적 안정성을 높인 16비트 부동소수점 형식) 정밀도로 제공되며, 대규모 모델의 일부 가중치만 학습시켜 효율을 높이는 LoRA(Low-Rank Adaptation) 기법이 적용됐다.

bf16 정밀도 외에도 int8_convrot 버전, 그리고 불필요한 파라미터를 제거한 pruned 버전인 pruned_int8 및 pruned_fp8 모델에서도 모두 작동하는 호환성을 갖췄다. 이는 ComfyUI(노드 기반의 시각적 워크플로우 제어 인터페이스) 노드가 실행 시점에 pruned 베이스 모델을 자동으로 감지하고, 시간 조건화 데이터를 다시 주입하는 방식을 사용하기 때문이다.

작동 구조 및 워크플로우 변화

기존 20단계에 달하던 샘플링 과정을 4단계로 압축한 것이 핵심이다. 이를 통해 실제 연산 시간 기준 약 5배의 속도 향상을 구현했으며, 텍스트-비디오(t2v)와 이미지-비디오(i2v) 방식 모두에서 고품질 비디오와 동기화된 스테레오 오디오를 동시에 출력한다.

ComfyUI 노드가 실행 시점에 pruned 베이스 모델을 감지해 시간 조건화 데이터를 주입하는 파이프라인을 사용한다. 설치를 위해서는 아래 명령어를 통해 커스텀 노드를 설치해야 한다.

bash
git clone https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo

설치 후 `.safetensors` 파일을 `ComfyUI/models/loras/` 경로에 배치하면 사용할 수 있다. 워크플로우 구성 시 모델 로더와 샘플러 사이에 MiniMax-H3 Turbo LoRA 노드를 삽입하고, 샘플러를 `MiniMax-H3 Turbo Sampler (4-step)`로 교체해야 한다. 스케줄러 설정은 `simple`로, 단계 수는 `4`로 지정한다. 일반 샘플러를 사용할 경우 비디오와 오디오의 흐름 스케줄이 일치하지 않아 오디오가 깨지는 현상이 발생하므로 전용 샘플러 사용이 필수적이다.

가중치 최적화 및 실무 적용

실무 적용 시 가장 권장되는 가중치는 EMA(Exponential Moving Average, 가중치 이동 평균을 통한 학습 안정화 방식)가 적용된 `ckpt850` 버전이다. 이전 체크포인트들이 6~8단계의 샘플링을 필요로 했던 것과 달리, 이 버전은 4단계만으로 충분한 선명도를 확보한다. 다만 프리뷰 단계의 제약으로 피부 질감이 플라스틱처럼 보이거나, 과도하게 날카로운 그레인 및 노이즈가 발생하는 아티팩트 현상이 보고되고 있다.

가중치 파일별 특성을 살펴보면, `ckpt850 non-EMA` 버전은 EMA 버전보다 결과물이 날카로우나 과하게 보정된 느낌이 강해 주로 분석 및 비교 용도로 쓰인다. `ckpt500` 버전은 상대적으로 부드러운 표현력을 가지며, 초기 릴리스인 200단계 체크포인트보다 개선된 성능을 보인다.

LoRA 강도 설정은 결과물의 품질을 결정하는 주요 변수다. 기본값은 1.0이며, 결과물에 흐릿한 고스팅 현상이나 번짐이 나타나면 강도를 1.05에서 1.2 사이로 높여야 한다. 반대로 과도한 선명도로 인해 노이즈가 심해진다면 0.8에서 0.95 사이로 낮추는 것이 효과적이다.

개발자는 영상 제작 파이프라인의 프로토타이핑 속도를 높이기 위해 `ckpt850 EMA` 가중치를 우선 도입하되, 출력물의 노이즈 수준에 따라 LoRA 강도를 0.8~1.2 범위 내에서 조정하며 하드웨어 환경에 맞는 최적의 균형점을 찾아야 한다.