에 ComfyUI 전용 Qwen3-VL-32B Ultra

32GB VRAM이라는 하드웨어 제약을 충족하는 환경에서 32B 규모의 시각-언어 모델(VLM)을 이미지 생성 도구의 입력 변환기로 활용하는 길이 열렸다. HuggingFace에 공개된 Qwen3-VL-32B Ultra Uncensored Heretic 체크포인트가 ComfyUI(노드 기반 이미지 생성 인터페이스) 전용 컨디셔닝 인코더 형태로 제공되기 때문이다. 컨디셔닝 인코더는 생성 모델이 출력할 결과물의 방향을 잡아주는 입력 변환기 역할을 수행하며, 이번 모델은 ComfyUI 환경에서 효율적으로 작동하도록 최적화되었다. 특히 검열이 제거된 Ultra Uncensored Heretic 버전을 기반으로 설계되어, 이미지 생성 과정에서 창작자가 겪는 제약을 최소화하고 표현의 자유도를 높였다.

실제 구동 검증은 NVIDIA GeForce RTX 5090의 32GB VRAM과 PyTorch 2.8.0+cu128 환경에서 이루어졌다. 런타임 안정성을 확보하기 위해 ComfyUI 커밋 14b05228cef127ce529bc0c08660770d4af3e9a8 버전과 comfy-kitchen 0.2.26, comfy-aimdo 0.4.11 의존성 패키지가 필수적으로 요구된다. 32B 파라미터 규모의 대형 모델을 이미지 생성 워크플로우에 결합하기 위해서는 이와 같은 고사양 GPU의 메모리 용량과 특정 소프트웨어 버전의 정밀한 일치가 전제되어야 한다.

버전은 24.55GiB로 용량을 줄여 VRAM 점유율을 낮춘

47.97GiB인 BF16 버전 대비 절반 수준인 24.55GiB까지 줄어든 용량은 VRAM 점유율을 낮추는 실질적인 대안이 된다. 8비트 정수형 양자화 및 가중치 압축 기술인 INT8 ConvRot를 적용해 350개의 학습된 행 단위 언어 행렬을 사용하며, ConvRot 그룹 크기는 256으로 설정했다. 성능 저하를 방지하기 위해 비전 타워와 정규화 층인 모든 노름(Norm)은 BF16 상태를 유지한다. 정밀도가 필수적인 영역은 보존하고 가중치 행렬을 압축해 메모리 점유율을 물리적으로 낮춘 구성이다.

모델을 실제로 구동하려면 안전한 텐서 저장 형식인 safetensors 파일을 지정된 경로에 배치해야 한다. 파일 저장 경로는 `ComfyUI/models/text_encoders/H3/`이며, 이 경로에 파일이 위치해야 시스템이 인식한다. 이후 ComfyUI(노드 기반 AI 이미지 생성 도구) 내의 CLIPLoader(CLIP 모델 로더)에서 H3 호환 텍스트 인코더 타입을 선택해 사용한다. 파일 경로 설정과 전용 인코더 타입 선택이라는 두 가지 설정 단계를 거쳐 최적화된 모델의 텍스트 인코딩 기능을 활성화할 수 있다.

확인해야 할 핵심 지점

47.97GiB에 달하는 파일 크기가 BF16(Bfloat16, 고정밀도 부동소수점 형식) 버전 체크포인트의 기본 사양이다. 이 파일은 총 902개의 텐서(다차원 배열 데이터)를 포함하며 Qwen3-VL의 임베딩과 언어 레이어 0번부터 49번, 그리고 전체 비전 타워를 모두 담은 풀 프리시전 소스로 구성된다. 고정밀도 부동소수점 형식을 사용해 모델이 가진 원래의 연산 정밀도를 최대한 유지하는 구조를 갖췄다.

7.09GiB 크기의 테일(Tail) 파일은 프롬프트 강화를 위해 별도로 제공되는 구성 요소다. 내부적으로는 언어 레이어 50번부터 63번까지의 데이터와 최종 언어 노름, LM 헤드(언어 모델 출력층)를 포함하고 있다. H3 Guide(프롬프트 정교화 도구) 노드를 통해 생성 전 단계에서 프롬프트를 정교하게 다듬는 용도로 활용하며, 생성 작업이 끝난 뒤에는 해당 테일을 메모리에서 즉시 해제해 자원 관리 효율을 높이는 방식이다.

보유한 VRAM 용량과 작업에 필요한 정밀도 요구 수준을 대조해 고정밀 BF16 버전과 효율 중심의 INT8 버전 중 하나를 선택하는 것이 최종 운용 기준이다.