ComfyUI v0.38.0: Ming-Image, ID-V2V 지원 및 빨라진 SeedVR2
ComfyUI v0.38.0은 공식 템플릿과 함께 네이티브 Ming-Image 지원을 추가하고, Wan ID-V2V, w6a8 양자화, HDR LogC3 및 ACEScct 색상 공간을 도입했으며, SeedVR2와 YuE2의 속도를 개선했습니다.
공식 Ming-Image 0.1 Design 템플릿으로 생성된 디자인 구성으로, 투명도를 포함한 RGBA 출력을 작성합니다(workflow_templates 저장소의 에셋).
코어에 통합된 Ming-Image
Ming-Image 0.1 Design이 이제 네이티브로 실행됩니다. 코어 지원은 Comfy-Org/ComfyUI#16482에서 추가되었고, #16514에서 후속 감지 수정이 이루어졌습니다. 이는 동일한 변경 사항이 v0.37.3 패치에 포함되었다가 v0.37.4에서 다시 되돌려진 이후의 일입니다. 안정 브랜치에서 모델이 나타났다가 사라졌다면, v0.38.0에서는 계속 유지됩니다.
이 포팅은 전용 조건화 노드인 Text Encode Ming Image Edit(TextEncodeMingImageEdit, 카테고리 model/conditioning/ming image)를 추가합니다. 이 노드는 프롬프트를 최대 8개의 참조 이미지(image_1부터 image_8까지)와 함께 Ming 텍스트 인코더로 토큰화하며, VAE 입력은 선택 사항입니다. VAE 입력이 없으면 이미지는 비전 타워를 통해서만 조건화되고, 있으면 각 참조가 깨끗한 프레임으로 잠재 데이터 시퀀스에 추가됩니다. 나중 참조는 첫 번째 참조 크기로 조정되며, 샘플링된 잠재 데이터는 그 첫 번째 이미지의 크기와 일치해야 합니다.
모델 측면에서 Ming-Image는 자체 MingImage 잠재 데이터 형식을 사용하는 16채널 잠재 데이터 공간 위에 구축된 30레이어 DiT이며, 1024 버킷에서 3.16 시프트로 실행됩니다. 텍스트 인코더는 번들로 제공되는 Ling-Mini-2.0 언어 모델로, 전문가 256개를 갖춘 20레이어 MoE이며, 참조 이미지용 Qwen 스타일 비전 타워와 짝을 이룹니다. 두 체크포인트가 동일한 노드 그래프에서 작동합니다. Design 모델과, 완료된 디자인을 편집 가능한 투명 레이어로 분해하는 Design Layer 형제 모델입니다.
리패킹된 가중치는 Comfy-Org/Ming-Image에 bf16 및 int8_convrot 변형으로 게시되어 있습니다:
📂 ComfyUI/
└── 📂 models/
├── 📂 diffusion_models/
│ ├── ming_image_0.1_design_bf16.safetensors
│ ├── ming_image_0.1_design_int8_convrot.safetensors
│ ├── ming_image_0.1_design_layer_bf16.safetensors
│ └── ming_image_0.1_design_layer_int8_convrot.safetensors
├── 📂 text_encoders/
│ ├── ming_image_0.1_ling_mini_2.0_bf16.safetensors
│ └── ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
└── 📂 vae/
└── ming_image_vae_bf16.safetensors공식 템플릿 image_ming_image_01_design_t2i는 프롬프트 강화 단계를 포함한 전체 파이프라인을 구성합니다. Qwen3.8-27B 텍스트 인코더(qwen3.8_27b_w4a8.safetensors로 제공)가 짧은 요청을 구조화된 Figma 스타일 JSON 디자인 브리프로 다시 작성하고, Ming 텍스트 인코더는 바로 그 브리프를 입력으로 받습니다. 샘플링은 1024x2048 잠재 데이터에서 ModelSamplingFlux를 사용한 Euler 12스텝입니다.
Qwen-Image 2.1 및 컨트롤넷 업데이트
Qwen-Image 2.1 관련 작업은 계속 이어지고 있습니다:
- Union Fun ControlNet이 이제 지원됩니다 (#16519). 개별 Fun ControlNet 유형을 하나로 아우르는 단일 ControlNet인 alibaba-pai/Qwen-Image-2.1-Fun-Controlnet-Union을 위한 것입니다. #16471의 H3 Fun-ControlNet-Union 2.0 지원도 이번 릴리스에 포함되었습니다.
- Tiny VAE 지원 (#16552)은 madebyollin의 taesd에서 가져온
taeqi2_1_decoder와taeqi2_1_encoder를 추가하여, Qwen-Image 2.1에서 빠른 잠재 데이터 미리보기와 저비용 TAESD 왕복 변환이 가능해집니다. 파일은models/vae_approx/에 넣으면 됩니다. 이들은 64개 잠재 채널과 4채널 RGBA 이미지 면을 가진 16x 모델이며, 구형 TAESD 변형이 사용하던 스칼라 방식 대신 채널별 스케일과 시프트를 사용합니다. - Prefix KV 캐시 배치 (#16429)는 이제 모델 patcher의 가용 메모리 계산을 통해 결정되므로, 전체 재계산으로 되돌아가는 대신 동적 VRAM 및 스마트 메모리 환경에서 캐시가 VRAM에 남아 있을 수 있습니다. Transformer 블록 컴파일 (#16430)은 메모리 컴파일러 지원을 추가하며, 이는 주로 오프로드 대역폭이 병목일 때 도움이 됩니다.
- fp16 활성화 클램프 (#16608)는 메모리 컴파일러를 망가뜨리던 인플레이스 할당 문제를 수정했으며, Qwen VL 이미지 전처리는 더 이상 4채널 RGBA 입력에서 충돌하지 않습니다 (#16548).
Wan ID-V2V 등장
ID-V2V 지원 PR인 Comfy-Org/ComfyUI#15139가 2026-09-27에 마침내 병합되어 이번 버전에 포함되었습니다. ID-V2V는 정체성을 유지하면서 비디오 스타일을 바꾸며, VACE 제어를 갖춘 Wan 2.1 이미지 기반 비디오 생성 베이스 위에 구축되었습니다. 이는 이전에는 ComfyUI가 로드할 수 없었던 조합입니다.
이를 가능하게 만든 두 가지 변경 사항이 있습니다. VACE 모델이 I2V 베이스의 img_emb 프로젝션을 포함할 때 모델 감지가 해당 아키텍처를 인식하며, Image to Video가 이제 선택적 ref_pad_image 입력을 받습니다. 이 입력은 이미지 조건화의 패딩 프레임을 단순 회색 대신 참조 이미지로 채우는데, 이것이 바로 모델이 학습된 드리프트 방지 패딩입니다. ref_pad_image는 선택 사항이므로 기존 I2V 워크플로는 영향을 받지 않습니다.
테스트 가중치는 Hugging Face에 남아 있습니다. Kijai/Wan_ID_V2V_comfy에서 wan_2.1_idv2v_int8_convrot.safetensors와 일반 깊이 제어를 지원하는 변형을 공개했으며, PR에는 바로 사용할 수 있는 워크플로 JSON이 포함되어 있습니다.
양자화: w6a8
ComfyUI는 이제 w6a8 체크포인트(#16483, comfy-kitchen에 구현됨)를 로드할 수 있습니다. 6비트 가중치에 8비트 활성화를 사용하므로, int8 및 fp8 리팩보다 파일 크기가 더 작습니다. pruned H3 가중치는 이미 새로운 형식으로 Comfy-Org/MiniMax-H3에 minimax_h3_fl2va_pruned_w6a8.safetensors 및 minimax_h3_ref2va_pruned_w6a8.safetensors로 게시되어 있으며, 기존 bf16, fp8_scaled, int8_convrot 파일 옆에서 받을 수 있습니다.
더 빨라진 SeedVR2와 YuE2
SeedVR2(#16530)는 업스케일러 VAE를 대대적으로 재작성한 버전입니다. 모델이 허용하는 경우, VAE는 이제 비디오를 한 번에 한 프레임씩 처리하고, causal convolution 캐시를 고정된 호스트 메모리에 int8로 양자화한 상태로 유지하며, 필요할 때 다시 프리페치합니다. 따라서 VRAM 사용량은 전체 클립이 아니라 단일 프레임의 작업 세트에 의해 결정되며, 이는 길거나 고해상도 비디오에서 중요합니다. 이 기능을 사용하려면 동일 릴리스에 포함된 comfy-kitchen 커널이 필요합니다.
공식 SeedVR2 이미지 확대 템플릿의 출력 (에셋은 workflow_templates 저장소에서 제공).
두 가지 오디오 경로도 더 빨라졌습니다:
- YuE2(#16626)는 이제 GPU에서 CPU로 되돌리는 토큰 전송을 일괄 처리하고, 샘플러를 CUDA graphs로 실행합니다.
- ACE-Step 1.5(#16461)는 오토리그레시브 모델에 CUDA graphs와 메모리 컴파일러를 적용했습니다.
MiniMax H3 관련 수정 두 가지도 함께 포함되었습니다. VAE가 이제 타일드 디코드 결과를 이미 합성된 이웃과 블렌딩하며(#16436), qk_norm_scale이 오프로드될 때 H3 VAE를 크래시시키던 정렬 버그가 수정되었습니다(#16485). **Upscale Image (Using Model)**는 더 이상 RGBA 이미지에서 크래시하지 않습니다(#16500).
HDR 색 공간
이미지 색 공간 변환(ImageColorSpace)에 두 가지 로그 인코딩이 추가되었습니다(#16541): HDR LogC3(Rec.709 원색을 사용하는 EI 800 곡선)와 HDR ACEScct(AP1 원색과 D60 흰색을 사용하며, 브래드퍼드 색순응으로 D65에 적응)입니다. 기존의 sRGB, 선형 Rec.709, HDR HLG, HDR PQ 대상과 결합하면 이제 워크플로가 VFX나 EXR 파이프라인에서 기대하는 색 공간 사이를 이동할 수 있습니다. 후속 수정(#16565)에서는 HDR 출력 경로의 음수 값을 처리합니다.
메모리, 어텐션 및 로더
- 이제 모델 파일이 각 블록이 어떤 어텐션 구현을 사용할지 선언할 수 있으며(#16419), 이를 통해 리팩(repack)이 하나의 모델 안에서 어텐션 백엔드를 혼합할 수 있습니다.
- comfy_attention 및
AttentionTensorContainer지원이 Lumina 패밀리(#16515)와 몇 가지 모델 패밀리(#16595)로 확장되었고, 더 낮은 메모리 사용량으로 FLUX 패밀리(#16488)도 지원합니다. - v0.37.0에서 동적 로딩을 위해 추가된 빠른 디스크 감지가 이제 모든 모델 로더를 대상으로 하며(#16425), AMD RDNA2 및 이전 아키텍처가 아키텍처 목록에 추가되었습니다(#16537).
- Ascend NPU 장치는 비동기 가중치 오프로드 스트림을 지원합니다(#16057).
- 에셋 시스템에는 안정성 강화와 성능 개선 작업이 이루어졌습니다. SQLite 쓰기 잠금을 미리 획득하고 파일 읽기를 쓰기 트랜잭션 밖으로 이동시켰으며(#16480, #16486), 출력 재검사는 모든 파일을 확인하는 대신 폴더를 나열하고 루프를 일시 중지하여 UI가 응답성을 유지하도록 하며(#16543, #16546), 에셋 패키지가 누락된 경우에도 ComfyUI가 시작되어
--enable-assets에 무엇이 필요한지 보고합니다(#16580).
기타 변경 사항
- Text Generate는 선택적
system_prompt입력을 받고 thinking 블록을 별도 출력으로 반환합니다 (#16442). - 업스트림이 안정적인 cu132 빌드 제공을 중단함에 따라 torchaudio 의존성이 제거되었습니다 (#16457).
- #16471의 MiniMax H3 Fun-ControlNet-Union 2.0 지원이 포함되었으며, SheetSage2 ABC 생성이 업스트림 YuE 코드와 일치하도록 정렬되었습니다 (#16569).
- 파트너 노드: Hunyuan Image 3.5 텍스트 기반 이미지 생성 및 편집(Tencent, #16462), SVG 노드에서 reasoning effort를 지원하는 Arrow 2(Quiver, #16478), Claude Opus 5.5(#16479), Recraft V4.1 Flash(#16501), GPT-6 Sol and Luna(OpenAI, #16520), Seedream 5.0 Flash(#16522) 및 Seedance 2.5 Draft 모드(#16529). 지원 중단된 Sora 노드는 제거되었습니다 (#16609). 이러한 파트너 추가 사항 중 일부는 이미 v0.37.x 패치 릴리스에 포함되어 있었습니다.
- 워크플로 템플릿은 v0.11.70, comfy-kitchen은 0.2.36, 내장 문서는 0.5.13입니다.
v0.38.0 받기
ComfyUI Manager 또는 런처를 통해 업데이트하세요. Qwen-Image 2.1 ControlNet과 tiny VAE 지원, 새로운 색상 공간, ID-V2V는 모두 v0.38.0 이상이 필요합니다. 패치 라인에서 주목할 대상은 Ming-Image입니다. 관련 노드가 v0.37.3에 포함되었다가 v0.37.4에서 다시 되돌려졌기 때문에, 지원이 유지되는 버전은 v0.38.0입니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.