ComfyUI v0.38.0:原生 Ming-Image、ID-V2V 与更快的 SeedVR2

ComfyUI Wikinews

ComfyUI v0.38.0 新增原生 Ming-Image 支持并提供官方模板,上线 Wan ID-V2V、w6a8 量化、HDR LogC3 与 ACEScct 色彩空间,并提升了 SeedVR2 与 YuE2 的速度。

ComfyUI v0.38.0 已发布。本次更新将 Ming-Image 引入核心并附带官方模板,落地了长期待支持的 Wan ID-V2V,新增 w6a8 量化、HDR LogC3 与 HDR ACEScct 颜色空间,并通过逐帧解码视频大幅降低 SeedVR2 的内存占用。
来自官方 ComfyUI 模板的 Ming-Image 0.1 Design 输出

由官方 Ming-Image 0.1 Design 模板生成的设计构图,该模板可输出带透明通道的 RGBA 结果(素材来自 workflow_templates 仓库)。

Ming-Image 纳入核心支持

Ming-Image 0.1 Design 现在可以原生运行。核心支持通过 Comfy-Org/ComfyUI#16482 加入,并在 #16514 中追加了检测修复;此前同一改动曾随 v0.37.3 补丁发布,随后又在 v0.37.4 中被回退。如果你在稳定分支上遇到模型先出现又消失的情况,v0.38.0 就是它稳定驻留的版本。

本次移植新增了一个专用条件节点 Text Encode Ming Image Edit(TextEncodeMingImageEdit,类别 model/conditioning/ming image)。它会把提示词连同最多八张引用图像(image_1 至 image_8)一起分词并送入 Ming 文本编码器;VAE 输入是可选的:不接 VAE 时,图像仅通过视觉塔提供条件,接入后每张引用图都会作为干净帧追加到 Latent 序列中。后续引用图会被缩放到第一张图的尺寸,采样得到的 Latent 也应与第一张图的尺寸一致。

在模型方面,Ming-Image 是一个在 16 通道 Latent 空间上运行的 30 层 DiT,拥有自己的 MingImage Latent 格式,并在 1024 档位上以 3.16 的 shift 运行。文本编码器是内置的 Ling-Mini-2.0 语言模型,一个拥有 256 个专家的 20 层 MoE,并搭配 Qwen 风格的视觉塔来处理引用图像。有两个模型可共用同一套节点图:Design 模型,以及可将已完成设计分解为可编辑透明图层的 Design Layer 版本。

重新打包的权重以 bf16 和 int8_convrot 两种变体发布在 Comfy-Org/Ming-Image:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── ming_image_0.1_design_bf16.safetensors
    │   ├── ming_image_0.1_design_int8_convrot.safetensors
    │   ├── ming_image_0.1_design_layer_bf16.safetensors
    │   └── ming_image_0.1_design_layer_int8_convrot.safetensors
    ├── 📂 text_encoders/
    │   ├── ming_image_0.1_ling_mini_2.0_bf16.safetensors
    │   └── ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
    └── 📂 vae/
        └── ming_image_vae_bf16.safetensors

官方模板 image_ming_image_01_design_t2i 串联起整条流水线,其中还包含一个提示词增强阶段:由 Qwen3.8-27B 文本编码器(以 qwen3.8_27b_w4a8.safetensors 形式提供)把简短的请求改写成结构化的 Figma 风格 JSON 设计说明,而 Ming 文本编码器接收的正是这份说明。采样采用 12 步 Euler,使用 ModelSamplingFlux,Latent 尺寸为 1024x2048。

Qwen-Image 2.1 与 ControlNet 更新

Qwen-Image 2.1 这条路线一直在持续推进:

  • Union Fun ControlNet 现已获得支持(#16519),对应 alibaba-pai/Qwen-Image-2.1-Fun-Controlnet-Union,这是单个 ControlNet 即可覆盖各类独立 Fun ControlNet 类型的模型。来自 #16471 的配套 H3 Fun-ControlNet-Union 2.0 支持也已包含在本版本中。
  • Tiny VAE 支持(#16552)新增了来自 madebyollin 的 taesd 的 taeqi2_1_decoder 与 taeqi2_1_encoder,因此 Qwen-Image 2.1 可以获得快速的 Latent 预览以及低成本的 TAESD 往返。将文件放入 models/vae_approx/ 即可。这些是 16x 模型,具有 64 个 Latent 通道和 4 通道 RGBA 图像侧,采用逐通道的缩放与偏移,而非旧版 TAESD 变体使用的标量方式。
  • Prefix KV 缓存放置(#16429)现在由模型 patcher 的可用内存核算来决定,因此在动态 VRAM 和智能内存下,缓存可以保留在 VRAM 中,而不必退回到完整的重新计算。Transformer 块编译(#16430)新增了内存编译器支持,这在卸载带宽成为瓶颈时尤其有帮助。
  • 一个 fp16 激活钳制(#16608)修复了会破坏内存编译器的原地分配问题,同时 Qwen VL 图像预处理不再因 4 通道 RGBA 输入而崩溃(#16548)。

Wan ID-V2V 正式上线:ComfyUI 现已支持身份保持视频重绘

ID-V2V 支持 PR Comfy-Org/ComfyUI#15139 于 2026-09-27 终于合并,并随本次版本一同发布。ID-V2V 能在保留人物身份的同时重塑视频风格,它基于 Wan 2.1 图生视频基础模型搭配 VACE 控制构建。这一组合此前 ComfyUI 无法加载。

两处改动让它得以运行。当 VACE 模型带有 I2V 基础模型的 img_emb 投影时,模型检测会识别出该架构;同时 Image to Video 现在接受一个可选的 ref_pad_image 输入。该输入会用引用图像填充图像条件的填充帧,而不是使用纯灰色,这正是模型训练时采用的抗漂移填充方式。ref_pad_image 是可选的,因此现有的 I2V 工作流不受影响。

测试权重仍托管在 Hugging Face 上:Kijai/Wan_ID_V2V_comfy 发布了 wan_2.1_idv2v_int8_convrot.safetensors 以及带正常深度控制的变体,该 PR 还附带一个可直接使用的工作流 JSON。

量化:w6a8

ComfyUI 现在可以加载 w6a8 模型(#16483,由 comfy-kitchen 实现):6 位权重搭配 8 位激活,因此文件比 int8 和 fp8 重打包版本都更小。剪枝后的 H3 权重已经以新格式发布在 Comfy-Org/MiniMax-H3 上,文件名为 minimax_h3_fl2va_pruned_w6a8.safetensors 和 minimax_h3_ref2va_pruned_w6a8.safetensors,与现有的 bf16、fp8_scaled 和 int8_convrot 文件放在一起。

更快的 SeedVR2 与 YuE2

SeedVR2(#16530)是对该放大模型 VAE 的一次大规模重写。在模型允许的情况下,VAE 现在会逐帧处理视频,将其因果卷积缓存以 int8 量化形式保存在锁页主机内存中,并按需预取回来。因此显存占用由单帧的工作集决定,而不再是整个片段,这对长视频或高分辨率视频尤为重要。它需要同一版本中的 comfy-kitchen 内核。

来自官方模板的 SeedVR2 放大输出

官方 SeedVR2 图像放大模板的输出(素材来自 workflow_templates 仓库)。

两条音频路径也得到了提速:

  • YuE2(#16626)现在会批量处理从 GPU 传回 CPU 的 token 传输,并在 CUDA graphs 下运行其采样器。
  • ACE-Step 1.5(#16461)为其自回归模型引入了 CUDA graphs 和内存编译器。

另外还附带两个 MiniMax H3 修复:VAE 现在会将分块解码的结果与已经合成的相邻块进行混合(#16436);以及一个在 qk_norm_scale 被卸载时导致 H3 VAE 崩溃的对齐 bug 已修复(#16485)。Upscale Image (Using Model) 不再对 RGBA 图像崩溃(#16500)。

HDR 色彩空间

转换图像色彩空间(ImageColorSpace)新增了两种对数编码(#16541):HDR LogC3(采用 Rec.709 原色的 EI 800 曲线)和 HDR ACEScct(AP1 原色与 D60 白点,通过 Bradford 色适应转换到 D65)。结合原有的 sRGB、线性 Rec.709、HDR HLG 和 HDR PQ 目标,工作流现在可以在 VFX 或 EXR 流程所期望的色彩空间之间转换。后续的修复(#16565)处理了 HDR 输出路径中的负值。

内存、注意力与加载器

  • 模型文件现在可以声明每个 block 应使用哪种注意力实现(#16419),这让一个 repack 可以在同一个模型内混合使用不同的注意力后端。
  • comfy_attention 与 AttentionTensorContainer 的支持范围扩展到 Lumina 系列(#16515)、另外几个模型系列(#16595),并以更低的内存占用支持 Flux 系列(#16488)。
  • v0.37.0 中为动态加载引入的快速磁盘检测现在覆盖所有模型加载器(#16425),并且 AMD RDNA2 及更早架构已加入架构列表(#16537)。
  • Ascend NPU 设备获得异步权重卸载流(#16057)。
  • 资产系统进行了一轮加固与性能优化:SQLite 写锁提前获取,文件读取移出写事务(#16480、#16486);输出重新扫描改为列出文件夹,而不是逐个检查每个文件,并会暂停其循环以保持 UI 响应(#16543、#16546);即使资产包缺失,ComfyUI 也能启动,并报告 --enable-assets 需要哪些内容(#16580)。

其他变更

  • Text Generate 现在接受可选的 system_prompt 输入,并将思考块单独作为其输出返回(#16442)。
  • torchaudio 依赖已被移除,因为上游已停止发布稳定的 cu132 构建(#16457)。
  • 已包含来自 #16471 的 MiniMax H3 Fun-ControlNet-Union 2.0 支持,且 SheetSage2 的 ABC 创建已与上游 YuE 代码保持一致(#16569)。
  • 合作节点:混元图像 3.5 文生图与编辑(腾讯,#16462)、在 SVG 节点中支持推理强度调节的 Arrow 2(Quiver,#16478)、Claude Opus 5.5(#16479)、Recraft V4.1 Flash(#16501)、GPT-6 Sol 与 Luna(OpenAI,#16520)、Seedream 5.0 Flash(#16522)以及 Seedance 2.5 Draft 模式(#16529)。已弃用的 Sora 节点已被移除(#16609)。其中部分合作节点新增内容已在 v0.37.x 补丁版本中发布。
  • 工作流模板 已更新至 v0.11.70,comfy-kitchen 为 0.2.36,嵌入式文档 为 0.5.13。

获取 v0.38.0

通过 ComfyUI Manager 或你的启动器进行更新。Qwen-Image 2.1 ControlNet 与 tiny VAE 支持、新的颜色空间以及 ID-V2V 都需要 v0.38.0 或更高版本。在补丁版本线上值得关注的是 Ming-Image:相关节点曾在 v0.37.3 中出现,又在 v0.37.4 中被回退,因此 v0.38.0 才是该支持得以保留的版本。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…