Qwen-Image-2.1-Turbo:ComfyUI 中的官方 8 步 Turbo 模型

ComfyUI Wikinews

阿里巴巴官方的 Qwen-Image-2.1-Turbo checkpoint 以 8 步去噪、CFG 1 运行 7B 生成与编辑模型,Comfy-Org 已为 ComfyUI 重新打包权重。

Qwen-Image-2.1-Turbo 是阿里巴巴于 2026 年 10 月 9 日发布的 Qwen-Image 2.1 官方加速 checkpoint。它保留相同的 7B 视觉生成模型和相同的编辑 pipeline,但文生图生成与多参考编辑只需 8 步去噪、CFG 1,而基础模型需要 40 步。
一位舞者在旋转中定格的瞬间,由 Qwen-Image-2.1-Turbo 以 8 步生成

人体姿态与运动,是阿里巴巴官方 Turbo 展示中的 8 步分类之一。

Turbo checkpoint 改变了什么

Turbo 并不是新架构。它是 Qwen-Image 2.1 的第二个 checkpoint,把采样调度直接内置其中,因此同一套 transformer 权重依旧可用于生成、指令编辑、RGBA 透明度和主体提取。接线时真正需要注意的差异如下:

  • 8 步去噪,而非 40 步。 推荐的 8 步调度随 checkpoint 一同提供。模型卡片明确指出,单独传入 num_inference_steps 并不会覆盖它,而且其他调度并未针对该 checkpoint 进行评估。
  • 默认 CFG 1。 无分类器引导处于关闭状态,因此每一步只执行一次前向传播。
  • 前缀 KV 缓存会在各去噪步骤之间复用文本与参考图像上下文,pipeline 通过 use_kv_cache=True 启用。
  • 与基础模型相同的分辨率预设,从 2048x2048(1:1)一直到 2752x1536(16:9)以及对应的竖版比例。
  • 目前基于 diffusers。 它通过 QwenImage21Pipeline 加载,需要支持由 pipeline 配置采样 Sigmas 的 diffusers 版本。

所保存的调度为 1.0, 0.978453, 0.95418, 0.926626, 0.89508, 0.845148, 0.704534, 0.414568,以一个空的 0 步结尾。在 Banodoco 的 #qwen-image 通道中,Kijai 指出它接近 ComfyUI 的 linear_quadratic 采样器且未施加 shift,并且总体而言他还没见过固定 Euler 调度在 turbo checkpoint 上胜过随机采样器。

展示

模型卡片按其 8 步输出所对应的实际需求进行分组。人像摄影与海报排版与编辑用例出自同一个 checkpoint:

Qwen-Image-2.1-Turbo 的人像样例

一张人像,以 8 步、1680x2512 生成。

带有渲染文字的海报版式

排版与海报设计,这个类别过去需要完整的 40 步采样。

界面与信息版式样例

UI 与信息版式,属于较难的结构化输出用例之一。

透明度在加速后依然保留:alpha 通道由模型写入,因此贴纸和产品资产输出后仍然可以直接合成。

带真实 alpha 通道的 RGBA 输出

使用 Turbo checkpoint 生成透明图像。

编辑的工作方式与基础模型相同,包括单图变换:

输入人物输出人物
输入参考8 步编辑输出(2048x2048)

ComfyUI 可用性

Comfy-Org/Qwen-Image-2.1 在发布后数小时内就加入了 Turbo,形式与基础模型相同,共三种:

  • diffusion_models/qwen_image_2.1_turbo_bf16.safetensors,BF16 格式的完整 8 步 checkpoint。
  • diffusion_models/qwen_image_2.1_turbo_int8_convrot.safetensors,用于降低显存占用的 INT8 convrot 量化版本。
  • loras/qwen_image_2.1_turbo_lora_avg_rank_178_bf16.safetensors,从同一次蒸馏中提取的 LoRA,你可以把它加载在基础 transformer 之上,而无需替换 checkpoint。

文本编码器和 VAE 与 Qwen-Image 2.1 共用,因此已经在运行基础模型的配置只需要新的 transformer 或 LoRA。Turbo 权重可直接放入现有的官方 Qwen-Image 2.1 工作流:将采样器设为 8 步、CFG 1,然后选择 turbo diffusion model,或者选择基础模型加 turbo LoRA。

初期反响

该版本当天就出现在 #qwen-image 中并被即时测试。RuneX 表示“官方 turbo 效果非常好”,并且在相同提示词下明显优于至少一个第三方 Turbo LoRA。Corza 将随附的 Sigmas 与自定义 Euler 调度进行对比,发现差异很小,主要是在叠加 LoRA 或 LoKR 时会有一些额外的锐化和皮肤细节,这与基础模型上叠加适配器时出现的过平滑问题相同。Kijai 对某个声称 turbo 效果更好的社区节点不以为意,指出在 flow-matching 模型上 ComfyUI 的 Euler 采样器本身就已经是 flow-match Euler,因此这类节点主要只是改变 Sigmas。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Qwen-Image-2.1-Turbo:ComfyUI 中的官方 8 步 Turbo 模型 | ComfyUI Wiki