Mage-Flow:微软原生分辨率文生图与编辑模型

news

微软亚洲研究院发布 Mage-Flow -- 紧凑型 4B 参数生成模型,支持文生图和图像编辑,原生分辨率 512-2048,提供 RL 对齐和 4 步 Turbo 变体,MIT 许可证。

Mage-Flow cover

微软亚洲研究院发布了 Mage-Flow,一个紧凑的 4B 参数生成堆栈,用于高效的文生图基于指令的图像编辑。与扩展到数百亿参数的模型不同,Mage-Flow 通过精心的分词器-主干网络-系统协同设计达到了与最先进模型相竞争的质量,同时保持了快速、低内存占用且易于在现实计算预算下进行微调的优势。

它能做什么

Mage-Flow 由两个共享且协同设计的组件构成:

  • Mage-VAE — 一个轻量级、高保真度潜空间分词器(带锚点潜空间 KL 正则化的单步扩散编码/解码)。在重建保真度上与 FLUX.2-VAE 相当,同时每个像素的编码/解码 MAC 分别减少约 12 倍 / 22 倍
  • NR-MMDiT — 一个共享的 4B 原生分辨率多模态扩散 Transformer,在 Mage-VAE 潜空间中使用整流流匹配,并以 Qwen3-VL 作为文本编码器。

这两者共同驱动了两个模型实例 — Mage-Flow(文生图)和 Mage-Flow-Edit(基于指令的图像编辑)— 每个都提供 BaseRL 对齐4 步 Turbo 变体。

主要特性

  • 紧凑却具备竞争力 — 单个 4B 参数系列可匹配或超越更大的开源系统(Qwen-Image 20B、Z-Image 6B、FLUX.2 32B、FireRed-Image-Edit 20B)
  • 原生分辨率 — 单个检查点即可在 512 到 2048 之间的任意宽高比上生成,包括极端的 4:1(例如 512x2048、2048x512)
  • 系统级速度 — 原生分辨率打包 + 融合 CUDA 内核将 MFU 从约 33% 提升至约 77%(训练速度提升约 2.5 倍);CFG 的条件/非条件分支在一次打包前向中完成
  • 完整模型系列 — Hugging Face 上提供 6 个检查点,涵盖生成和编辑的 Base、RL 对齐和 Turbo 级别
  • 交互级延迟 — 在单张 A100 上以 1024x1024 分辨率:Mage-Flow-Turbo 0.59 秒/图,Mage-Flow-Edit-Turbo 1.02 秒/编辑,峰值内存约 18-20 GB
  • 多功能编辑 — 支持语义内容编辑、外观变换、图像修复和结构感知输出,全部在统一流程中完成

模型目录

所有检查点均为 Hugging Face 上的独立 diffusers 风格仓库:

模型任务变体步数链接
Mage-Flow-4B-Base文生图Base30🤗 Hugging Face
Mage-Flow-4B文生图RL 对齐20🤗 Hugging Face
Mage-Flow-4B-Turbo文生图少步蒸馏4🤗 Hugging Face
Mage-Flow-Edit-4B-Base编辑Base30🤗 Hugging Face
Mage-Flow-Edit-4B编辑RL 对齐30🤗 Hugging Face
Mage-Flow-Edit-4B-Turbo编辑少步蒸馏4🤗 Hugging Face

性能亮点

Mage-Flow 在 GenEval 上达到 0.90 — 在所有开源模型中最高,超越了 FLUX.2(0.87)、Qwen-Image(0.87)和 Z-Image(0.84)。在 DPG-Bench 上,Mage-Flow-Base 得分为 86.26,与更大的模型相比同样具有竞争力。

在图像编辑方面,Mage-Flow-Edit-Turbo 得分为 GEdit-EN 8.271GEdit-CN 8.264,在多个基准测试中位列所有开源编辑模型的第一或第二名。

获取

所有 Mage-Flow 检查点均在 Hugging Face 上以 MIT 许可证 发布,可自由用于研究和商业用途。目前还没有原生的 ComfyUI 支持,需要使用官方 Python API、CLI 或 Gradio 应用。

更多详情、图库和基准测试请参见项目页面

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Mage-Flow:微软原生分辨率文生图与编辑模型 | ComfyUI Wiki