Mage-Flow:微软原生分辨率文生图与编辑模型
微软亚洲研究院发布 Mage-Flow -- 紧凑型 4B 参数生成模型,支持文生图和图像编辑,原生分辨率 512-2048,提供 RL 对齐和 4 步 Turbo 变体,MIT 许可证。
微软亚洲研究院发布了 Mage-Flow,一个紧凑的 4B 参数生成堆栈,用于高效的文生图和基于指令的图像编辑。与扩展到数百亿参数的模型不同,Mage-Flow 通过精心的分词器-主干网络-系统协同设计达到了与最先进模型相竞争的质量,同时保持了快速、低内存占用且易于在现实计算预算下进行微调的优势。
- 模型:microsoft/Mage-Flow 在 Hugging Face 上
- 论文:arXiv 2607.19064
- 代码:github.com/microsoft/Mage
- 许可证:MIT
它能做什么
Mage-Flow 由两个共享且协同设计的组件构成:
- Mage-VAE — 一个轻量级、高保真度潜空间分词器(带锚点潜空间 KL 正则化的单步扩散编码/解码)。在重建保真度上与 FLUX.2-VAE 相当,同时每个像素的编码/解码 MAC 分别减少约 12 倍 / 22 倍。
- NR-MMDiT — 一个共享的 4B 原生分辨率多模态扩散 Transformer,在 Mage-VAE 潜空间中使用整流流匹配,并以 Qwen3-VL 作为文本编码器。
这两者共同驱动了两个模型实例 — Mage-Flow(文生图)和 Mage-Flow-Edit(基于指令的图像编辑)— 每个都提供 Base、RL 对齐 和 4 步 Turbo 变体。
主要特性
- 紧凑却具备竞争力 — 单个 4B 参数系列可匹配或超越更大的开源系统(Qwen-Image 20B、Z-Image 6B、FLUX.2 32B、FireRed-Image-Edit 20B)
- 原生分辨率 — 单个检查点即可在 512 到 2048 之间的任意宽高比上生成,包括极端的 4:1(例如 512x2048、2048x512)
- 系统级速度 — 原生分辨率打包 + 融合 CUDA 内核将 MFU 从约 33% 提升至约 77%(训练速度提升约 2.5 倍);CFG 的条件/非条件分支在一次打包前向中完成
- 完整模型系列 — Hugging Face 上提供 6 个检查点,涵盖生成和编辑的 Base、RL 对齐和 Turbo 级别
- 交互级延迟 — 在单张 A100 上以 1024x1024 分辨率:Mage-Flow-Turbo 0.59 秒/图,Mage-Flow-Edit-Turbo 1.02 秒/编辑,峰值内存约 18-20 GB
- 多功能编辑 — 支持语义内容编辑、外观变换、图像修复和结构感知输出,全部在统一流程中完成
模型目录
所有检查点均为 Hugging Face 上的独立 diffusers 风格仓库:
| 模型 | 任务 | 变体 | 步数 | 链接 |
|---|---|---|---|---|
| Mage-Flow-4B-Base | 文生图 | Base | 30 | 🤗 Hugging Face |
| Mage-Flow-4B | 文生图 | RL 对齐 | 20 | 🤗 Hugging Face |
| Mage-Flow-4B-Turbo | 文生图 | 少步蒸馏 | 4 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B-Base | 编辑 | Base | 30 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B | 编辑 | RL 对齐 | 30 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B-Turbo | 编辑 | 少步蒸馏 | 4 | 🤗 Hugging Face |
性能亮点
Mage-Flow 在 GenEval 上达到 0.90 — 在所有开源模型中最高,超越了 FLUX.2(0.87)、Qwen-Image(0.87)和 Z-Image(0.84)。在 DPG-Bench 上,Mage-Flow-Base 得分为 86.26,与更大的模型相比同样具有竞争力。
在图像编辑方面,Mage-Flow-Edit-Turbo 得分为 GEdit-EN 8.271 和 GEdit-CN 8.264,在多个基准测试中位列所有开源编辑模型的第一或第二名。
获取
所有 Mage-Flow 检查点均在 Hugging Face 上以 MIT 许可证 发布,可自由用于研究和商业用途。目前还没有原生的 ComfyUI 支持,需要使用官方 Python API、CLI 或 Gradio 应用。
更多详情、图库和基准测试请参见项目页面。
评论
使用 GitHub 登录后即可参与讨论。