Mage-Flow: modelo de resolución nativa 4B de Microsoft
Microsoft Asia lanza Mage-Flow -- compacto stack 4B para texto a imagen y edicion, resolucion nativa 512-2048, variantes RL y Turbo, licencia MIT.
Microsoft Asia ha lanzado Mage-Flow, un stack generativo compacto de 4B parámetros para generación eficiente de texto a imagen y edición de imágenes basada en instrucciones. En lugar de escalar a decenas de miles de millones de parámetros, Mage-Flow alcanza una calidad competitiva con el estado del arte mediante un cuidadoso codiseño tokenizador-backbone-sistema, manteniéndolo rápido, ligero en memoria y fácil de ajustar bajo presupuestos computacionales realistas.
- Modelo: microsoft/Mage-Flow en Hugging Face
- Artículo: arXiv 2607.19064
- Código: github.com/microsoft/Mage
- Licencia: MIT
Qué Hace
Mage-Flow está construido a partir de dos componentes compartidos y codiseñados:
- Mage-VAE — un tokenizador latente ligero y de alta fidelidad (codificación/decodificación de difusión en un paso con regularización KL de anclaje latente). Iguala la fidelidad de reconstrucción de FLUX.2-VAE usando ~12x / ~22x menos MACs de codificación/decodificación por píxel.
- NR-MMDiT — un Transformer de Difusión Multimodal de Resolución Nativa compartido de 4B con emparejamiento de flujo rectificado en el espacio latente de Mage-VAE, usando Qwen3-VL como codificador de texto.
Juntos impulsan dos instancias del modelo — Mage-Flow para texto a imagen y Mage-Flow-Edit para edición de imágenes basada en instrucciones — cada una disponible en variantes Base, Alineada por RL y Turbo de 4 pasos.
Características Clave
- Compacto pero competitivo — una única familia de 4B que iguala o supera sistemas abiertos mucho más grandes (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B)
- Resolución nativa — un único checkpoint genera de 512 a 2048 en cualquier relación de aspecto, incluyendo 4:1 extremas (ej. 512x2048, 2048x512)
- Velocidad a nivel de sistema — empaquetado de resolución nativa + kernels CUDA fusionados elevan el MFU de ~33% a ~77% (~2.5x entrenamiento más rápido); las ramas condicional e incondicional de CFG se ejecutan en un único pase empaquetado
- Familia completa de modelos — 6 checkpoints en Hugging Face que cubren generación y edición en niveles Base, Alineado por RL y Turbo
- Latencia interactiva — a 1024x1024 en una sola A100: Mage-Flow-Turbo 0.59 s/imagen, Mage-Flow-Edit-Turbo 1.02 s/edición, pico de memoria ~18-20 GB
- Edición versátil — soporta edición semántica de contenido, transformación de apariencia, restauración de imágenes y salidas conscientes de la estructura dentro de un pipeline unificado
Zoo de Modelos
Todos los checkpoints son repositorios autónomos estilo diffusers en Hugging Face:
| Modelo | Tarea | Variante | Pasos | Enlace |
|---|---|---|---|---|
| Mage-Flow-4B-Base | texto a imagen | Base | 30 | 🤗 Hugging Face |
| Mage-Flow-4B | texto a imagen | Alineado por RL | 20 | 🤗 Hugging Face |
| Mage-Flow-4B-Turbo | texto a imagen | Destilado pocos pasos | 4 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B-Base | edición | Base | 30 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B | edición | Alineado por RL | 30 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B-Turbo | edición | Destilado pocos pasos | 4 | 🤗 Hugging Face |
Destacados de Rendimiento
Mage-Flow logra GenEval 0.90 — el más alto entre todos los modelos de código abierto, superando a FLUX.2 (0.87), Qwen-Image (0.87) y Z-Image (0.84). En DPG-Bench, Mage-Flow-Base obtiene 86.26, siendo competitivo con modelos mucho más grandes.
Para edición de imágenes, Mage-Flow-Edit-Turbo puntúa GEdit-EN 8.271 y GEdit-CN 8.264, ubicándose primero o segundo entre todos los modelos de edición de código abierto en múltiples evaluaciones comparativas.
Disponibilidad
Todos los checkpoints de Mage-Flow se publican bajo la licencia MIT en Hugging Face, lo que los hace libremente disponibles para uso comercial y de investigación. Actualmente no existe soporte nativo para ComfyUI; se recomienda usar el pipeline oficial de Python o la interfaz Gradio.
Visita la página del proyecto para más detalles, galerías y evaluaciones comparativas.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.