Mage-Flow: modelo de resolución nativa 4B de Microsoft

news

Microsoft Asia lanza Mage-Flow -- compacto stack 4B para texto a imagen y edicion, resolucion nativa 512-2048, variantes RL y Turbo, licencia MIT.

Mage-Flow cover

Microsoft Asia ha lanzado Mage-Flow, un stack generativo compacto de 4B parámetros para generación eficiente de texto a imagen y edición de imágenes basada en instrucciones. En lugar de escalar a decenas de miles de millones de parámetros, Mage-Flow alcanza una calidad competitiva con el estado del arte mediante un cuidadoso codiseño tokenizador-backbone-sistema, manteniéndolo rápido, ligero en memoria y fácil de ajustar bajo presupuestos computacionales realistas.

Qué Hace

Mage-Flow está construido a partir de dos componentes compartidos y codiseñados:

  • Mage-VAE — un tokenizador latente ligero y de alta fidelidad (codificación/decodificación de difusión en un paso con regularización KL de anclaje latente). Iguala la fidelidad de reconstrucción de FLUX.2-VAE usando ~12x / ~22x menos MACs de codificación/decodificación por píxel.
  • NR-MMDiT — un Transformer de Difusión Multimodal de Resolución Nativa compartido de 4B con emparejamiento de flujo rectificado en el espacio latente de Mage-VAE, usando Qwen3-VL como codificador de texto.

Juntos impulsan dos instancias del modelo — Mage-Flow para texto a imagen y Mage-Flow-Edit para edición de imágenes basada en instrucciones — cada una disponible en variantes Base, Alineada por RL y Turbo de 4 pasos.

Características Clave

  • Compacto pero competitivo — una única familia de 4B que iguala o supera sistemas abiertos mucho más grandes (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B)
  • Resolución nativa — un único checkpoint genera de 512 a 2048 en cualquier relación de aspecto, incluyendo 4:1 extremas (ej. 512x2048, 2048x512)
  • Velocidad a nivel de sistema — empaquetado de resolución nativa + kernels CUDA fusionados elevan el MFU de ~33% a ~77% (~2.5x entrenamiento más rápido); las ramas condicional e incondicional de CFG se ejecutan en un único pase empaquetado
  • Familia completa de modelos — 6 checkpoints en Hugging Face que cubren generación y edición en niveles Base, Alineado por RL y Turbo
  • Latencia interactiva — a 1024x1024 en una sola A100: Mage-Flow-Turbo 0.59 s/imagen, Mage-Flow-Edit-Turbo 1.02 s/edición, pico de memoria ~18-20 GB
  • Edición versátil — soporta edición semántica de contenido, transformación de apariencia, restauración de imágenes y salidas conscientes de la estructura dentro de un pipeline unificado

Zoo de Modelos

Todos los checkpoints son repositorios autónomos estilo diffusers en Hugging Face:

ModeloTareaVariantePasosEnlace
Mage-Flow-4B-Basetexto a imagenBase30🤗 Hugging Face
Mage-Flow-4Btexto a imagenAlineado por RL20🤗 Hugging Face
Mage-Flow-4B-Turbotexto a imagenDestilado pocos pasos4🤗 Hugging Face
Mage-Flow-Edit-4B-BaseediciónBase30🤗 Hugging Face
Mage-Flow-Edit-4BediciónAlineado por RL30🤗 Hugging Face
Mage-Flow-Edit-4B-TurboediciónDestilado pocos pasos4🤗 Hugging Face

Destacados de Rendimiento

Mage-Flow logra GenEval 0.90 — el más alto entre todos los modelos de código abierto, superando a FLUX.2 (0.87), Qwen-Image (0.87) y Z-Image (0.84). En DPG-Bench, Mage-Flow-Base obtiene 86.26, siendo competitivo con modelos mucho más grandes.

Para edición de imágenes, Mage-Flow-Edit-Turbo puntúa GEdit-EN 8.271 y GEdit-CN 8.264, ubicándose primero o segundo entre todos los modelos de edición de código abierto en múltiples evaluaciones comparativas.

Disponibilidad

Todos los checkpoints de Mage-Flow se publican bajo la licencia MIT en Hugging Face, lo que los hace libremente disponibles para uso comercial y de investigación. Actualmente no existe soporte nativo para ComfyUI; se recomienda usar el pipeline oficial de Python o la interfaz Gradio.

Visita la página del proyecto para más detalles, galerías y evaluaciones comparativas.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Mage-Flow: modelo de resolución nativa 4B de Microsoft | ComfyUI Wiki