Mage-Flow : le modele natif 4B de Microsoft
Microsoft Asia publie Mage-Flow -- compact stack 4B pour texte-image et edition d'images, resolution native 512-2048, variantes RL et Turbo, licence MIT.
Microsoft Asia a publié Mage-Flow, une stack générative compacte de 4 milliards de paramètres pour la génération texte-image efficace et l'édition d'images par instructions. Plutôt que de passer à des dizaines de milliards de paramètres, Mage-Flow atteint une qualité concurrentielle de l'état de l'art grâce à une co-conception minutieuse tokeniseur-colonne vertébrale-système, le rendant rapide, léger en mémoire et facile à affiner avec des budgets de calcul réalistes.
- Modèle : microsoft/Mage-Flow sur Hugging Face
- Article : arXiv 2607.19064
- Code : github.com/microsoft/Mage
- Licence : MIT
Ce qu'il fait
Mage-Flow repose sur deux composants partagés et co-conçus :
- Mage-VAE — un tokeniseur latent léger et haute-fidélité (encodage/décodage par diffusion en une étape avec régularisation KL par ancre latente). Correspond à la fidélité de reconstruction de FLUX.2-VAE tout en utilisant ~12× / ~22× moins de MACs d'encodage/décodage par pixel.
- NR-MMDiT — un Transformation Multimodal à Résolution Native partagé de 4B avec rectified flow matching dans l'espace latent de Mage-VAE, utilisant Qwen3-VL comme encodeur de texte.
Ensemble, ils alimentent deux instanciations du modèle — Mage-Flow pour la génération texte-image et Mage-Flow-Edit pour l'édition d'images par instructions — chacune disponible en variantes Base, RL-aligned et Turbo 4 étapes.
Fonctionnalités clés
- Compact mais compétitif — une seule famille 4B qui égale ou dépasse des systèmes ouverts bien plus volumineux (Qwen-Image 20B, Z-Image 6B, FLUX.2 32B, FireRed-Image-Edit 20B)
- Résolution native — un seul point de contrôle génère de 512 à 2048 sur n'importe quel rapport d'aspect, y compris les formats extrêmes 4:1 (par ex. 512×2048, 2048×512)
- Vitesse au niveau système — le packing en résolution native et les noyaux CUDA fusionnés augmentent le MFU d'environ 33 % à environ 77 % (entraînement ~2,5× plus rapide) ; les branches conditionnelle et inconditionnelle de CFG s'exécutent en une seule passe forward packée
- Famille complète de modèles — 6 points de contrôle sur Hugging Face couvrant la génération et l'édition aux niveaux Base, RL-aligned et Turbo
- Latence interactive — à 1024×1024 sur un seul A100 : Mage-Flow-Turbo 0,59 s/image, Mage-Flow-Edit-Turbo 1,02 s/édition, pic mémoire ~18–20 Go
- Édition polyvalente — prend en charge l'édition de contenu sémantique, la transformation d'apparence, la restauration d'image et les sorties structurées dans un pipeline unifié
Zoo de modèles
Tous les points de contrôle sont des dépôts autonomes au format diffusers sur Hugging Face :
| Modèle | Tâche | Variante | Étapes | Lien |
|---|---|---|---|---|
| Mage-Flow-4B-Base | texte-image | Base | 30 | 🤗 Hugging Face |
| Mage-Flow-4B | texte-image | RL-aligned | 20 | 🤗 Hugging Face |
| Mage-Flow-4B-Turbo | texte-image | Distillé (peu d'étapes) | 4 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B-Base | édition | Base | 30 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B | édition | RL-aligned | 30 | 🤗 Hugging Face |
| Mage-Flow-Edit-4B-Turbo | édition | Distillé (peu d'étapes) | 4 | 🤗 Hugging Face |
Points forts des performances
Mage-Flow atteint GenEval 0,90 — le plus élevé parmi tous les modèles open-source, surpassant FLUX.2 (0,87), Qwen-Image (0,87) et Z-Image (0,84). Sur DPG-Bench, Mage-Flow-Base obtient un score de 86,26, compétitif avec des modèles bien plus grands.
Pour l'édition d'images, Mage-Flow-Edit-Turbo obtient GEdit-EN 8,271 et GEdit-CN 8,264, se classant premier ou deuxième parmi tous les modèles d'édition open-source sur plusieurs benchmarks.
Disponibilité
Tous les points de contrôle Mage-Flow sont publiés sous licence MIT sur Hugging Face, les rendant librement disponibles pour la recherche et une utilisation commerciale. Il n'existe pas encore de nœud ComfyUI natif pour Mage-Flow.
Consultez la page du projet pour plus de détails, des galeries et des benchmarks.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.