ComfyUI v0.38.0 : Ming-Image, ID-V2V et SeedVR2 plus rapide

ComfyUI Wikinews

ComfyUI v0.38.0 ajoute Ming-Image en natif avec un template officiel, intègre Wan ID-V2V, la quantification w6a8 et les espaces HDR LogC3 et ACEScct, et accélère SeedVR2 et YuE2.

ComfyUI v0.38.0 est disponible. Cette version intègre Ming-Image au cœur du logiciel avec un template officiel, ajoute le support longtemps attendu de Wan ID-V2V, introduit la quantification w6a8, les espaces colorimétriques HDR LogC3 et HDR ACEScct, et réduit la mémoire utilisée par SeedVR2 en décodant la vidéo une frame à la fois.
Sortie Ming-Image 0.1 Design générée par le template officiel ComfyUI

Une composition de design générée par le template officiel Ming-Image 0.1 Design, qui écrit une sortie RGBA avec transparence (ressource issue du référentiel workflow_templates).

Ming-Image dans le cœur

Ming-Image 0.1 Design s'exécute désormais nativement. La prise en charge dans le cœur est arrivée avec Comfy-Org/ComfyUI#16482, suivie d'un correctif de détection dans #16514, après que la même modification avait été intégrée dans le correctif v0.37.3 puis annulée à nouveau dans v0.37.4. Si le modèle est apparu puis a disparu pour vous sur la branche stable, c'est en v0.38.0 qu'il reste.

Le portage ajoute un nœud de conditionnement dédié, Text Encode Ming Image Edit (TextEncodeMingImageEdit, catégorie model/conditioning/ming image). Il tokenise le prompt avec jusqu'à huit images de référence (image_1 à image_8) dans l'encodeur de texte Ming, et l'entrée VAE est facultative : sans elle, les images ne conditionnent que via la tour de vision, tandis qu'avec elle, chaque référence est ajoutée à la séquence latente comme une image propre. Les références suivantes sont redimensionnées sur la première, et le latent échantillonné doit correspondre à la taille de cette première image.

Du côté du modèle, Ming-Image est un DiT à 30 couches sur un espace latent à 16 canaux avec son propre format latent MingImage, et il fonctionne avec un shift de 3,16 sur le bucket 1024. L'encodeur de texte est le modèle de langue Ling-Mini-2.0 intégré, un MoE à 20 couches et 256 experts, associé à une tour de vision de style Qwen pour les images de référence. Deux checkpoints fonctionnent avec le même graphe de nœuds : le modèle Design et son frère Design Layer qui décompose un design terminé en calques transparents éditables.

Les poids repackés sont publiés sous Comfy-Org/Ming-Image en variantes bf16 et int8_convrot :

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── ming_image_0.1_design_bf16.safetensors
    │   ├── ming_image_0.1_design_int8_convrot.safetensors
    │   ├── ming_image_0.1_design_layer_bf16.safetensors
    │   └── ming_image_0.1_design_layer_int8_convrot.safetensors
    ├── 📂 text_encoders/
    │   ├── ming_image_0.1_ling_mini_2.0_bf16.safetensors
    │   └── ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
    └── 📂 vae/
        └── ming_image_vae_bf16.safetensors

Le modèle officiel image_ming_image_01_design_t2i câble tout le pipeline, y compris une étape d'amélioration du prompt : un encodeur de texte Qwen3.8-27B (fourni sous qwen3.8_27b_w4a8.safetensors) réécrit une demande courte en un brief de design JSON structuré de style Figma, et c'est ce brief que reçoit l'encodeur de texte Ming. L'échantillonnage se fait en 12 étapes d'Euler avec ModelSamplingFlux sur un latent 1024x2048.

Mises à jour de Qwen-Image 2.1 et de ControlNet

Le développement autour de Qwen-Image 2.1 se poursuit :

  • Union Fun ControlNet est désormais pris en charge (#16519) pour alibaba-pai/Qwen-Image-2.1-Fun-Controlnet-Union, le ControlNet unique qui couvre les différents types de Fun ControlNet individuels. La prise en charge correspondante de H3 Fun-ControlNet-Union 2.0 issue de #16471 figure également dans cette version.
  • La prise en charge de Tiny VAE (#16552) ajoute taeqi2_1_decoder et taeqi2_1_encoder du dépôt taesd de madebyollin, ce qui offre à Qwen-Image 2.1 des aperçus latents rapides et un aller-retour TAESD peu coûteux. Déposez les fichiers dans models/vae_approx/. Il s'agit de modèles 16x avec 64 canaux latents et un côté image RGBA à 4 canaux, avec une échelle et un décalage par canal au lieu des valeurs scalaires utilisées par les anciennes variantes TAESD.
  • Le placement du cache KV de préfixe (#16429) est désormais déterminé à partir de la comptabilité de mémoire libre du model patcher, de sorte que le cache peut rester en VRAM avec le VRAM dynamique et la mémoire intelligente au lieu de retomber sur un recalcul complet. La compilation des blocs Transformer (#16430) ajoute la prise en charge du memory-compiler, ce qui aide principalement lorsque la bande passante d'offload constitue le goulot d'étranglement.
  • Un clamp d'activation fp16 (#16608) corrige une allocation in-place qui cassait le memory compiler, et le prétraitement d'image de Qwen VL ne plante plus sur une entrée RGBA à 4 canaux (#16548).

Wan ID-V2V arrive dans ComfyUI

La PR de prise en charge ID-V2V, Comfy-Org/ComfyUI#15139, a finalement été fusionnée le 2026-09-27 et est livrée ici. ID-V2V restyle la vidéo tout en préservant l'identité, et repose sur une base Wan 2.1 image-to-video avec contrôle VACE, une combinaison que ComfyUI ne pouvait pas charger auparavant.

Deux changements rendent cela possible. La détection de modèle reconnaît l'architecture lorsqu'un modèle VACE porte la projection img_emb d'une base I2V, et Image to Video accepte désormais une entrée optionnelle ref_pad_image. Cette entrée remplit les images de remplissage du conditionnement d'image avec une image de référence au lieu d'un gris uni : c'est le remplissage anti-dérive avec lequel le modèle a été entraîné. ref_pad_image est optionnelle, les flux de travail I2V existants ne sont donc pas affectés.

Les poids de test restent sur Hugging Face : Kijai/Wan_ID_V2V_comfy publie wan_2.1_idv2v_int8_convrot.safetensors ainsi qu'une variante avec contrôle de profondeur standard, et la PR inclut un JSON de flux de travail prêt à l'emploi.

Quantification : w6a8

ComfyUI peut désormais charger les checkpoints w6a8 (#16483, implémenté dans comfy-kitchen) : des poids en 6 bits avec des activations en 8 bits, ce qui donne un fichier plus petit que les repacks int8 et fp8. Les poids H3 pruned sont déjà publiés au nouveau format sur Comfy-Org/MiniMax-H3 sous les noms minimax_h3_fl2va_pruned_w6a8.safetensors et minimax_h3_ref2va_pruned_w6a8.safetensors, à côté des fichiers bf16, fp8_scaled et int8_convrot existants.

SeedVR2 et YuE2 plus rapides

SeedVR2 (#16530) est une réécriture substantielle du VAE de l'upscaler. Là où le modèle le permet, le VAE traite désormais la vidéo image par image, conserve les caches de sa convolution causale quantifiés en int8 dans la mémoire hôte épinglée, et les précharge au besoin. L'utilisation de la VRAM est donc déterminée par l'ensemble de travail d'une seule image plutôt que par celui du clip entier, ce qui compte pour les vidéos longues ou en haute résolution. Cela nécessite les kernels comfy-kitchen de la même version.

Sortie de l'upscale SeedVR2 du template officiel

Sortie du template officiel d'upscale d'image SeedVR2 (ressource issue du dépôt workflow_templates).

Deux chaînes audio ont elles aussi été accélérées :

  • YuE2 (#16626) regroupe désormais les transferts de tokens du GPU vers le CPU et exécute son sampler sous CUDA graphs.
  • ACE-Step 1.5 (#16461) bénéficie des CUDA graphs et du memory compiler sur son modèle autoregressif.

Deux correctifs MiniMax H3 accompagnent le tout : le VAE mélange désormais les décodages en mosaïque avec les voisins déjà composés (#16436), et un bug d'alignement qui faisait planter le VAE H3 lorsque qk_norm_scale était offloaded est corrigé (#16485). Upscale Image (Using Model) ne plante plus sur les images RGBA (#16500).

Espaces colorimétriques HDR

Convertir l’espace colorimétrique de l’image (ImageColorSpace) a reçu deux encodages log (#16541) : HDR LogC3 (la courbe EI 800 avec primaires Rec.709) et HDR ACEScct (primaires AP1 et blanc D60, adaptés à D65 avec l’adaptation chromatique de Bradford). Combinés aux cibles existantes sRGB, Rec.709 linéaire, HDR HLG et HDR PQ, un flux de travail peut désormais passer d’un espace colorimétrique à l’autre, comme l’attend un pipeline VFX ou EXR. Un correctif de suivi (#16565) gère les valeurs négatives dans le chemin de sortie HDR.

Mémoire, attention et chargeurs

  • Les fichiers de modèle peuvent désormais déclarer quelle implémentation d'attention chaque bloc doit utiliser (#16419), ce qui permet à un repack de mélanger plusieurs backends d'attention au sein d'un même modèle.
  • La prise en charge de comfy_attention et de AttentionTensorContainer s'étend à la famille Lumina (#16515), à quelques autres familles de modèles (#16595) et, avec une consommation de mémoire réduite, à la famille Flux (#16488).
  • La détection de disque rapide ajoutée pour le chargement dynamique dans la v0.37.0 couvre désormais tous les chargeurs de modèles (#16425), et les architectures AMD RDNA2 et antérieures ont été ajoutées à la liste des architectures (#16537).
  • Les appareils Ascend NPU bénéficient de flux asynchrones de déchargement des poids (#16057).
  • Le système de ressources a eu droit à une série de renforcements et de travaux sur les performances : le verrou d'écriture SQLite est acquis d'emblée et les lectures de fichiers sont sorties des transactions d'écriture (#16480, #16486), les rescans de sortie listent les dossiers au lieu de vérifier chaque fichier et mettent leurs boucles en pause pour que l'interface reste réactive (#16543, #16546), et ComfyUI démarre même lorsque les paquets de ressources sont manquants, en signalant ce dont --enable-assets a besoin (#16580).

Autres changements

  • Text Generate accepte une entrée optionnelle system_prompt et renvoie le bloc de réflexion sur sa propre sortie (#16442).
  • La dépendance torchaudio a été supprimée, car l'amont a cessé de fournir des builds cu132 stables (#16457).
  • La prise en charge de MiniMax H3 Fun-ControlNet-Union 2.0 issue de #16471 est incluse, et la création ABC de SheetSage2 a été alignée sur le code YuE de l'amont (#16569).
  • Nœuds partenaires : Hunyuan Image 3.5 texte-vers-image et édition (Tencent, #16462), Arrow 2 avec l'effort de raisonnement dans les nœuds SVG (Quiver, #16478), Claude Opus 5.5 (#16479), Recraft V4.1 Flash (#16501), GPT-6 Sol et Luna (OpenAI, #16520), Seedream 5.0 Flash (#16522) et Seedance 2.5 Draft mode (#16529). Les nœuds Sora obsolètes ont été supprimés (#16609). Plusieurs de ces ajouts partenaires ont déjà été livrés dans les versions correctives v0.37.x.
  • Les modèles de flux de travail sont en v0.11.70, comfy-kitchen en 0.2.36 et la documentation intégrée en 0.5.13.

Obtenir la v0.38.0

Mettez à jour via le ComfyUI Manager ou votre launcher. Le support du ControlNet Qwen-Image 2.1 et du tiny VAE, les nouveaux espaces de couleur et l'ID-V2V nécessitent tous la v0.38.0 ou une version plus récente. Ming-Image est le point à surveiller sur la ligne de correctifs : les nœuds étaient présents dans la v0.37.3 et ont de nouveau été annulés dans la v0.37.4, c'est donc dans la v0.38.0 que le support reste en place.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
ComfyUI v0.38.0 : Ming-Image, ID-V2V et SeedVR2 plus rapide | ComfyUI Wiki