MiniMax-H3 × Z-Image : greffe de détail spatial pour la vidéo H3

ComfyUI Wikinews

L'attention spatiale de Z-Image passe sur MiniMax-H3 via un rescale de q_norm : décors et textures plus riches, détail plat entre plans enchaînés, checkpoints ComfyUI.

MiniMax-H3 × Z-Image (dépôt prêt pour ComfyUI | dépôt GGUF) est une greffe de détail spatial communautaire de joeygambino qui transplante le profil d'attention de Z-Image, spécialisé dans les textures, sur les blocs tardifs de MiniMax-H3. Le résultat est un remplacement direct des checkpoints H3 standards : mêmes identité, voix, vitesse et VRAM, avec des décors et des surfaces visiblement plus riches.

Ce que c'est

Z-Image (Lumina2, un modèle d'image de 6B réputé pour son rendu de textures exceptionnel) et MiniMax-H3 utilisent tous deux une normalisation Q par tête dans l'attention. La greffe redimensionne les poids q_norm des blocs tardifs de H3 pour qu'ils s'attachent à la texture fine comme le fait Z-Image, sans réentraînement, sans nouvelle connaissance ni changement d'architecture. Les blocs précoces restent intacts (les greffer produit un artefact en treillis dans les textures régulières, mesuré et non deviné), et la normalisation K ainsi que les couches feed-forward ne sont jamais modifiées.

C'est le deuxième « mariage » dans la lignée de l'auteur : Joy-LTX 2.5 a transféré les performances de JoyAI-Echo sur LTX-2.5 par transplantation de delta de poids. Ici le donneur est une architecture entièrement différente, donc ce qui traverse, ce sont des statistiques d'attention plutôt que des poids, avec un contrôle par bloc et par dose, vérifié contre des lignes de base à graine identique.

Ce que ça donne

Vidéos de démonstration, des prises continues en trois plans rendues avec les fichiers de cette page :

Mesuré sur des scènes enchaînées, le détail supplémentaire reste plat entre les jonctions : un ratio de bande haute de 0,99 sur 3 jonctions contre 1,11 sur l'original, c'est-à-dire sans dérive de netteté d'un plan à l'autre.

Utilisation dans ComfyUI

Déposez le fichier là où vivent vos checkpoints H3 et sélectionnez-le dans votre loader. Tous les workflows H3 fonctionnent sans modification, y compris les toiles en chaîne sans couture de MiniMax-H3 Multishot. Les versions prêtes pour ComfyUI (bf16 / fp8 / int8 / w4a8 / nvfp4) se chargent avec le nœud standard Load Diffusion Model sur ComfyUI 0.32+ ; le dépôt GGUF propose des cuissons curve pour les cartes plus petites :

fichierpour
*-curve-zs05-Q8_0.gguf32 Go
*-curve-zs05-Q5_1.gguf24-32 Go
*-curve-zs05-Q4_0.gguf16-24 Go

fl2va vs ref2va : même choix que pour H3 standard, ref2va quand l'identité et la voix doivent persister (images de référence, ancrage vocal, banque d'identité), fl2va quand un plan doit atterrir sur une image fournie. Les deux s'enchaînent. Sur RTX 30/40, l'auteur rapporte que les versions GGUF sont 4 à 8 fois plus rapides que toute version 4 bits prête pour ComfyUI sur Ampere.

Vérification

L'auteur rapporte une équivalence à graine identique avec l'implémentation par patch à l'exécution, une identité maintenue sur les visages entre variantes (la texture faciale s'améliore par rapport à l'original), des scènes enchaînées de 4 plans qui posent les événements scénarisés sans artefacts, et une vérification au niveau des tenseurs de la mathématique de la greffe après cuisson pour chaque fichier.

Liens

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax-H3 × Z-Image : greffe de détail spatial pour la vidéo H3 | ComfyUI Wiki