MiniMax H3 Semantic Bridge : adaptateur 11 Mo pour ComfyUI

ComfyUI Wikinews

La distillation indépendante transfère les sémantiques SenseNova U1.5 dans le conditionnement de MiniMax H3 : un adaptateur de 11 Mo avec nœuds ComfyUI et workflows.

MiniMax H3 Semantic Bridge (Hugging Face) est un projet de recherche indépendant qui transfère les représentations sémantiques de SenseNova U1.5 dans l'espace de conditionnement de MiniMax H3 par distillation croisée d'architecture. Le résultat est un adaptateur autonome d'environ 11 Mo (v1.0, publié le 5 septembre) avec trois nœuds personnalisés ComfyUI, fonctionnant entièrement localement sur du matériel grand public. Ce n'est pas une publication officielle de MiniMax.
MiniMax H3 Semantic Bridge exemple ComfyUI workflow

Le flux de travail d'exemple publié montre où se situe le nœud Pont Sémantique dans un pipeline FL2VA H3 standard : après le conditionnement texte, avant l'échantillonnage.

Pourquoi ne pas greffer simplement les poids ?

L'auteur a d'abord testé l'approche évidente : transplanter directement les poids du transformateur de SenseNova U1.5 dans MiniMax H3. Cela a échoué complètement. En comparant les poids 2D pertinents, H3 possède 264 tenseurs contre 593 pour SenseNova, sans correspondance exacte de forme, sans correspondance de transposition, et sans dimensions d'entrée ou de sortie correspondantes.

L'interface utilisable s'est révélée être les représentations de conditionnement. H3 consomme un conditionnement texte de 5120 dimensions avant de le projeter dans son espace transformateur interne de 5376 dimensions, tandis que la représentation linguistique de SenseNova est de 4096 dimensions. Au lieu de copier les poids, le projet a aligné la façon dont les deux architectures représentent le même prompt, puis a distillé cette mappage en un adaptateur compact côté H3.

La voie de recherche, entièrement documentée dans le dépôt : l'alignement des représentations cachées a atteint un cosinus de validation d'environ 0,904 sur des prompts hors échantillon de la distribution originale et 0,749 sur 160 prompts stricts hors distribution. Un pont professeur complet (exécutant SenseNova au moment de l'inférence) a fonctionné mais était peu pratique, il a donc été distillé en un adaptateur élève qui prédit la représentation dérivée du professeur directement à partir du conditionnement propre de H3. L'élève final atteint un cosinus de représentation professeur de 0,996 et un cosinus de correction de 0,984, avec une correction hors distribution de 0,990.

Ce que fait l'adaptateur dans ComfyUI

L'adaptateur n'est pas un LoRA, une fusion de checkpoint ou une greffe de paramètres. Au moment de l'inférence, il opère uniquement sur le conditionnement H3 : le nœud transforme le conditionnement texte natif H3 en une représentation sémantique apprise, l'adapte en magnitude et le mélange en retour comme résidu (C = H + alpha * (S - H)), laissant les poids du transformateur de diffusion intacts. SenseNova n'est pas nécessaire à l'inférence.

Le pack de nœuds (zip sur HF) fournit trois nœuds :

  • MiniMax H3 Image vers Vidéo + Pont Sémantique : un wrapper prêt à l'emploi autour du chemin image-vers-Vidéo H3 standard
  • MiniMax H3 Pont Sémantique : la transformation de conditionnement elle-même, avec les contrôles alpha (défaut 0,10, exemples A/B utilisent 0,15) et magnitude_match (RECOMMANDÉ par token)
  • MiniMax H3 Effacer le Cache du Pont Sémantique

Installation : extraire le zip dans ComfyUI/custom_nodes/, placer MiniMaxH3_SemanticBridge_v1.safetensors dans ComfyUI/models/semantic_bridge/, et redémarrer. Tout l'adaptateur pèse environ 11 Mo.

Cible : adhérence aux prompts, pas nouveaux styles

Le projet se concentre sur la structure sémantique plutôt que sur l'ajout de concepts visuels : composition complexe, relations spatiales, anatomie, comptage d'objets, contraintes textuelles, matériaux et éclairage, et comportement de réflexion ou d'occlusion. L'exemple phare A/B met en stress un prompt demandant une main posée à plat sur une table en verre "avec les cinq doigts naturellement séparés et clairement visibles", parmi beaucoup d'autres contraintes simultanées.

Native MiniMax H3With Semantic Bridge
H3 Natif : la main droite dérive sur la tablePont Sémantique (alpha 0,15) : la main reste posée comme demandé

Deuxième moitié de la paire A/B table en verre avec le pont activé (alpha 0,15).

L'auteur est explicite que ce sont des observations qualitatives provenant de paires contrôlées, pas un benchmark : l'adaptateur peut aider certains prompts, faire peu sur d'autres, ou occasionnellement empirer les résultats. Les métriques de l'espace de représentation ne se traduisent pas directement en gains de qualité perceptuelle.

Portée : FL2VA uniquement, et une station de développement de 24 Go

Deux notes pratiques. Premièrement, v1 fonctionne uniquement sur le chemin standard FL2VA / conditionné par texte. Une variante compatible Ref2VA a été testée et a dégradé le chant audio de référence et la synchronisation labiale, aussi le README met-il explicitement en garde contre son utilisation pour la génération conditionnée par référence.

Deuxièmement, l'intégralité du projet (extraction de représentation, expériences de pont, distillation, évaluation) a fonctionné sur une seule RTX 3090 Ti avec 24 Go, sans cluster multi-GPU. Pour une expérience sur le transfert de comportement appris entre des architectures incompatibles, c'est sans doute la partie la plus intéressante de la publication.

Disponibilité

  • Adaptateur, nœuds, flux de travail, documents de recherche : speach1sdef178/MiniMax-H3-Semantic-Bridge sur Hugging Face
  • Licence : les artefacts dérivés du modèle suivent la Licence Communautaire MiniMax H3 (avec NOTICE incluse) ; le professeur SenseNova U1.5 est Apache-2.0 et n'est pas redistribué
  • Article de recherche complet : RESEARCH_ARTICLE.md

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 Semantic Bridge : adaptateur 11 Mo pour ComfyUI | ComfyUI Wiki