XGEN-JING : modèle interactif égocentrique basé sur MiniMax H3

ComfyUI Wikinews

JING-Flash-v1 de XGEN Labs génère vidéo et audio à la première personne sur MiniMax H3 : caméra au clavier, interaction par texte, dialogue et inférence en quatre étapes.

XGEN Labs a publié XGEN-JING, un modèle d'expérience interactive égocentrique construit sur MiniMax H3. Là où un modèle vidéo classique génère un clip fixe, JING prend en entrée des actions, des images de référence et un historique d'observations, puis génère de la vidéo et de l'audio à la première personne : vous vous déplacez, interagissez avec les objets et tenez des conversations.

Couverture de XGEN-JING

La couverture officielle de XGEN-JING issue du référentiel du modèle.

Ce qu'il fait

Le modèle est entraîné pour trois comportements, tous générés conjointement sous forme de vidéo et d'audio :

  • Contrôle de la caméra. Déplacez-vous dans des lieux du quotidien et des mondes imaginaires grâce à la saisie au clavier, en explorant le même point de départ en le parcourant différemment.
  • Interaction et dialogue. Pilotez les interactions avec les objets et les conversations avec les personnages par du texte plutôt que par des prompts de mouvement.
  • Conditionnement par référence. Composez une expérience à partir d'images de personnages, d'objets et de scènes tirées d'une histoire, afin que le même ensemble de références puisse être exploré sous différentes actions.

JING Flash repose sur le chemin Ref2VA de MiniMax H3 ainsi que sur FlashGen, le LoRA H3 en 4 étapes, ce qui rend possible l'inférence bidirectionnelle en quatre étapes. L'encodeur de texte, le tokenizer, le processor, les VAE vidéo et audio et les planificateurs proviennent tous du MiniMax H3 au format diffusers plutôt que de faire partie de la publication : seul le transformer jing_flash_v1 est nouveau.

Statut de la publication

Il s'agit d'une version de type aperçu, et le plan de publication est explicite à ce sujet :

ÉlémentStatut
Modèle bidirectionnel en quatre étapes JING-Flash-v1Publié
Code d'inférence et exemplesPublié
Compétences de promptPublié
Modèle causalBientôt disponible
Rapport techniqueBientôt disponible

Cette distinction est importante pour comprendre ce que « interactif » signifie ici. Un modèle bidirectionnel en quatre étapes génère l'intégralité du clip avec la séquence d'actions connue à l'avance ; le modèle causal, qui répondrait étape par étape au fur et à mesure que vous appuyez sur les touches, n'est pas encore disponible. XGEN Labs a publié une galerie et une vidéo de démonstration en même temps que les poids.

Le référentiel inclut également un document sur les compétences de prompt, qui génère des cas d'inférence validés à partir d'histoires et d'images de référence.

Logo XGEN Labs

Disponibilité

La vidéo de démonstration officielle de XGEN-JING.

Il n'y a aucun support ComfyUI : le chemin d'inférence repose sur diffusers plus un runtime SGLang épinglé à une révision de diffusion spécifique, et la configuration de démonstration validée répartit la pile sur six GPU H100 (un pour l'encodeur de texte, un pour les VAE vidéo et audio, quatre pour le DiT avec parallélisme de séquence) avec FlashAttention-4 comme backend d'attention par défaut. Jusqu'à l'arrivée d'un modèle causal et d'un chemin d'inférence plus léger, il s'agit d'un aperçu de la direction que prennent les modèles interactifs basés sur H3 plutôt que de quelque chose d'exécutable sur une machine ComfyUI locale.

Pour le modèle de monde interactif antérieur sur la même base, voir H3-World.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
XGEN-JING : modèle interactif égocentrique basé sur MiniMax H3 | ComfyUI Wiki