TaoMate-H3 : le LoRA streaming temps réel d'Alibaba pour MiniMax H3

ComfyUI Wikinews

Alibaba TaoLive AIGC publie TaoMate-H3, un LoRA en 3 étapes qui diffuse audio et vidéo synchronisés par blocs pour une génération MiniMax H3 longue durée à 35 FPS.

L'équipe TaoLive AIGC du groupe Taobao et Tmall d'Alibaba a publié TaoMate-H3, un runtime streaming à faible latence construit sur MiniMax H3 qui génère de l'audio et de la vidéo synchronisés par petits blocs. Le framework atteint une sortie en parallélisme par étages à 35 FPS, prend en charge des générations ininterrompues au-delà de 30 minutes et fournit un adaptateur LoRA en 3 étapes de rang 128 avec le code du runtime sur GitHub (plus de 150 étoiles).

Présentation

TaoMate est un framework à mémoire persistante guidé par ancre pour la génération audio-vidéo conjointe en quelques étapes, décrit dans le papier et la page projet du projet. Au lieu d'étendre le cache de contexte actif, il préserve une ancre visuelle immuable, compresse les blocs vidéo et audio terminés en états dynamiques à capacité fixe, puis récupère ces états via une attention résiduelle propre à chaque modalité. Une méthode de modulation sensible à la référence conditionne les caractéristiques vidéo sur les statistiques d'apparence de l'ancre, et une distillation de contexte causal préservant l'ancre maintient celle-ci non perturbée pendant l'entraînement.

MétriqueValeur
Sortie streaming35 FPS
Latence sur un seul appareil130,3 s / 1441 images
Backbone22,1B (MiniMax H3)
Cohérence longue0,9520
Désynchronisation audio0,000

Le runtime publié génère la parole, les effets sonores et la vidéo sur une seule chronologie synchronisée, avec un transfert propre du cache KV qui préserve l'identité visuelle, la voix et le mouvement au fil des changements de prompt. Chaque bloc de cinq secondes peut porter son propre prompt via un fichier --prompt-json, et la génération s'exécute en 480p, 768p et 1080p aligné. La configuration matérielle validée est 8 x H20 96 Go avec parallélisme de tenseurs et de séquences.

Image d'exemple TaoMate-H3 issue de la bande démo officielle : reporter du port

Image d'exemple issue de la bande démo officielle : un personnage narrateur conservé d'un bloc de streaming à l'autre.

Ce qui a été publié

Démo officielle : clip de 10 secondes d'un robot en argile généré avec un audio synchronisé.

Réaction de la communauté

La publication a rapidement attiré l'attention de la communauté MiniMax H3. En une semaine, elle a cumulé plus de 150 étoiles GitHub, et des membres de la communauté ont trouvé un flux de travail pratique à deux échantillonneurs pour une utilisation sur un seul GPU : construire la scène avec un échantillonneur de haute qualité d'étapes, puis terminer les trois dernières étapes avec le LoRA TaoMate. Les testeurs rapportent une forte qualité visuelle sans l'aspect surcuit courant des autres LoRA turbo, tout en notant que les scènes statiques ou lentes fonctionnent bien mieux que les mouvements rapides. Une conversion safetensors du LoRA compatible ComfyUI est également disponible auprès d'un membre de la communauté.

Disponibilité

TaoMate-H3 nécessite le modèle de base MiniMax H3 et cible Linux avec des GPU SM90 (Hopper) sous la licence communautaire MiniMax H3. Le code du runtime, le guide d'installation et le format de fichier de prompt se trouvent dans le référentiel GitHub, et l'adaptateur LoRA est sur Hugging Face. Il n'existe pas de nœud ComfyUI natif pour le runtime streaming lui-même ; les utilisateurs sur un seul GPU accèdent au LoRA via des flux de travail communautaires.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
TaoMate-H3 : le LoRA streaming temps réel d'Alibaba pour MiniMax H3 | ComfyUI Wiki