TaoMate-H3 : le LoRA streaming temps réel d'Alibaba pour MiniMax H3
Alibaba TaoLive AIGC publie TaoMate-H3, un LoRA en 3 étapes qui diffuse audio et vidéo synchronisés par blocs pour une génération MiniMax H3 longue durée à 35 FPS.
Présentation
TaoMate est un framework à mémoire persistante guidé par ancre pour la génération audio-vidéo conjointe en quelques étapes, décrit dans le papier et la page projet du projet. Au lieu d'étendre le cache de contexte actif, il préserve une ancre visuelle immuable, compresse les blocs vidéo et audio terminés en états dynamiques à capacité fixe, puis récupère ces états via une attention résiduelle propre à chaque modalité. Une méthode de modulation sensible à la référence conditionne les caractéristiques vidéo sur les statistiques d'apparence de l'ancre, et une distillation de contexte causal préservant l'ancre maintient celle-ci non perturbée pendant l'entraînement.
| Métrique | Valeur |
|---|---|
| Sortie streaming | 35 FPS |
| Latence sur un seul appareil | 130,3 s / 1441 images |
| Backbone | 22,1B (MiniMax H3) |
| Cohérence longue | 0,9520 |
| Désynchronisation audio | 0,000 |
Le runtime publié génère la parole, les effets sonores et la vidéo sur une seule chronologie synchronisée, avec un transfert propre du cache KV qui préserve l'identité visuelle, la voix et le mouvement au fil des changements de prompt. Chaque bloc de cinq secondes peut porter son propre prompt via un fichier --prompt-json, et la génération s'exécute en 480p, 768p et 1080p aligné. La configuration matérielle validée est 8 x H20 96 Go avec parallélisme de tenseurs et de séquences.
Image d'exemple issue de la bande démo officielle : un personnage narrateur conservé d'un bloc de streaming à l'autre.
Ce qui a été publié
- Code du runtime : la pile d'inférence streaming complète sur TaoLiveAIGC/TaoMate-H3, incluant la génération par blocs, la planification d'un prompt par bloc et l'exécution en parallélisme par étages
- Adaptateur LoRA en 3 étapes : le checkpoint EMA du générateur à l'étape 3000 (rang 128, alpha 128, tenseurs FP32) sur TaoLiveAIGC/TaoMate-H3 sur Hugging Face, utilisé avec le modèle de base MiniMax H3 FL2VA
- Galerie de démos : bandes d'exemple incluant un narrateur de documentaire de 30 minutes ininterrompu sur la page projet
Démo officielle : clip de 10 secondes d'un robot en argile généré avec un audio synchronisé.
Réaction de la communauté
La publication a rapidement attiré l'attention de la communauté MiniMax H3. En une semaine, elle a cumulé plus de 150 étoiles GitHub, et des membres de la communauté ont trouvé un flux de travail pratique à deux échantillonneurs pour une utilisation sur un seul GPU : construire la scène avec un échantillonneur de haute qualité d'étapes, puis terminer les trois dernières étapes avec le LoRA TaoMate. Les testeurs rapportent une forte qualité visuelle sans l'aspect surcuit courant des autres LoRA turbo, tout en notant que les scènes statiques ou lentes fonctionnent bien mieux que les mouvements rapides. Une conversion safetensors du LoRA compatible ComfyUI est également disponible auprès d'un membre de la communauté.
Disponibilité
TaoMate-H3 nécessite le modèle de base MiniMax H3 et cible Linux avec des GPU SM90 (Hopper) sous la licence communautaire MiniMax H3. Le code du runtime, le guide d'installation et le format de fichier de prompt se trouvent dans le référentiel GitHub, et l'adaptateur LoRA est sur Hugging Face. Il n'existe pas de nœud ComfyUI natif pour le runtime streaming lui-même ; les utilisateurs sur un seul GPU accèdent au LoRA via des flux de travail communautaires.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.