LongCat Video Avatar 1.5 : l'avatar audio open source de Meituan

ComfyUI Wikinews

Meituan fait passer LongCat-Video-Avatar en 1.5 : lip-sync Whisper-Large, distillation DMD2 en 8 étapes et nœuds ComfyUI pour avatars audio-vers-vidéo.

LongCat-Video-Avatar 1.5 est le framework open source amélioré de Meituan pour la génération de vidéos humaines pilotées par l'audio. Construit sur le modèle de fondation LongCat-Video, il produit des vidéos d'avatar stables et de qualité professionnelle avec une prise en charge native de l'Audio-Text-to-Video (AT2V), de l'Audio-Text-Image-to-Video (ATI2V) et de la continuation vidéo, fonctionnant avec un ou plusieurs flux audio.

Démonstration de LongCat Video Avatar 1.5

Nouveautés de la version 1.5

  • L'encodeur audio Whisper-Large remplace Wav2Vec2, offrant une dynamique labiale nettement plus fluide et naturelle
  • L'inférence distillée en 8 étapes basée sur DMD2, équilibrant un service rentable avec une haute fidélité visuelle
  • Une stabilité prête pour la production : synchronisation labiale précise, stabilité temporelle du corps entier et cohérence stricte de l'identité sur les vidéos longues
  • La généralisation stylisée du domaine : robuste sur l'anime, les animaux, les interactions multi-personnes et la manipulation d'objets

La page du projet inclut des comparaisons côte à côte avec les services commerciaux pour la synchronisation labiale et l'animation 3D :

Comparaison de la synchronisation labiale

Prise en charge de ComfyUI

Le pack de Nœuds communautaire ComfyUI-LongCat-Avatar adapte le pipeline officiel Avatar 1.5 à ComfyUI : neuf Nœuds couvrant la génération d'avatars mono et multi-audio, le conditionnement audio Whisper-large-v3, le LoRA de distillation DMD requis et trois modes de poids (DiT .safetensors mono-fichier, checkpoints officiels shardés et checkpoints officiels shardés INT8) en 480p et 720p.

Les fichiers de modèle se placent dans les dossiers ComfyUI standard (models/loras, models/vae, models/audio_encoders, models/diffusion_models), et les Nœuds peuvent télécharger automatiquement les checkpoints officiels shardés. Le Flux de travail d'exemple du pack :

Flux de travail LongCat Video Avatar ComfyUI

Disponibilité

Les poids, le rapport technique et le code d'inférence sont disponibles via le référentiel officiel LongCat-Video et la page du projet.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
LongCat Video Avatar 1.5 : l'avatar audio open source de Meituan | ComfyUI Wiki