LongCat Video Avatar 1.5 : l'avatar audio open source de Meituan
Meituan fait passer LongCat-Video-Avatar en 1.5 : lip-sync Whisper-Large, distillation DMD2 en 8 étapes et nœuds ComfyUI pour avatars audio-vers-vidéo.
LongCat-Video-Avatar 1.5 est le framework open source amélioré de Meituan pour la génération de vidéos humaines pilotées par l'audio. Construit sur le modèle de fondation LongCat-Video, il produit des vidéos d'avatar stables et de qualité professionnelle avec une prise en charge native de l'Audio-Text-to-Video (AT2V), de l'Audio-Text-Image-to-Video (ATI2V) et de la continuation vidéo, fonctionnant avec un ou plusieurs flux audio.
Nouveautés de la version 1.5
- L'encodeur audio Whisper-Large remplace Wav2Vec2, offrant une dynamique labiale nettement plus fluide et naturelle
- L'inférence distillée en 8 étapes basée sur DMD2, équilibrant un service rentable avec une haute fidélité visuelle
- Une stabilité prête pour la production : synchronisation labiale précise, stabilité temporelle du corps entier et cohérence stricte de l'identité sur les vidéos longues
- La généralisation stylisée du domaine : robuste sur l'anime, les animaux, les interactions multi-personnes et la manipulation d'objets
La page du projet inclut des comparaisons côte à côte avec les services commerciaux pour la synchronisation labiale et l'animation 3D :
Prise en charge de ComfyUI
Le pack de Nœuds communautaire ComfyUI-LongCat-Avatar adapte le pipeline officiel Avatar 1.5 à ComfyUI : neuf Nœuds couvrant la génération d'avatars mono et multi-audio, le conditionnement audio Whisper-large-v3, le LoRA de distillation DMD requis et trois modes de poids (DiT .safetensors mono-fichier, checkpoints officiels shardés et checkpoints officiels shardés INT8) en 480p et 720p.
Les fichiers de modèle se placent dans les dossiers ComfyUI standard (models/loras, models/vae, models/audio_encoders, models/diffusion_models), et les Nœuds peuvent télécharger automatiquement les checkpoints officiels shardés. Le Flux de travail d'exemple du pack :
Disponibilité
Les poids, le rapport technique et le code d'inférence sont disponibles via le référentiel officiel LongCat-Video et la page du projet.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.