LongCat Video Avatar 1.5: avatar de audio de código abierto
Meituan actualiza LongCat-Video-Avatar a 1.5 con lip-sync Whisper-Large, destilación DMD2 en 8 pasos y nodos ComfyUI para avatares de audio a vídeo.
LongCat-Video-Avatar 1.5 es el framework de código abierto actualizado de Meituan para la generación de vídeo humano impulsado por audio. Construido sobre el modelo fundacional LongCat-Video, produce vídeos de avatar estables y de calidad profesional con soporte nativo para Audio-Text-to-Video (AT2V), Audio-Text-Image-to-Video (ATI2V) y continuación de vídeo, funcionando con uno o varios flujos de audio.
Novedades en 1.5
- Codificador de audio Whisper-Large: reemplaza a Wav2Vec2, ofreciendo dinámicas de labios notablemente más fluidas y naturales
- Inferencia destilada en 8 pasos: basada en DMD2, equilibra un servicio rentable con una alta fidelidad visual
- Estabilidad lista para producción: sincronización de labios precisa, estabilidad temporal de cuerpo completo y consistencia estricta de identidad en vídeos largos
- Generalización de dominio estilizada: robusta en anime, animales, interacciones multipersona y manejo de objetos
La página del proyecto incluye comparaciones lado a lado contra servicios comerciales para sincronización de labios y animación 3D:
Soporte de ComfyUI
El paquete de nodos de la comunidad ComfyUI-LongCat-Avatar adapta el pipeline oficial de Avatar 1.5 a ComfyUI: nueve nodos que cubren la generación de avatares con audio único y múltiple, acondicionamiento de audio Whisper-large-v3, el LoRA de destilación DMD requerido y tres modos de pesos: DiT .safetensors de archivo único, checkpoints fragmentados oficiales y checkpoints fragmentados oficiales INT8, en 480p y 720p.
Los archivos de modelo se colocan en las carpetas estándar de ComfyUI (models/loras, models/vae, models/audio_encoders, models/diffusion_models), y los nodos pueden descargar automáticamente los checkpoints fragmentados oficiales. El flujo de trabajo de ejemplo del paquete:
Disponibilidad
Los pesos, el informe técnico y el código de inferencia están disponibles a través del repositorio oficial de LongCat-Video y la página del proyecto.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.