LongCat Video Avatar 1.5: открытая модель аватаров от Meituan
Meituan обновляет LongCat-Video-Avatar до 1.5: липсинк на базе Whisper-Large, дистилляция DMD2 до 8 шагов и поддержка нескольких аудиодорожек, плюс кастомные ноды ComfyUI.
LongCat-Video-Avatar 1.5 — это обновлённый открытый фреймворк Meituan для генерации видео с человеком, управляемого аудио. Построенный на базовой модели LongCat-Video, он создаёт стабильные аватары производственного качества с нативной поддержкой Audio-Text-to-Video (AT2V), Audio-Text-Image-to-Video (ATI2V) и продолжения видео, работая с одной или несколькими аудиодорожками.
Что нового в 1.5
- Аудиоэнкодер Whisper-Large заменяет Wav2Vec2, обеспечивая заметно более плавную и естественную артикуляцию
- Инференс с дистилляцией до 8 шагов на основе DMD2, балансирующий стоимость и визуальное качество
- Стабильность производственного уровня — точный липсинк, временная стабильность всего тела и строгое сохранение идентичности на длинных видео
- Обобщение на стилизованные домены — стабильная работа с аниме, животными, сценами с несколькими людьми и взаимодействием с объектами
На странице проекта доступны сравнения бок о бок с коммерческими сервисами по липсинку и 3D-анимации:
Поддержка ComfyUI
Пакет кастомных нод ComfyUI-LongCat-Avatar адаптирует официальный пайплайн Avatar 1.5 для ComfyUI: девять нод покрывают генерацию аватаров с одним и несколькими аудио, аудио-кондиционирование Whisper-large-v3, обязательную DMD-дистилляцию LoRA и три режима весов — единый файл .safetensors DiT, официальные шардированные и INT8-шардированные чекпоинты — в разрешениях 480p и 720p.
Файлы моделей размещаются в стандартных папках ComfyUI (models/loras, models/vae, models/audio_encoders, models/diffusion_models), а ноды умеют автоматически скачивать официальные шардированные чекпоинты. Пример workflow из пакета:
Доступность
Веса, технический отчёт и код инференса доступны через официальный репозиторий LongCat-Video и страницу проекта.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.