DreamX-Creator 1.0: совместная генерация аудио и видео 7B в 2K

ComfyUI Wikinews

AMap открывает DreamX-Creator 1.0: 7B-модель совместной генерации аудио и видео с gated cross-modal attention и 1-шаговым 2K-рефайнером, на базе Wan2.2, доступна для скачивания.

DreamX-Creator 1.0 (GitHub, Hugging Face) это исследовательский фреймворк команды AMap ML для нативной совместной генерации аудио и видео. Исходный код открыт 3 сентября под лицензией Apache-2.0. Генератор на 7B параметров моделирует видео- и аудиопотоки совместно с помощью управляемого кросс-модального внимания, а авторегрессивный одношаговый рефайнер повышает разрешение результата до 2K.
Тизер DreamX-Creator 1.0

Тизер DreamX-Creator 1.0, демонстрирующий результаты совместной генерации аудио и видео в разрешении 2K.

Генератор на 7B, создающий видео и аудио одновременно

Получив первый кадр и текстовый промпт, базовый генератор совместно моделирует видео- и аудиопотоки с учётом специфики каждой модальности. Двунаправленное взаимодействие обеспечивают два механизма:

  • Управляемое кросс-модальное внимание (Gated Cross-Modal Attention): веса кросс-внимания (cross_attn_weights.safetensors, 2,56 ГБ) позволяют каждой модальности учитывать другую, а обученный шлюз (gate) регулирует объём проходящей между ними информации.
  • Совместное прогрессивное обучение (Progressive Joint Training): оба потока обучаются вместе, чтобы движения губ, действия на экране и звуковая дорожка оставались синхронизированными, а не склеивались постфактум.

Поверх базового генератора этап обучения с подкреплением аудио и видео (Audio-Video Reinforcement Learning) улучшает визуальное качество, качество аудио, семантическую согласованность и детальное выравнивание аудио и видео за счёт мультимодальной обратной связи, учитывающей особенности модальностей.

Одношаговое повышение разрешения до 2K

Вторая часть системы: авторегрессивный одношаговый рефайнер до 2K (SR-DiT, 5B параметров). Он повышает разрешение сгенерированного видео до 2K, сохраняя содержимое, движение и тайминг, согласованный с аудио. Рефайнер также работает с внешними видео: на вход можно подать любой клип, аудио при этом пройдёт без изменений.

Рефайнер поставляется с собственными регуляторами скорости: кэш KV, оконное внимание и варианты латентного апсемплера (по умолчанию FlashLatentUpsampler, плюс опциональный дистиллированный быстрый декодер LightVAE) позволяют обменивать качество на более низкую задержку.

Что можно скачать

Все веса доступны на Hugging Face и ModelScope, всего около 54 ГБ:

КомпонентСодержимое
creator/Совместный генератор 7B: шарды видео-DiT (~20 ГБ), аудио-DiT (5,7 ГБ), веса кросс-внимания (2,6 ГБ)
audio_vae/Аудио-VAE CreatorDACVAE (0,74 ГБ)
refiner/SR-DiT 5B (10 ГБ), FlashLatentUpsampler, опциональный каузальный 2D-апсемплер и декодер LightVAE
wan2.2_ti2v_5b/Общие зависимости Wan2.2-TI2V-5B: видео-VAE, текстовый энкодер UMT5-xxl и токенизатор

Каталог Wan2.2 можно напрямую взять из Wan-AI/Wan2.2-TI2V-5B, поэтому если вы уже используете Wan2.2, скачивать нужно только три каталога, относящихся к DreamX.

Вывод модели выполняется на чистом Python: у каждого из двух этапов есть собственный requirements.txt и скрипт, запускаемый одной командой. Опции CPU offload и параллелизма по последовательности на нескольких GPU описаны в README-файлах подкаталогов.

Доступность

Для DreamX-Creator пока нет нативной ноды ComfyUI: веса представлены в формате diffusers, а вывод выполняется через официальный репозиторий. Следующей вехой в дорожной карте указаны дистиллированные модели с меньшим числом шагов.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
DreamX-Creator 1.0: совместная генерация аудио и видео 7B в 2K | ComfyUI Wiki