DreamX-Creator 1.0: совместная генерация аудио и видео 7B в 2K
AMap открывает DreamX-Creator 1.0: 7B-модель совместной генерации аудио и видео с gated cross-modal attention и 1-шаговым 2K-рефайнером, на базе Wan2.2, доступна для скачивания.
Тизер DreamX-Creator 1.0, демонстрирующий результаты совместной генерации аудио и видео в разрешении 2K.
Генератор на 7B, создающий видео и аудио одновременно
Получив первый кадр и текстовый промпт, базовый генератор совместно моделирует видео- и аудиопотоки с учётом специфики каждой модальности. Двунаправленное взаимодействие обеспечивают два механизма:
- Управляемое кросс-модальное внимание (Gated Cross-Modal Attention): веса кросс-внимания (
cross_attn_weights.safetensors, 2,56 ГБ) позволяют каждой модальности учитывать другую, а обученный шлюз (gate) регулирует объём проходящей между ними информации. - Совместное прогрессивное обучение (Progressive Joint Training): оба потока обучаются вместе, чтобы движения губ, действия на экране и звуковая дорожка оставались синхронизированными, а не склеивались постфактум.
Поверх базового генератора этап обучения с подкреплением аудио и видео (Audio-Video Reinforcement Learning) улучшает визуальное качество, качество аудио, семантическую согласованность и детальное выравнивание аудио и видео за счёт мультимодальной обратной связи, учитывающей особенности модальностей.
Одношаговое повышение разрешения до 2K
Вторая часть системы: авторегрессивный одношаговый рефайнер до 2K (SR-DiT, 5B параметров). Он повышает разрешение сгенерированного видео до 2K, сохраняя содержимое, движение и тайминг, согласованный с аудио. Рефайнер также работает с внешними видео: на вход можно подать любой клип, аудио при этом пройдёт без изменений.
Рефайнер поставляется с собственными регуляторами скорости: кэш KV, оконное внимание и варианты латентного апсемплера (по умолчанию FlashLatentUpsampler, плюс опциональный дистиллированный быстрый декодер LightVAE) позволяют обменивать качество на более низкую задержку.
Что можно скачать
Все веса доступны на Hugging Face и ModelScope, всего около 54 ГБ:
| Компонент | Содержимое |
|---|---|
creator/ | Совместный генератор 7B: шарды видео-DiT (~20 ГБ), аудио-DiT (5,7 ГБ), веса кросс-внимания (2,6 ГБ) |
audio_vae/ | Аудио-VAE CreatorDACVAE (0,74 ГБ) |
refiner/ | SR-DiT 5B (10 ГБ), FlashLatentUpsampler, опциональный каузальный 2D-апсемплер и декодер LightVAE |
wan2.2_ti2v_5b/ | Общие зависимости Wan2.2-TI2V-5B: видео-VAE, текстовый энкодер UMT5-xxl и токенизатор |
Каталог Wan2.2 можно напрямую взять из Wan-AI/Wan2.2-TI2V-5B, поэтому если вы уже используете Wan2.2, скачивать нужно только три каталога, относящихся к DreamX.
Вывод модели выполняется на чистом Python: у каждого из двух этапов есть собственный requirements.txt и скрипт, запускаемый одной командой. Опции CPU offload и параллелизма по последовательности на нескольких GPU описаны в README-файлах подкаталогов.
Доступность
Для DreamX-Creator пока нет нативной ноды ComfyUI: веса представлены в формате diffusers, а вывод выполняется через официальный репозиторий. Следующей вехой в дорожной карте указаны дистиллированные модели с меньшим числом шагов.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.