Bernini-Diffusers-v2: ByteDance открывает полный видеопайплайн

ComfyUI Wikinews

ByteDance выпускает Bernini-Diffusers-v2: пайплайн генерации и редактирования видео с семантическим планированием в формате diffusers, с редактированием по референсу и OpenS2V.

Bernini-Diffusers-v2 (HuggingFace | GitHub | Страница проекта) представляет собой новый релиз ByteDance: полный пайплайн генерации и редактирования видео Bernini, упакованный в автономный каталог формата diffusers, который объединяет семантический планировщик MLLM, веса планирования Bernini и компоненты diffusion Wan2.2 в одном checkpoint.

Обзор

Bernini представляет собой унифицированный фреймворк ByteDance для генерации и редактирования видео, который сочетает семантический планировщик на основе MLLM с рендерером на основе DiT. Вместо прямой генерации кадров он сначала разбивает сложные инструкции на явные семантические планы, а затем рендерит результат с помощью декодера diffusion на основе Wan2.2. Такое «латентное семантическое планирование» обеспечивает точное следование инструкциям при выполнении сложных запросов на генерацию и редактирование.

Bernini-Diffusers-v2 упаковывает весь пайплайн в один автономный каталог diffusers: планировщик Qwen2.5-VL, веса планирования Bernini и компоненты diffusion Wan2.2 (текстовый энкодер, VAE, scheduler, конфигурации двух трансформеров). По сравнению с релизами Bernini-R, содержащими только рендерер, эта версия РЕКОМЕНДУЕТСЯ, когда требуется многоэтапное семантическое планирование и более качественная обработка сложных запросов. По сравнению с первым релизом Bernini-Diffusers (июнь 2026 года), в v2 используется рецепт обучения, который прогревает коннектор в течение тысяч шагов ДО совместного обучения, что улучшает редактирование видео по референсу и производительность OpenS2V.

Фреймворк Bernini: семантический планировщик MLLM + рендерер DiT Wan2.2

Фреймворк Bernini: семантический планировщик на основе MLLM разбивает инструкции на планы, которые рендерер DiT Wan2.2 превращает в видео. Источник: страница проекта Bernini

Поддерживаемые задачи

Bernini-Diffusers-v2 охватывает шесть задач с помощью готовых к запуску лаунчеров в репозитории Bernini:

ЗадачаОписание
t2i / i2iТекст-в-изображение и изображение-в-изображение
t2vТекст-в-видео
v2vРедактирование видео-в-видео
rv2vРедактирование видео по референсу (референс + исходное видео)
r2vРеференс-в-видео (OpenS2V, одно изображение или референс в видео)

Бенчмарк

МодельEditVerseOpenVEOpenS2VVBenchBernini-v2v (OS)Bernini-rv2v (OS)
Bernini-v2 7+14B8.023.9663.8384.463.493.55

В редактировании видео Bernini выходит в первый эшелон среди ведущих коммерческих моделей с закрытым исходным кодом по результатам внутренней оценки ByteDance в формате арены, основанной на слепом попарном сравнении людьми.

Структура пакета

Релиз представляет собой автономный каталог формата diffusers. Передайте скачанный каталог напрямую в параметр --config:

Bernini-Diffusers-v2/
  bernini/          # Bernini planning checkpoint
  mllm/             # Qwen2.5-VL planner assets
  scheduler/        # base diffusion modules
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json   # Wan2.2 diffusion decoder components

Поддержка ComfyUI

Рендерер Bernini-R имеет официальную поддержку ComfyUI от Comfy-Org, а также отдельный учебник на docs.comfy.org, который охватывает рабочие процессы текст-в-видео, изображение-в-видео и редактирование видео. Каталог формата diffusers из этого релиза также можно загрузить с помощью стандартной ноды Загрузить модель диффузии в ComfyUI.

Для полного пайплайна семантического планирования (планировщик + рендерер) официальный репозиторий Bernini предоставляет код вывода на Python, включая демо Gradio для одной GPU и нескольких GPU (torchrun --ulysses 8), а также скрипты запуска для каждой задачи в каталоге scripts/bernini_v2/ (run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh).

Доступность

Скачать модель с помощью CLI hf:

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2

Затем запустите вывод, передав каталог в параметр --config:

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

Статья доступна на arXiv:2605.22344.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Bernini-Diffusers-v2: ByteDance открывает полный видеопайплайн | ComfyUI Wiki