Bernini-Diffusers-v2: ByteDance открывает полный видеопайплайн
ByteDance выпускает Bernini-Diffusers-v2: пайплайн генерации и редактирования видео с семантическим планированием в формате diffusers, с редактированием по референсу и OpenS2V.
Обзор
Bernini представляет собой унифицированный фреймворк ByteDance для генерации и редактирования видео, который сочетает семантический планировщик на основе MLLM с рендерером на основе DiT. Вместо прямой генерации кадров он сначала разбивает сложные инструкции на явные семантические планы, а затем рендерит результат с помощью декодера diffusion на основе Wan2.2. Такое «латентное семантическое планирование» обеспечивает точное следование инструкциям при выполнении сложных запросов на генерацию и редактирование.
Bernini-Diffusers-v2 упаковывает весь пайплайн в один автономный каталог diffusers: планировщик Qwen2.5-VL, веса планирования Bernini и компоненты diffusion Wan2.2 (текстовый энкодер, VAE, scheduler, конфигурации двух трансформеров). По сравнению с релизами Bernini-R, содержащими только рендерер, эта версия РЕКОМЕНДУЕТСЯ, когда требуется многоэтапное семантическое планирование и более качественная обработка сложных запросов. По сравнению с первым релизом Bernini-Diffusers (июнь 2026 года), в v2 используется рецепт обучения, который прогревает коннектор в течение тысяч шагов ДО совместного обучения, что улучшает редактирование видео по референсу и производительность OpenS2V.
Фреймворк Bernini: семантический планировщик на основе MLLM разбивает инструкции на планы, которые рендерер DiT Wan2.2 превращает в видео. Источник: страница проекта Bernini
Поддерживаемые задачи
Bernini-Diffusers-v2 охватывает шесть задач с помощью готовых к запуску лаунчеров в репозитории Bernini:
| Задача | Описание |
|---|---|
t2i / i2i | Текст-в-изображение и изображение-в-изображение |
t2v | Текст-в-видео |
v2v | Редактирование видео-в-видео |
rv2v | Редактирование видео по референсу (референс + исходное видео) |
r2v | Референс-в-видео (OpenS2V, одно изображение или референс в видео) |
Бенчмарк
| Модель | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS) |
|---|---|---|---|---|---|---|
| Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55 |
В редактировании видео Bernini выходит в первый эшелон среди ведущих коммерческих моделей с закрытым исходным кодом по результатам внутренней оценки ByteDance в формате арены, основанной на слепом попарном сравнении людьми.
Структура пакета
Релиз представляет собой автономный каталог формата diffusers. Передайте скачанный каталог напрямую в параметр --config:
Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder componentsПоддержка ComfyUI
Рендерер Bernini-R имеет официальную поддержку ComfyUI от Comfy-Org, а также отдельный учебник на docs.comfy.org, который охватывает рабочие процессы текст-в-видео, изображение-в-видео и редактирование видео. Каталог формата diffusers из этого релиза также можно загрузить с помощью стандартной ноды Загрузить модель диффузии в ComfyUI.
Для полного пайплайна семантического планирования (планировщик + рендерер) официальный репозиторий Bernini предоставляет код вывода на Python, включая демо Gradio для одной GPU и нескольких GPU (torchrun --ulysses 8), а также скрипты запуска для каждой задачи в каталоге scripts/bernini_v2/ (run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh).
Доступность
Скачать модель с помощью CLI hf:
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2Затем запустите вывод, передав каталог в параметр --config:
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
--case assets/testcases/i2i/i2i.json --num_frames 1Статья доступна на arXiv:2605.22344.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.