Bernini v2 в ComfyUI через Пользовательские ноды
rzgar упаковал планировщик Bernini-Diffusers-v2 от ByteDance и рендерер Wan2.2 в ноды ComfyUI с весами FP8 и NVFP4.
Обзор
Полный Bernini v2 pipeline ранее можно было запустить только через официальный код diffusers от ByteDance. Пакет ComfyUI преобразует его в узловой рабочий процесс: дообученный планировщик Qwen2.5-VL с коннектором и декодер ViT в стиле MaskGIT преобразуют текст и визуальные данные источника в токены семантического плана, затем два совместно обученных Wan2.2 DiT (высокий шум и низкий шум, переключение на 0.875) рендерят видео, внедряя медиа источника как контекстные latents.
Планирование и рендеринг Bernini v2 pipeline работают как Пользовательские узлы ComfyUI. Источник: rzgar/Bernini-v2-ComfyUI
Шесть задач, один Рабочий процесс
Выбор задачи автоматический и зависит от того, какие входные медиа прикреплёны:
| Connected inputs | Task |
|---|---|
| None | Текст-в-видео (t2v) |
| Reference images only | Опора-в-видео (r2v) |
| Source video | Видео-в-видео редактирование (v2v) |
| Source video + reference images | Редактирование с опорой (rv2v) |
| Source video + reference video | Передача эстетического направления (ads2v) |
РЕКОМЕНДУЕМЫЕ Настройки: CFG 3, 16–50 шагов, семплеры UniPC / DPMPP_2M / EULER.
Файлы моделей
Пакет включает квантования FP8-scaled и NVFP4 обоих DiT, а также ассеты планировщика (MLLM, коннектор, ViT decoder, токены маски), которые размещаются в models/text_encoders/. Planner tokenizer и конфиги processor предоставлены отдельным zip в репозитории. Все компоненты перечислены на странице модели.
Предыстория: Bernini v2
ByteDance открыла исходный код полного фреймворка Bernini в июне 2026 года и упаковала его как Bernini-Diffusers-v2 13 августа. Рецепт обучения v2 разогревает коннектор тысячи шагов ДО совместного обучения, что улучшило редактирование с опорой и баллы OpenS2V (63.83) по сравнению с первым релизом diffusers. Во внутреннем слепом арене ByteDance Bernini занимает первое место среди коммерческих моделей с закрытым исходным кодом в области редактирования видео.
Фреймворк Bernini: семантический планировщик MLLM разбивает инструкции, рендерер Wan2.2 DiT создаёт видео. Источник: Страница проекта Bernini
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.