Bernini-Diffusers-v2:字节跳动开源完整视频流水线

ComfyUI Wikinews

字节跳动发布 Bernini-Diffusers-v2:采用 diffusers 格式的完整语义规划视频生成与编辑流水线,具备更强的参考引导编辑与 OpenS2V 能力。

Bernini-Diffusers-v2HuggingFace | GitHub | 项目主页)是字节跳动发布的新版本:完整的 Bernini 视频生成与编辑流水线,打包为自包含的 diffusers 格式目录,将 MLLM 语义规划器、Bernini 规划权重和 Wan2.2 扩散组件整合在同一个 checkpoint 中。

概述

Bernini 是字节跳动面向视频生成与编辑的统一框架,它将基于 MLLM 的语义规划器与基于 DiT 的渲染器相结合。它不会直接生成帧,而是先将复杂的指令分解为明确的语义规划,再通过基于 Wan2.2 的扩散解码器渲染出结果。这种“Latent 语义规划”使其在处理复杂的生成与编辑请求时具备强大的指令遵循能力。

Bernini-Diffusers-v2 将整个流水线打包在一个自包含的 diffusers 目录中:包含 Qwen2.5-VL 规划器、Bernini 规划权重以及 Wan2.2 扩散组件(文本编码器、VAE、scheduler、双 transformer 配置)。与仅包含渲染器的 Bernini-R 版本相比,当您需要多步语义规划和更好地处理复杂请求时,推荐使用此版本。与首个 Bernini-Diffusers 版本(2026 年 6 月)相比,v2 采用了新的训练方案:在联合训练之前,先用数千步对连接器进行预热,从而提升了参考引导视频编辑OpenS2V 的性能。

Bernini 框架:MLLM 语义规划器 + Wan2.2 DiT 渲染器

Bernini 框架:基于 MLLM 的语义规划器将指令分解为规划,再由 Wan2.2 DiT 渲染器将其转化为视频。来源:Bernini 项目主页

使用例

Bernini-Diffusers-v2 可通过 Bernini 仓库 中开箱即用的启动脚本运行六种使用例:

使用例描述
t2i / i2i文生图与图生图
t2v文生视频
v2v视频转视频编辑
rv2v参考引导视频编辑(参考 + 源视频)
r2v参考生视频(OpenS2V,单张图像或参考图生成视频)

基准测试

模型EditVerseOpenVEOpenS2VVBenchBernini-v2v (OS)Bernini-rv2v (OS)
Bernini-v2 7+14B8.023.9663.8384.463.493.55

在视频编辑方面,根据字节跳动内部基于盲测人工两两对比的竞技场评估,Bernini 在领先的闭源商业模型中达到了第一梯队水平。

包结构

该版本是一个自包含的 diffusers 格式目录。将下载的目录直接传给 --config

Bernini-Diffusers-v2/
  bernini/          # Bernini planning checkpoint
  mllm/             # Qwen2.5-VL planner assets
  scheduler/        # base diffusion modules
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json   # Wan2.2 diffusion decoder components

ComfyUI 支持

Bernini-R 渲染器获得了 Comfy-Org 提供的官方 ComfyUI 支持,在 docs.comfy.org 上有专门的教程,涵盖文生视频、图生视频和视频编辑工作流。此版本中的 diffusers 格式目录也可以使用 ComfyUI 的标准 UNet加载器 节点加载。

对于完整的语义规划流水线(规划器 + 渲染器),官方 Bernini 仓库 提供了 Python 推理代码,包括单 GPU 和多 GPU(torchrun --ulysses 8)的 Gradio 演示,以及 scripts/bernini_v2/ 目录下各使用例对应的运行脚本(run_t2i.shrun_i2i.shrun_t2v.shrun_v2v.shrun_rv2v.shrun_r2v.sh)。

获取方式

使用 hf 命令行工具下载模型:

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2

然后将该目录作为 --config 传入以运行推理:

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

论文可在 arXiv:2605.22344 查看。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Bernini-Diffusers-v2:字节跳动开源完整视频流水线 | ComfyUI Wiki