Bernini-Diffusers-v2:字节跳动开源完整视频流水线
字节跳动发布 Bernini-Diffusers-v2:采用 diffusers 格式的完整语义规划视频生成与编辑流水线,具备更强的参考引导编辑与 OpenS2V 能力。
概述
Bernini 是字节跳动面向视频生成与编辑的统一框架,它将基于 MLLM 的语义规划器与基于 DiT 的渲染器相结合。它不会直接生成帧,而是先将复杂的指令分解为明确的语义规划,再通过基于 Wan2.2 的扩散解码器渲染出结果。这种“Latent 语义规划”使其在处理复杂的生成与编辑请求时具备强大的指令遵循能力。
Bernini-Diffusers-v2 将整个流水线打包在一个自包含的 diffusers 目录中:包含 Qwen2.5-VL 规划器、Bernini 规划权重以及 Wan2.2 扩散组件(文本编码器、VAE、scheduler、双 transformer 配置)。与仅包含渲染器的 Bernini-R 版本相比,当您需要多步语义规划和更好地处理复杂请求时,推荐使用此版本。与首个 Bernini-Diffusers 版本(2026 年 6 月)相比,v2 采用了新的训练方案:在联合训练之前,先用数千步对连接器进行预热,从而提升了参考引导视频编辑和 OpenS2V 的性能。
Bernini 框架:基于 MLLM 的语义规划器将指令分解为规划,再由 Wan2.2 DiT 渲染器将其转化为视频。来源:Bernini 项目主页
使用例
Bernini-Diffusers-v2 可通过 Bernini 仓库 中开箱即用的启动脚本运行六种使用例:
| 使用例 | 描述 |
|---|---|
t2i / i2i | 文生图与图生图 |
t2v | 文生视频 |
v2v | 视频转视频编辑 |
rv2v | 参考引导视频编辑(参考 + 源视频) |
r2v | 参考生视频(OpenS2V,单张图像或参考图生成视频) |
基准测试
| 模型 | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS) |
|---|---|---|---|---|---|---|
| Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55 |
在视频编辑方面,根据字节跳动内部基于盲测人工两两对比的竞技场评估,Bernini 在领先的闭源商业模型中达到了第一梯队水平。
包结构
该版本是一个自包含的 diffusers 格式目录。将下载的目录直接传给 --config:
Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder componentsComfyUI 支持
Bernini-R 渲染器获得了 Comfy-Org 提供的官方 ComfyUI 支持,在 docs.comfy.org 上有专门的教程,涵盖文生视频、图生视频和视频编辑工作流。此版本中的 diffusers 格式目录也可以使用 ComfyUI 的标准 UNet加载器 节点加载。
对于完整的语义规划流水线(规划器 + 渲染器),官方 Bernini 仓库 提供了 Python 推理代码,包括单 GPU 和多 GPU(torchrun --ulysses 8)的 Gradio 演示,以及 scripts/bernini_v2/ 目录下各使用例对应的运行脚本(run_t2i.sh、run_i2i.sh、run_t2v.sh、run_v2v.sh、run_rv2v.sh、run_r2v.sh)。
获取方式
使用 hf 命令行工具下载模型:
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2然后将该目录作为 --config 传入以运行推理:
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
--case assets/testcases/i2i/i2i.json --num_frames 1论文可在 arXiv:2605.22344 查看。
评论
使用 GitHub 登录后即可参与讨论。