Bernini v2 通过自定义节点登陆 ComfyUI:六任务工作流指南
rzgar 将字节跳动的 Bernini-Diffusers-v2 语义规划器和 Wan2.2 渲染器打包为 ComfyUI 自定义节点,包含 FP8 和 NVFP4 权重及一个适用于六项任务的单一工作流。
概述
完整的 Bernini v2 pipeline 此前只能通过字节跳动的官方 diffusers 代码运行。ComfyUI 包将其转换为基于节点的工作流:经过微调的 Qwen2.5-VL 规划器配合连接器以及 MaskGIT 风格的 ViT 解码器将文本加来源视觉转化为语义计划令牌,随后两个协同训练的 Wan2.2 DiTs(高噪波和低噪波,在 0.875 处切换)渲染视频,并将来源媒体作为上下文 latent 注入。
Bernini v2 规划和渲染 pipeline 作为 ComfyUI 自定义节点运行。来源:rzgar/Bernini-v2-ComfyUI
六项任务,一个工作流
任务选择是自动的,基于哪些媒体输入已连接:
| Connected inputs | Task |
|---|---|
| 无 | 文生视频 (t2v) |
| 仅参考图像 | 参考生视频 (r2v) |
| 来源视频 | 视频转视频编辑 (v2v) |
| 来源视频 + 参考图像 | 参考引导编辑 (rv2v) |
| 来源视频 + 参考视频 | 美学方向转移 (ads2v) |
推荐设置:CFG 3,16 到 50 步,UniPC / DPMPP_2M / EULER samplers。
模型文件
该包附带两个 DiTs 的 FP8 缩放和 NVFP4 量化版本,以及需要放入 models/text_encoders/ 下的规划器资产(MLLM、连接器、ViT 解码器、遮罩令牌)。规划器的 tokenizer 和处理器配置作为单独的 zip 提供在仓库中。所有组件均列于 模型页面。
背景:Bernini v2
字节跳动于 2026 年 6 月开源了完整的 Bernini 框架,并于 8 月 13 日将其打包为 Bernini-Diffusers-v2。v2 训练配方在协同训练之前预热连接器数千步,这改进了参考引导编辑和 OpenS2V 评分(63.83),优于首个 diffusers 发布版。在字节跳动的内部盲测竞技场中,Bernini 在闭源商业模型的 video editing 中位列第一梯队。
Bernini 框架:MLLM 语义规划器分解指令,Wan2.2 DiT 渲染器生成视频。来源:Bernini 项目页面
评论
使用 GitHub 登录后即可参与讨论。