Bernini v2 通过自定义节点登陆 ComfyUI:六任务工作流指南

ComfyUI Wikinews

rzgar 将字节跳动的 Bernini-Diffusers-v2 语义规划器和 Wan2.2 渲染器打包为 ComfyUI 自定义节点,包含 FP8 和 NVFP4 权重及一个适用于六项任务的单一工作流。

社区开发者 rzgar 已将字节跳动的完整 Bernini-Diffusers-v2 pipeline 打包为 ComfyUI 节点包:rzgar/Bernini-v2-ComfyUI。该发布版捆绑了语义规划器、Wan2.2 双 DiT 渲染器以及一个根据输入连接推断任务的单一工作流。来源:Hugging Face 仓库 README,Banodoco #ltx_chatter。

概述

完整的 Bernini v2 pipeline 此前只能通过字节跳动的官方 diffusers 代码运行。ComfyUI 包将其转换为基于节点的工作流:经过微调的 Qwen2.5-VL 规划器配合连接器以及 MaskGIT 风格的 ViT 解码器将文本加来源视觉转化为语义计划令牌,随后两个协同训练的 Wan2.2 DiTs(高噪波和低噪波,在 0.875 处切换)渲染视频,并将来源媒体作为上下文 latent 注入。

Bernini v2 自定义节点工作流在 ComfyUI

Bernini v2 规划和渲染 pipeline 作为 ComfyUI 自定义节点运行。来源:rzgar/Bernini-v2-ComfyUI

六项任务,一个工作流

任务选择是自动的,基于哪些媒体输入已连接:

Connected inputsTask
文生视频 (t2v)
仅参考图像参考生视频 (r2v)
来源视频视频转视频编辑 (v2v)
来源视频 + 参考图像参考引导编辑 (rv2v)
来源视频 + 参考视频美学方向转移 (ads2v)

推荐设置:CFG 3,16 到 50 步,UniPC / DPMPP_2M / EULER samplers。

模型文件

该包附带两个 DiTs 的 FP8 缩放和 NVFP4 量化版本,以及需要放入 models/text_encoders/ 下的规划器资产(MLLM、连接器、ViT 解码器、遮罩令牌)。规划器的 tokenizer 和处理器配置作为单独的 zip 提供在仓库中。所有组件均列于 模型页面

背景:Bernini v2

字节跳动于 2026 年 6 月开源了完整的 Bernini 框架,并于 8 月 13 日将其打包为 Bernini-Diffusers-v2。v2 训练配方在协同训练之前预热连接器数千步,这改进了参考引导编辑和 OpenS2V 评分(63.83),优于首个 diffusers 发布版。在字节跳动的内部盲测竞技场中,Bernini 在闭源商业模型的 video editing 中位列第一梯队。

Bernini 框架图

Bernini 框架:MLLM 语义规划器分解指令,Wan2.2 DiT 渲染器生成视频。来源:Bernini 项目页面

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
Bernini v2 通过自定义节点登陆 ComfyUI:六任务工作流指南 | ComfyUI Wiki