Bernini-Diffusers-v2: ByteDanceが動画生成パイプライン全体をオープンソース化

ComfyUI Wikinews

ByteDanceがBernini-Diffusers-v2をリリース: diffusers形式のセマンティックプランニングによる動画生成・編集パイプライン一式。参照誘導編集とOpenS2Vが強化されています。

Bernini-Diffusers-v2 (HuggingFace | GitHub | プロジェクトページ) はByteDanceの新リリースです。Berniniの動画生成・編集パイプライン一式を自己完結型のdiffusers形式ディレクトリとしてパッケージ化し、MLLMセマンティックプランナー、Berniniプランニング重み、Wan2.2 diffusionコンポーネントを1つのチェックポイントにバンドルしています。

概要

Berniniは、MLLMベースのセマンティックプランナーとDiTベースのレンダラーを組み合わせた、ByteDanceの動画生成・編集向け統合フレームワークです。フレームを直接生成するのではなく、複雑な指示を明示的なセマンティックプランに分解してから、Wan2.2ベースのdiffusionデコーダーで結果をレンダリングします。この「潜在セマンティックプランニング」により、複雑な生成・編集リクエストに対して高い指示追従性を実現します。

Bernini-Diffusers-v2 は、パイプライン全体を1つの自己完結型diffusersディレクトリにパッケージ化しています。Qwen2.5-VLプランナー、Berniniプランニング重み、Wan2.2 diffusionコンポーネント(テキストエンコーダー、VAE、スケジューラー、デュアルtransformer設定)が含まれます。レンダラーのみのBernini-Rリリースと比較して、マルチステップのセマンティックプランニングや複雑なリクエストの処理が必要な場合に推奨されます。最初のBernini-Diffusersリリース(2026年6月)と比較して、v2は共トレーニングの前にコネクタを数千ステップウォームアップするトレーニング手法を採用しており、参照誘導動画編集OpenS2Vのパフォーマンスが向上しています。

Berniniフレームワーク: MLLMセマンティックプランナー + Wan2.2 DiTレンダラー

Berniniのフレームワーク: MLLMベースのセマンティックプランナーが指示をプランに分解し、Wan2.2 DiTレンダラーが動画に変換します。ソース: Berniniプロジェクトページ

対応タスク

Bernini-Diffusers-v2は、Berniniリポジトリ内のすぐに実行できるランチャーを通じて6つのタスクをカバーしています:

タスク説明
t2i / i2iテキストから画像へ、および画像から画像へ
t2vテキストから動画へ
v2v動画から動画への編集
rv2v参照誘導動画編集(参照 + ソース動画)
r2v参照から動画(OpenS2V、単一画像または参照から動画へ)

ベンチマーク

モデルEditVerseOpenVEOpenS2VVBenchBernini-v2v (OS)Bernini-rv2v (OS)
Bernini-v2 7+14B8.023.9663.8384.463.493.55

動画編集において、BerniniはByteDanceの社内アリーナ評価(ブラインド方式の人間によるペアワイズ比較)で、主要なクローズドソース商用モデルの中で第一層に到達しています。

パッケージ構成

本リリースは自己完結型のdiffusers形式ディレクトリです。ダウンロードしたディレクトリをそのまま --config に渡します:

Bernini-Diffusers-v2/
  bernini/          # Bernini planning checkpoint
  mllm/             # Qwen2.5-VL planner assets
  scheduler/        # base diffusion modules
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json   # Wan2.2 diffusion decoder components

ComfyUIサポート

Bernini-Rレンダラーは、Comfy-Orgによる公式のComfyUIサポートがあり、docs.comfy.orgにテキストから動画へ、画像から動画へ、動画編集のワークフローをカバーする専用チュートリアルがあります。本リリースのdiffusers形式ディレクトリは、ComfyUIのスタンダードなLoad Diffusion Modelノードでも読み込めます。

完全なセマンティックプランニングパイプライン(プランナー + レンダラー)については、公式のBerniniリポジトリがPython推論コードを提供しており、シングルGPUおよびマルチGPU(torchrun --ulysses 8)のGradioデモと、scripts/bernini_v2/配下のタスク別実行スクリプト(run_t2i.shrun_i2i.shrun_t2v.shrun_v2v.shrun_rv2v.shrun_r2v.sh)が含まれます。

入手方法

hf CLIでモデルをダウンロードします:

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2

次に、ディレクトリを --config として渡して推論を実行します:

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

論文はarXiv:2605.22344で公開されています。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Bernini-Diffusers-v2: ByteDanceが動画生成パイプライン全体をオープンソース化 | ComfyUI Wiki