Bernini-Diffusers-v2: ByteDanceが動画生成パイプライン全体をオープンソース化
ByteDanceがBernini-Diffusers-v2をリリース: diffusers形式のセマンティックプランニングによる動画生成・編集パイプライン一式。参照誘導編集とOpenS2Vが強化されています。
概要
Berniniは、MLLMベースのセマンティックプランナーとDiTベースのレンダラーを組み合わせた、ByteDanceの動画生成・編集向け統合フレームワークです。フレームを直接生成するのではなく、複雑な指示を明示的なセマンティックプランに分解してから、Wan2.2ベースのdiffusionデコーダーで結果をレンダリングします。この「潜在セマンティックプランニング」により、複雑な生成・編集リクエストに対して高い指示追従性を実現します。
Bernini-Diffusers-v2 は、パイプライン全体を1つの自己完結型diffusersディレクトリにパッケージ化しています。Qwen2.5-VLプランナー、Berniniプランニング重み、Wan2.2 diffusionコンポーネント(テキストエンコーダー、VAE、スケジューラー、デュアルtransformer設定)が含まれます。レンダラーのみのBernini-Rリリースと比較して、マルチステップのセマンティックプランニングや複雑なリクエストの処理が必要な場合に推奨されます。最初のBernini-Diffusersリリース(2026年6月)と比較して、v2は共トレーニングの前にコネクタを数千ステップウォームアップするトレーニング手法を採用しており、参照誘導動画編集とOpenS2Vのパフォーマンスが向上しています。
Berniniのフレームワーク: MLLMベースのセマンティックプランナーが指示をプランに分解し、Wan2.2 DiTレンダラーが動画に変換します。ソース: Berniniプロジェクトページ
対応タスク
Bernini-Diffusers-v2は、Berniniリポジトリ内のすぐに実行できるランチャーを通じて6つのタスクをカバーしています:
| タスク | 説明 |
|---|---|
t2i / i2i | テキストから画像へ、および画像から画像へ |
t2v | テキストから動画へ |
v2v | 動画から動画への編集 |
rv2v | 参照誘導動画編集(参照 + ソース動画) |
r2v | 参照から動画(OpenS2V、単一画像または参照から動画へ) |
ベンチマーク
| モデル | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS) |
|---|---|---|---|---|---|---|
| Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55 |
動画編集において、BerniniはByteDanceの社内アリーナ評価(ブラインド方式の人間によるペアワイズ比較)で、主要なクローズドソース商用モデルの中で第一層に到達しています。
パッケージ構成
本リリースは自己完結型のdiffusers形式ディレクトリです。ダウンロードしたディレクトリをそのまま --config に渡します:
Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder componentsComfyUIサポート
Bernini-Rレンダラーは、Comfy-Orgによる公式のComfyUIサポートがあり、docs.comfy.orgにテキストから動画へ、画像から動画へ、動画編集のワークフローをカバーする専用チュートリアルがあります。本リリースのdiffusers形式ディレクトリは、ComfyUIのスタンダードなLoad Diffusion Modelノードでも読み込めます。
完全なセマンティックプランニングパイプライン(プランナー + レンダラー)については、公式のBerniniリポジトリがPython推論コードを提供しており、シングルGPUおよびマルチGPU(torchrun --ulysses 8)のGradioデモと、scripts/bernini_v2/配下のタスク別実行スクリプト(run_t2i.sh、run_i2i.sh、run_t2v.sh、run_v2v.sh、run_rv2v.sh、run_r2v.sh)が含まれます。
入手方法
hf CLIでモデルをダウンロードします:
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2次に、ディレクトリを --config として渡して推論を実行します:
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
--case assets/testcases/i2i/i2i.json --num_frames 1論文はarXiv:2605.22344で公開されています。
コメント
GitHubでサインインしてディスカッションに参加しましょう。