Bernini: ByteDanceのセマンティックプランニング動画フレームワーク
ComfyUI Wiki
BerniniはByteDanceのオープンな動画生成・編集フレームワークです。言語モデルによるセマンティックプランナーとWan2.2ベースの動画レンダラーで構成され、Apache-2.0で公開されています。
B
Bernini by ByteDance
Video GenerationVideo EditingDiTByteDanceBerniniは、ByteDanceによるオープンな動画生成・編集フレームワークです。マルチモーダル言語モデルがセマンティックプランナーとしてショットプランを書き、拡散トランスフォーマーのレンダラーがそのプランを動画に変換します。同じパイプラインでテキストから動画へ、参照から動画、動画編集、美的転送までをカバーし、ComfyUI向けにdiffusers形式で提供されています。
| 開発元 | ByteDance |
| アーキテクチャ | セマンティックプランナー(マルチモーダルLLM)+ Wan2.1/2.2バックボーン上のDiT動画レンダラー |
| ライセンス | Apache-2.0 |
| 生成モード | テキストから動画へ、参照から動画、動画編集、美的転送 |
| 精度 | fp16、fp8、int8、MXFP8、NVFP4(リリースおよびComfyUIパックごとに異なります) |
バリアント
| バリアント | 説明 | ライセンス | 公開 |
|---|---|---|---|
| Bernini-R | DiT動画レンダラーコンポーネント: MLLMセマンティックプランナーと、生成および編集のためのWan2.1/2.2レンダラー | Apache-2.0 | 2026-06 |
| Bernini v2 | diffusers形式の完全なセマンティックプランニングパイプライン: Qwen2.5-VLプランナー、Wan2.2デュアルDiTレンダラー、より強力な参照ガイド付き編集 | Apache-2.0 | 2026-08 |
厳選された重みのダウンロード、チュートリアル、関連情報については、上記のバリアントを選択してください。
Berniniでできること
- セマンティックプランニング: マルチモーダル言語モデルが、レンダリング前にプロンプトと参照画像を明示的なショットプランに変換するため、複数被写体のシーンや編集を狙いどおりに保てます。
- 1つのパイプラインで多数のタスク: テキストから動画へ、参照から動画、動画から動画への編集、参照ガイド付き編集、美的転送は、すべて同じプランナーとレンダラーを通して実行されます。
- diffusers優先のリリース: ByteDanceはパイプラインをdiffusers形式で公開しているため、標準的なツールで読み込むことができ、コミュニティによってComfyUI向けに再パッケージ化されています。
ComfyUI サポート
Berniniは、ファーストパーティのノードパックではなく、コミュニティによる再パッケージ化を通じてComfyUIで利用できます。Bernini-v2-ComfyUI パックは、FP8とNVFP4の重み、および6つのサポート対象タスクをカバーする単一のワークフローを提供します。
コメント
GitHubでサインインしてディスカッションに参加しましょう。