Bernini: ByteDanceのセマンティックプランニング動画フレームワーク

ComfyUI Wiki

BerniniはByteDanceのオープンな動画生成・編集フレームワークです。言語モデルによるセマンティックプランナーとWan2.2ベースの動画レンダラーで構成され、Apache-2.0で公開されています。

B

Bernini by ByteDance

Video GenerationVideo EditingDiTByteDance

Berniniは、ByteDanceによるオープンな動画生成・編集フレームワークです。マルチモーダル言語モデルがセマンティックプランナーとしてショットプランを書き、拡散トランスフォーマーのレンダラーがそのプランを動画に変換します。同じパイプラインでテキストから動画へ、参照から動画、動画編集、美的転送までをカバーし、ComfyUI向けにdiffusers形式で提供されています。

開発元ByteDance
アーキテクチャセマンティックプランナー(マルチモーダルLLM)+ Wan2.1/2.2バックボーン上のDiT動画レンダラー
ライセンスApache-2.0
生成モードテキストから動画へ、参照から動画、動画編集、美的転送
精度fp16、fp8、int8、MXFP8、NVFP4(リリースおよびComfyUIパックごとに異なります)

バリアント

バリアント説明ライセンス公開
Bernini-RDiT動画レンダラーコンポーネント: MLLMセマンティックプランナーと、生成および編集のためのWan2.1/2.2レンダラーApache-2.02026-06
Bernini v2diffusers形式の完全なセマンティックプランニングパイプライン: Qwen2.5-VLプランナー、Wan2.2デュアルDiTレンダラー、より強力な参照ガイド付き編集Apache-2.02026-08

厳選された重みのダウンロード、チュートリアル、関連情報については、上記のバリアントを選択してください。

Berniniでできること

  • セマンティックプランニング: マルチモーダル言語モデルが、レンダリング前にプロンプトと参照画像を明示的なショットプランに変換するため、複数被写体のシーンや編集を狙いどおりに保てます。
  • 1つのパイプラインで多数のタスク: テキストから動画へ、参照から動画、動画から動画への編集、参照ガイド付き編集、美的転送は、すべて同じプランナーとレンダラーを通して実行されます。
  • diffusers優先のリリース: ByteDanceはパイプラインをdiffusers形式で公開しているため、標準的なツールで読み込むことができ、コミュニティによってComfyUI向けに再パッケージ化されています。

ComfyUI サポート

Berniniは、ファーストパーティのノードパックではなく、コミュニティによる再パッケージ化を通じてComfyUIで利用できます。Bernini-v2-ComfyUI パックは、FP8とNVFP4の重み、および6つのサポート対象タスクをカバーする単一のワークフローを提供します。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…