FLUX 3: ビデオ、画像、オーディオ、行動予測のためのマルチモーダルフローモデル

ComfyUI Wiki

FLUX 3はBlack Forest Labs初のマルチモーダル基盤モデルで、Self-Flowに基づく統一フローマッチングアーキテクチャ内でビデオ、画像、オーディオ、行動予測を共同学習します。

F

FLUX 3

マルチモーダル動画生成オーディオ生成テキストから画像行動予測

Black Forest Labs初のマルチモーダル基盤モデル — 画像、ビデオ、オーディオ、行動予測を統一アーキテクチャで共同学習。効率的なマルチモーダルアライメントのためのSelf-Flowアプローチを採用。ネイティブオーディオ付きテキストから動画生成、画像から動画、動画から動画、生成型オーディオ継続、高品質テキストから画像生成が可能。

開発元Black Forest Labs
発表日2026-07-23
アーキテクチャマルチモーダルフローマッチング(Self-Flow)
ステータスアーリーアクセス(ビデオ)、近日公開(画像、Dev)
対応機能ビデオ+オーディオ、画像生成、行動予測
主要研究Self-Flow

FLUX 3とは?

FLUX 3はBlack Forest Labsの次世代マルチモーダルモデルで、画像、ビデオ、オーディオを単一の統一アーキテクチャで共同学習します。画像生成のみに特化していた従来のFLUXモデルとは異なり、FLUX 3は物理世界の共有表現を構築します:物体がどのように結合しているか、物事がどのように動くか、イベントがどのように聞こえるか。

単一のモダリティだけでは現実を完全に説明できません。画像はある時点の空間構造をキャプチャし、ビデオは時間的ダイナミクスを復元し、オーディオは因果的な音響関係を明らかにし、言語は知覚と指示を結び付けます。FLUX 3はこれらすべてを同時に学習し、モダリティ間の相互制約を利用して、より一貫性があり物理的に根拠のある出力を生成します。

マルチモーダル生成と理解を効率的に調整するSelf-Flowアプローチに基づいて構築されたFLUX 3は、計算リソースとデータを大幅にスケールアップし、ビデオ、画像、オーディオを同時にトレーニングします。

FLUX 3でできること

ビデオ+オーディオ(FLUX 3 Video — アーリーアクセス開始)

FLUX 3 Videoは、1回の生成で720p解像度、最大20秒の長さのネイティブオーディオ付きの多様なビデオクリップを生成します:

  • テキストから動画生成(同期オーディオ付き)
  • 画像から動画へ(開始フレームまたは視覚参照からのアニメーション)
  • 動画から動画へ(同じキャラクターなど中心要素を新しいシーンに引き継ぐ)
  • 生成型ビデオ-オーディオ継続(入力ビデオとオーディオから)
  • キーフレームから動画(定義された瞬間間の制御された遷移)
  • 多言語対話生成
  • エージェントチェーン(個々のクリップを長いマルチショットシーケンスに連結)
  • 従来の映画的な出力を超えた幅広いビジュアルスタイルとアスペクト比
  • 強力な人間の表情表現、物理的に根拠のあるサウンドイベント関連付け、多言語能力

画像(FLUX 3 Image — アーリーアクセス近日公開)

FLUX 3 Imageは、多様なスタイル、アスペクト比、解像度でのテキストから画像合成と画像編集を提供します。予備評価では、複雑なプロンプト処理とテキスト生成精度(複数言語での高精度テキストレンダリングを含む)において、以前のFLUXバージョンから大幅な改善が見られます。

行動予測(FLUX 3 Action / FLUX-mimic — パートナーアクセス)

FLUX 3の世界理解は、ネイティブ統合(Self-Flowに基づく)と、事前学習済みビデオバックボーンをダイナミクス認識基盤としてファインチューニングすることにより、行動予測にまで拡張されます。mimic roboticsとのパートナーシップにより、FLUX-mimicビデオ行動モデルは、Audiでの巧みな操作と生産展開のための実際の生産タスクでテストされています。

ローンチ計画

機能アクセスステータス
FLUX 3 VideoAPI+プライベートウェイトアクセスアーリーアクセス開始
FLUX 3 ImageAPI+プライベートウェイトアクセスアーリーアクセス近日公開(数週間後)
FLUX 3 Action研究および商用パートナー(mimic)現在パートナー向け
FLUX 3 Devオープンウェイトマルチモーダルバックボーン後日公開

初期評価結果

720p、オーディオ付き10秒テキストから動画クリップの予備的な人間による選好評価:

比較対象選好率
Runway Gen-4.5 vs77% がFLUX 3を好んだ
Grok Imagine Video vs69% がFLUX 3を好んだ
Kling v3 Pro vs60% がFLUX 3を好んだ
Happy Horse v1 vs59% がFLUX 3を好んだ
Happy Horse 1.1 vs57% がFLUX 3を好んだ
Seedance 2.0 vs52% がFLUX 3を好んだ
Luma Ray 3.2 vs93% がFLUX 3を好んだ

|> これらの結果は予備的なものであり、アーリーアクセス期間中にさらなる改善が見込まれています。出典:Black Forest Labs — FLUX 3ブログ投稿

リンク

Guides and workflows related to this model series.

No articles found.

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…