FLUX 3: ビデオ、画像、オーディオ、行動予測のためのマルチモーダルフローモデル
FLUX 3はBlack Forest Labs初のマルチモーダル基盤モデルで、Self-Flowに基づく統一フローマッチングアーキテクチャ内でビデオ、画像、オーディオ、行動予測を共同学習します。
| 開発元 | Black Forest Labs |
| 発表日 | 2026-07-23 |
| アーキテクチャ | マルチモーダルフローマッチング(Self-Flow) |
| ステータス | アーリーアクセス(ビデオ)、近日公開(画像、Dev) |
| 対応機能 | ビデオ+オーディオ、画像生成、行動予測 |
| 主要研究 | Self-Flow |
FLUX 3とは?
FLUX 3はBlack Forest Labsの次世代マルチモーダルモデルで、画像、ビデオ、オーディオを単一の統一アーキテクチャで共同学習します。画像生成のみに特化していた従来のFLUXモデルとは異なり、FLUX 3は物理世界の共有表現を構築します:物体がどのように結合しているか、物事がどのように動くか、イベントがどのように聞こえるか。
単一のモダリティだけでは現実を完全に説明できません。画像はある時点の空間構造をキャプチャし、ビデオは時間的ダイナミクスを復元し、オーディオは因果的な音響関係を明らかにし、言語は知覚と指示を結び付けます。FLUX 3はこれらすべてを同時に学習し、モダリティ間の相互制約を利用して、より一貫性があり物理的に根拠のある出力を生成します。
マルチモーダル生成と理解を効率的に調整するSelf-Flowアプローチに基づいて構築されたFLUX 3は、計算リソースとデータを大幅にスケールアップし、ビデオ、画像、オーディオを同時にトレーニングします。
FLUX 3でできること
ビデオ+オーディオ(FLUX 3 Video — アーリーアクセス開始)
FLUX 3 Videoは、1回の生成で720p解像度、最大20秒の長さのネイティブオーディオ付きの多様なビデオクリップを生成します:
- テキストから動画生成(同期オーディオ付き)
- 画像から動画へ(開始フレームまたは視覚参照からのアニメーション)
- 動画から動画へ(同じキャラクターなど中心要素を新しいシーンに引き継ぐ)
- 生成型ビデオ-オーディオ継続(入力ビデオとオーディオから)
- キーフレームから動画(定義された瞬間間の制御された遷移)
- 多言語対話生成
- エージェントチェーン(個々のクリップを長いマルチショットシーケンスに連結)
- 従来の映画的な出力を超えた幅広いビジュアルスタイルとアスペクト比
- 強力な人間の表情表現、物理的に根拠のあるサウンドイベント関連付け、多言語能力
画像(FLUX 3 Image — アーリーアクセス近日公開)
FLUX 3 Imageは、多様なスタイル、アスペクト比、解像度でのテキストから画像合成と画像編集を提供します。予備評価では、複雑なプロンプト処理とテキスト生成精度(複数言語での高精度テキストレンダリングを含む)において、以前のFLUXバージョンから大幅な改善が見られます。
行動予測(FLUX 3 Action / FLUX-mimic — パートナーアクセス)
FLUX 3の世界理解は、ネイティブ統合(Self-Flowに基づく)と、事前学習済みビデオバックボーンをダイナミクス認識基盤としてファインチューニングすることにより、行動予測にまで拡張されます。mimic roboticsとのパートナーシップにより、FLUX-mimicビデオ行動モデルは、Audiでの巧みな操作と生産展開のための実際の生産タスクでテストされています。
ローンチ計画
| 機能 | アクセス | ステータス |
|---|---|---|
| FLUX 3 Video | API+プライベートウェイトアクセス | アーリーアクセス開始 |
| FLUX 3 Image | API+プライベートウェイトアクセス | アーリーアクセス近日公開(数週間後) |
| FLUX 3 Action | 研究および商用パートナー(mimic) | 現在パートナー向け |
| FLUX 3 Dev | オープンウェイトマルチモーダルバックボーン | 後日公開 |
初期評価結果
720p、オーディオ付き10秒テキストから動画クリップの予備的な人間による選好評価:
| 比較対象 | 選好率 |
|---|---|
| Runway Gen-4.5 vs | 77% がFLUX 3を好んだ |
| Grok Imagine Video vs | 69% がFLUX 3を好んだ |
| Kling v3 Pro vs | 60% がFLUX 3を好んだ |
| Happy Horse v1 vs | 59% がFLUX 3を好んだ |
| Happy Horse 1.1 vs | 57% がFLUX 3を好んだ |
| Seedance 2.0 vs | 52% がFLUX 3を好んだ |
| Luma Ray 3.2 vs | 93% がFLUX 3を好んだ |
|> これらの結果は予備的なものであり、アーリーアクセス期間中にさらなる改善が見込まれています。出典:Black Forest Labs — FLUX 3ブログ投稿。
リンク
Guides and workflows related to this model series.
コメント
GitHubでサインインしてディスカッションに参加しましょう。