FLUX 3:Black Forest Labsのマルチモーダルビデオ、オーディオ、画像モデル
Black Forest LabsがFLUX 3を発表。統合マルチモーダル基盤モデルで、20秒のビデオとネイティブオーディオ、画像生成、ロボット工学向けアクション予測を実現。
Black Forest Labsは、画像、動画、音声を統合アーキテクチャで共同訓練した新しいマルチモーダル基盤モデルFLUX 3を発表しました。このモデルは、ネイティブ音声付きの20秒動画クリップを生成し、さまざまなスタイルの画像を合成・編集し、ロボット工学のアクション予測にも対応します。
FLUX 3デモ:ネイティブ音声付きマルチモーダル動画生成(出典:BFLブログ)
FLUX 3の仕組み
FLUX 3はBFLのSelf-Flowアプローチに基づいており、マルチモーダル生成と理解を同一の基盤アーキテクチャ内で整合させます。各メディアタイプを個別のタスクとして扱うのではなく、画像、ビデオ、オーディオを同時に学習します。音は衝撃に一致し、動きは物理法則に従い、未来は過去から導かれなければなりません。
ビデオ機能
FLUX 3 Videoは、テキストプロンプト、画像、または既存のビデオから、ネイティブオーディオ付きで最大20秒のクリップを生成できます。主な機能は以下の通りです。
- テキストから動画への生成(ネイティブオーディオ付き)
- 画像から動画へ(開始フレームからのアニメーション、または画像を視覚的参照として使用)
- 動画から動画へ(ソースクリップから新しいシーンへ中心要素を引き継ぎ)
- 入力ビデオとオーディオからの生成的な継続
- キーフレームから動画へ(定義された瞬間間の制御された遷移)
- 多言語ダイアログ生成
- 個々のクリップを長いマルチショットシーケンスに連結するエージェント的チェーン
- 強力なタイポグラフィ生成とアニメーションデザイン
予備評価では、FLUX 3 VideoはGrok Imagine Videoとの比較で最大69%、Kling v3 Proで60%、Runway Gen-4.5で77%、Luma Ray 3.2で93%のケースで優先されました。このモデルは特に、人間の表情の捉え方、音と物理的イベントの関連付け、多言語能力に優れています。
画像機能
FLUX 3は、さまざまなスタイル、アスペクト比、解像度にわたって画像を生成・編集できます。初期の評価では、複雑なプロンプト処理と多言語テキストレンダリングにおいて、以前のFLUXバージョンから大幅に改善されています。FLUX 3 Imageの早期アクセスは数週間以内に提供される予定です。
アクション予測
FLUX 3の世界理解はアクション予測にも及びます。BFLはmimic roboticsと協力してFLUX-mimicを開発し、FLUX 3のビデオバックボーンとロボット学習を組み合わせて器用な操作を実現しています。Audiは生産タスク向けにこのシステムをテストしており、一部のタスクはわずか30分のロボットデータでファインチューニングされています。
利用可能性
FLUX 3 VideoとFLUX 3 Actionは早期アクセスを通じて利用可能です。Black Forest Labsは、年内にAPIアクセス、プライベートモデルウェイト、およびオープンウェイトのFLUX 3 Devバージョンをリリースする予定です。
現時点では、FLUX 3のネイティブComfyUIサポートはまだありません。公式BFL APIまたは早期アクセスプログラムが必要です。
コメント
GitHubでサインインしてディスカッションに参加しましょう。