FLUX 3:Black Forest Labsのマルチモーダルビデオ、オーディオ、画像モデル

news

Black Forest LabsがFLUX 3を発表。統合マルチモーダル基盤モデルで、20秒のビデオとネイティブオーディオ、画像生成、ロボット工学向けアクション予測を実現。

Black Forest Labsは、画像、動画、音声を統合アーキテクチャで共同訓練した新しいマルチモーダル基盤モデルFLUX 3を発表しました。このモデルは、ネイティブ音声付きの20秒動画クリップを生成し、さまざまなスタイルの画像を合成・編集し、ロボット工学のアクション予測にも対応します。

FLUX 3デモ:ネイティブ音声付きマルチモーダル動画生成(出典:BFLブログ)

FLUX 3の仕組み

FLUX 3はBFLのSelf-Flowアプローチに基づいており、マルチモーダル生成と理解を同一の基盤アーキテクチャ内で整合させます。各メディアタイプを個別のタスクとして扱うのではなく、画像、ビデオ、オーディオを同時に学習します。音は衝撃に一致し、動きは物理法則に従い、未来は過去から導かれなければなりません。

FLUX 3 アーキテクチャ概要

ビデオ機能

FLUX 3 Videoは、テキストプロンプト、画像、または既存のビデオから、ネイティブオーディオ付きで最大20秒のクリップを生成できます。主な機能は以下の通りです。

  • テキストから動画への生成(ネイティブオーディオ付き)
  • 画像から動画へ(開始フレームからのアニメーション、または画像を視覚的参照として使用)
  • 動画から動画へ(ソースクリップから新しいシーンへ中心要素を引き継ぎ)
  • 入力ビデオとオーディオからの生成的な継続
  • キーフレームから動画へ(定義された瞬間間の制御された遷移)
  • 多言語ダイアログ生成
  • 個々のクリップを長いマルチショットシーケンスに連結するエージェント的チェーン
  • 強力なタイポグラフィ生成とアニメーションデザイン

予備評価では、FLUX 3 VideoはGrok Imagine Videoとの比較で最大69%、Kling v3 Proで60%、Runway Gen-4.5で77%、Luma Ray 3.2で93%のケースで優先されました。このモデルは特に、人間の表情の捉え方、音と物理的イベントの関連付け、多言語能力に優れています。

画像機能

FLUX 3は、さまざまなスタイル、アスペクト比、解像度にわたって画像を生成・編集できます。初期の評価では、複雑なプロンプト処理と多言語テキストレンダリングにおいて、以前のFLUXバージョンから大幅に改善されています。FLUX 3 Imageの早期アクセスは数週間以内に提供される予定です。

アクション予測

FLUX 3の世界理解はアクション予測にも及びます。BFLはmimic roboticsと協力してFLUX-mimicを開発し、FLUX 3のビデオバックボーンとロボット学習を組み合わせて器用な操作を実現しています。Audiは生産タスク向けにこのシステムをテストしており、一部のタスクはわずか30分のロボットデータでファインチューニングされています。

利用可能性

FLUX 3 VideoとFLUX 3 Actionは早期アクセスを通じて利用可能です。Black Forest Labsは、年内にAPIアクセス、プライベートモデルウェイト、およびオープンウェイトのFLUX 3 Devバージョンをリリースする予定です。

FLUX 3早期アクセスをリクエスト

現時点では、FLUX 3のネイティブComfyUIサポートはまだありません。公式BFL APIまたは早期アクセスプログラムが必要です。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
FLUX 3:Black Forest Labsのマルチモーダルビデオ、オーディオ、画像モデル | ComfyUI Wiki