FLUX 3: le modèle multimodal vidéo, audio et image

news

Black Forest Labs dévoile FLUX 3, un modèle de base multimodal unifié générant des vidéos de 20 secondes avec son natif, des images et la prédiction d'actions pour la robotique.

Black Forest Labs a annoncé FLUX 3, un nouveau modèle de fondation multimodal entraîné conjointement sur les images, la vidéo et l'audio au sein d'une architecture unifiée. Le modèle peut générer des clips vidéo de 20 secondes avec audio natif, synthétiser et éditer des images dans de multiples styles, et s'étend à la prédiction d'actions pour la robotique.

Démo FLUX 3 : génération vidéo multimodale avec audio natif (source : blog BFL)

Comment fonctionne FLUX 3

FLUX 3 s'appuie sur l'approche Self-Flow de BFL, qui aligne la génération et la compréhension multimodales au sein de la même architecture sous-jacente. Au lieu de traiter chaque type de média comme une tâche séparée, le modèle apprend à partir d'images, de vidéos et d'audio simultanément — le son doit correspondre à l'impact, le mouvement doit obéir à la physique, et le futur doit découler du passé.

Vue d'ensemble de l'architecture de FLUX 3

Capacités vidéo

FLUX 3 Video peut générer des clips avec un son natif d'une durée allant jusqu'à 20 secondes à partir de prompts textuels, d'images ou de vidéos existantes. Les capacités principales incluent :

  • Génération texte vers vidéo avec son natif
  • Image vers vidéo — animation à partir d'une image de départ ou utilisation d'images comme références visuelles
  • Vidéo vers vidéo — transport des éléments centraux d'un clip source vers une nouvelle scène
  • Continuation générative à partir de la vidéo et de l'audio d'entrée
  • Image clé vers vidéo pour des transitions contrôlées entre des moments définis
  • Génération de dialogues multilingues
  • Enchaînement agentique de clips individuels en séquences plus longues en plusieurs plans
  • Génération de typographie forte et de designs animés

Lors des évaluations préliminaires, FLUX 3 Video a été préféré à Grok Imagine Video dans jusqu'à 69 % des comparaisons, à Kling v3 Pro dans 60 %, à Runway Gen-4.5 dans 77 % et à Luma Ray 3.2 dans 93 % des comparaisons. Le modèle est particulièrement fort pour capturer les expressions faciales humaines, associer les sons aux événements physiques et pour les capacités multilingues.

Capacités image

FLUX 3 peut générer et éditer des images dans une grande variété de styles, de ratios d'aspect et de résolutions. Les premières évaluations montrent une amélioration significative par rapport aux versions précédentes de FLUX dans le traitement de prompts complexes et du rendu de texte multilingue. L'accès anticipé à FLUX 3 Image est attendu dans les semaines à venir.

Prédiction d'actions

La compréhension du monde de FLUX 3 s'étend à la prédiction d'actions. BFL a développé FLUX-mimic avec mimic robotics, combinant le backbone vidéo de FLUX 3 avec l'apprentissage robotique pour une manipulation dextre. Audi teste le système pour des tâches de production, certaines tâches étant affinées avec seulement 30 minutes de données robotiques.

Disponibilité

FLUX 3 Video et FLUX 3 Action sont disponibles via Accès anticipé. Black Forest Labs prévoit de publier un accès API, des poids de modèles privés et une version FLUX 3 Dev à poids ouvert plus tard cette année.

Demander un accès anticipé à FLUX 3

Au moment de la rédaction, il n'y a pas encore de support natif de ComfyUI pour FLUX 3 — il nécessite l'API officielle de BFL ou le programme d'accès anticipé.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
FLUX 3: le modèle multimodal vidéo, audio et image | ComfyUI Wiki