FLUX 3 : Modèle de flux multimodal pour la prédiction vidéo, image, audio et action

ComfyUI Wiki

FLUX 3 est le premier modèle fondamental multimodal de Black Forest Labs, entraîné conjointement sur la prédiction vidéo, image, audio et action au sein d'une architecture unifiée de flow matching basée sur Self-Flow.

F

FLUX 3

MultimodalGénération vidéoGénération audioText-to-ImagePrédiction d'action

Le premier modèle fondamental multimodal de Black Forest Labs. Il apprend conjointement à partir d'images, de vidéos, d'audio et de prédiction d'action dans une architecture unifiée. Construit sur l'approche Self-Flow pour un alignement multimodal efficace. Capable de text-to-video avec audio natif, image-to-video, video-to-video, continuation audio générative et génération d'images text-to-image de haute qualité.

Qu'est-ce que FLUX 3 ?

FLUX 3 est le modèle multimodal de nouvelle génération de Black Forest Labs, qui apprend conjointement à partir d'images, de vidéos et d'audio au sein d'une architecture unifiée unique. Contrairement aux modèles FLUX précédents qui se concentraient uniquement sur la génération d'images, FLUX 3 construit une représentation partagée du monde physique : comment les objets tiennent ensemble, comment les choses bougent et comment les événements sonnent.

Aucune modalité unique ne fournit une description complète de la réalité. Les images capturent les structures spatiales à un instant donné, les vidéos restituent la dynamique temporelle, l'audio révèle les relations acoustiques causales et le langage relie la perception aux instructions. FLUX 3 apprend de toutes simultanément, en utilisant des contraintes mutuelles entre les modalités pour produire des sorties plus cohérentes et physiquement fondées.

Construit sur l'approche Self-Flow pour aligner efficacement la génération et la compréhension multimodales, FLUX 3 augmente considérablement les ressources de calcul et de données pour s'entraîner simultanément sur la vidéo, les images et l'audio.

Que peut faire FLUX 3 ?

Vidéo + Audio (FLUX 3 Video : Accès anticipé dès maintenant)

FLUX 3 Video génère des clips vidéo très diversifiés avec audio natif jusqu'à 20 secondes de long en résolution 720p en une seule génération :

  • Génération text-to-video avec audio synchronisé
  • Image-to-video (animation à partir d'une image de départ ou de références visuelles)
  • Video-to-video transportant des éléments centraux (par exemple, le même personnage) vers de nouvelles scènes
  • Continuation vidéo-audio générative à partir d'une vidéo et d'un audio d'entrée
  • Keyframe-to-video pour des transitions contrôlées entre des moments définis
  • Génération de dialogues multilingues
  • Chaînage agentique de clips individuels en séquences multi-plans plus longues
  • Large gamme de styles visuels et de rapports d'aspect au-delà de la production cinématographique conventionnelle
  • Forte expression faciale humaine, association son-événement physiquement fondée et capacités multilingues

Image (FLUX 3 Image : Accès anticipé bientôt disponible)

FLUX 3 Image proposera la synthèse text-to-image et l'édition d'images dans une grande variété de styles, rapports d'aspect et résolutions. Les évaluations préliminaires montrent des améliorations significatives par rapport aux versions précédentes de FLUX dans le traitement de prompts complexes et la précision de la génération de texte, y compris un rendu textuel très précis dans plusieurs langues.

Prédiction d'action (FLUX 3 Action / FLUX-mimic : Accès partenaire)

La compréhension du monde de FLUX 3 s'étend à la prédiction d'action via l'intégration native (s'appuyant sur Self-Flow) et via le fine-tuning du backbone vidéo pré-entraîné en tant que fondation consciente de la dynamique. En partenariat avec mimic robotics, le modèle vidéo-action FLUX-mimic est testé sur des tâches de production réelles chez Audi pour la manipulation dextre et le déploiement en production.

Plan de lancement

CapacitéAccèsStatut
FLUX 3 VideoAPI + Accès aux poids privésAccès anticipé maintenant
FLUX 3 ImageAPI + Accès aux poids privésAccès anticipé dans les semaines à venir
FLUX 3 ActionPartenaires de recherche et commerciaux (mimic)Partenaires maintenant
FLUX 3 DevBackbone multimodal à poids ouvertsPlus tard

Évaluations préliminaires

Dans les évaluations préliminaires des préférences humaines pour des clips text-to-video de 10 secondes en 720p avec audio :

ComparaisonPréférence
vs Runway Gen-4.577 % préfèrent FLUX 3
vs Grok Imagine Video69 % préfèrent FLUX 3
vs Kling v3 Pro60 % préfèrent FLUX 3
vs Happy Horse v159 % préfèrent FLUX 3
vs Happy Horse 1.157 % préfèrent FLUX 3
vs Seedance 2.052 % préfèrent FLUX 3
vs Luma Ray 3.293 % préfèrent FLUX 3

|> Ces résultats sont préliminaires et l'équipe s'attend à d'autres améliorations pendant la phase d'accès anticipé. Source : Black Forest Labs — Article sur FLUX 3.

Liens

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…