FLUX 3: Modelo de Flujo Multimodal para Predicción de Video, Imagen, Audio y Acción

ComfyUI Wiki

FLUX 3 es el primer modelo fundacional multimodal de Black Forest Labs, entrenado conjuntamente en predicción de video, imagen, audio y acción dentro de una arquitectura unificada de flujo matching basada en Self-Flow.

F

FLUX 3

MultimodalGeneración de VideoGeneración de AudioTexto a ImagenPredicción de Acción

El primer modelo fundacional multimodal de Black Forest Labs: aprende conjuntamente de imágenes, video, audio y predicción de acción en una arquitectura unificada. Construido sobre el enfoque Self-Flow para una alineación multimodal eficiente. Capaz de texto a video con audio nativo, imagen a video, video a video, continuación generativa de audio y generación de texto a imagen de alta calidad.

DesarrolladorBlack Forest Labs
Anunciado2026-07-23
ArquitecturaFlujo Matching Multimodal (Self-Flow)
EstadoAcceso anticipado (Video), Próximamente (Imagen, Dev)
CapacidadesVideo + Audio, Generación de Imagen, Predicción de Acción
Investigación ClaveSelf-Flow

¿Qué es FLUX 3?

FLUX 3 es el modelo multimodal de próxima generación de Black Forest Labs que aprende conjuntamente de imágenes, vídeos y audio dentro de una única arquitectura unificada. A diferencia de los modelos FLUX anteriores que se centraban únicamente en la generación de imágenes, FLUX 3 construye una representación compartida del mundo físico: cómo se mantienen unidos los objetos, cómo se mueven las cosas y cómo suenan los eventos.

Ninguna modalidad por sí sola proporciona una descripción completa de la realidad. Las imágenes capturan estructuras espaciales en un punto en el tiempo, los vídeos restauran la dinámica temporal, el audio revela relaciones acústicas causales y el lenguaje vincula la percepción con las instrucciones. FLUX 3 aprende de todas ellas simultáneamente, utilizando restricciones mutuas entre modalidades para producir salidas más coherentes y fundamentadas físicamente.

Construido sobre el enfoque Self-Flow para alinear eficientemente la generación y comprensión multimodal, FLUX 3 escala significativamente los recursos de cómputo y datos para entrenar simultáneamente en video, imágenes y audio.

¿Qué puede hacer FLUX 3?

Video + Audio (FLUX 3 Video — Acceso anticipado ahora)

FLUX 3 Video genera clips de vídeo altamente diversos con audio nativo de hasta 20 segundos de duración en resolución 720p en una sola generación:

  • Generación de texto a vídeo con audio sincronizado
  • Imagen a vídeo (animación a partir de un fotograma inicial o referencias visuales)
  • Vídeo a vídeo transportando elementos centrales (por ejemplo, el mismo personaje) a nuevas escenas
  • Continuación generativa de vídeo-audio a partir de vídeo y audio de entrada
  • Fotograma clave a vídeo para transiciones controladas entre momentos definidos
  • Generación de diálogos multilingües
  • Encadenamiento agéntico de clips individuales en secuencias más largas de múltiples tomas
  • Amplia gama de estilos visuales y relaciones de aspecto más allá de la producción cinematográfica convencional
  • Expresiones faciales humanas fuertes, asociación de eventos sonoros fundamentada físicamente y capacidades multilingües

Imagen (FLUX 3 Image — Próximamente acceso anticipado)

FLUX 3 Image ofrecerá síntesis de texto a imagen y edición de imágenes en una amplia variedad de estilos, relaciones de aspecto y resoluciones. Las evaluaciones preliminares muestran mejoras significativas con respecto a las versiones anteriores de FLUX en el manejo de indicaciones complejas y la precisión de la generación de texto, incluida la representación de texto de alta precisión en varios idiomas.

Predicción de Acción (FLUX 3 Action / FLUX-mimic — Acceso para socios)

La comprensión del mundo de FLUX 3 se extiende a la predicción de acciones mediante integración nativa (basada en Self-Flow) y mediante el ajuste fino del backbone de vídeo preentrenado como base consciente de la dinámica. En asociación con mimic robotics, el modelo de vídeo-acción FLUX-mimic se está probando en tareas de producción reales en Audi para manipulación diestra y despliegue en producción.

Plan de lanzamiento

CapacidadAccesoEstado
FLUX 3 VideoAPI + Acceso a pesos privadosAcceso anticipado ahora
FLUX 3 ImageAPI + Acceso a pesos privadosAcceso anticipado en las próximas semanas
FLUX 3 ActionSocios de investigación y comerciales (mimic)Socios ahora
FLUX 3 DevBackbone multimodal de pesos abiertosMás tarde

Evaluaciones preliminares

En evaluaciones preliminares de preferencia humana para clips de texto a vídeo de 10 segundos a 720p con audio:

ComparaciónPreferencia
vs Runway Gen-4.577% prefirió FLUX 3
vs Grok Imagine Video69% prefirió FLUX 3
vs Kling v3 Pro60% prefirió FLUX 3
vs Happy Horse v159% prefirió FLUX 3
vs Happy Horse 1.157% prefirió FLUX 3
vs Seedance 2.052% prefirió FLUX 3
vs Luma Ray 3.293% prefirió FLUX 3

|> Estos resultados son preliminares y el equipo espera mejoras adicionales durante la fase de Acceso Anticipado. Fuente: Black Forest Labs — Publicación del blog de FLUX 3.

Enlaces

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…