FLUX 3: modelo multimodal de video, audio e imagen

news

Black Forest Labs presenta FLUX 3, un modelo fundacional multimodal unificado que genera video de 20 segundos con audio nativo, imágenes y predicción de acciones para robótica.

Black Forest Labs ha anunciado FLUX 3, un nuevo modelo fundacional multimodal entrenado conjuntamente en imágenes, video y audio dentro de una arquitectura unificada. El modelo puede generar clips de video de 20 segundos con audio nativo, sintetizar y editar imágenes en múltiples estilos, y se extiende a la predicción de acciones para robótica.

Demostración de FLUX 3: generación de video multimodal con audio nativo (fuente: blog de BFL)

Cómo funciona FLUX 3

FLUX 3 se basa en el enfoque Self-Flow de BFL, que alinea la generación y comprensión multimodal dentro de la misma arquitectura subyacente. En lugar de tratar cada tipo de medio como una tarea separada, el modelo aprende de imágenes, video y audio simultáneamente: el sonido debe coincidir con el impacto, el movimiento debe obedecer a la física y el futuro debe seguir al pasado.

Visión general de la arquitectura de FLUX 3

Capacidades de video

FLUX 3 Video puede generar clips con audio nativo de hasta 20 segundos a partir de indicaciones de texto, imágenes o videos existentes. Las capacidades principales incluyen:

  • Generación de texto a video con audio nativo
  • Imagen a video: animación a partir de un fotograma inicial o usando imágenes como referencias visuales
  • Video a video: transferencia de elementos centrales de un clip de origen a una nueva escena
  • Continuación generativa a partir de video y audio de entrada
  • Fotograma clave a video para transiciones controladas entre momentos definidos
  • Generación de diálogos multilingües
  • Encadenamiento agéntico de clips individuales en secuencias largas de múltiples tomas
  • Generación de tipografía fuerte y diseños animados

En evaluaciones preliminares, FLUX 3 Video fue preferido sobre Grok Imagine Video en hasta el 69% de las comparaciones, sobre Kling v3 Pro en el 60%, sobre Runway Gen-4.5 en el 77% y sobre Luma Ray 3.2 en el 93% de las comparaciones. El modelo es particularmente fuerte en capturar expresiones faciales humanas, asociar sonidos con eventos físicos y capacidades multilingües.

Capacidades de imagen

FLUX 3 puede generar y editar imágenes en una amplia variedad de estilos, proporciones y resoluciones. Las evaluaciones tempranas muestran una mejora significativa con respecto a versiones anteriores de FLUX en el manejo de indicaciones complejas y renderizado de texto multilingüe. Se espera el acceso temprano a FLUX 3 Image en las próximas semanas.

Predicción de acciones

La comprensión del mundo de FLUX 3 se extiende a la predicción de acciones. BFL ha desarrollado FLUX-mimic con mimic robotics, combinando el backbone de video de FLUX 3 con aprendizaje robótico para manipulación diestra. Audi está probando el sistema para tareas de producción, con algunas tareas ajustadas usando tan solo 30 minutos de datos de robot.

Disponibilidad

FLUX 3 Video y FLUX 3 Action están disponibles a través del Acceso Anticipado. Black Forest Labs planea lanzar acceso API, pesos de modelo privados y una versión de código abierto FLUX 3 Dev más adelante este año.

Solicitar acceso anticipado a FLUX 3

Al momento de escribir esto, aún no hay soporte nativo de ComfyUI para FLUX 3; requiere la API oficial de BFL o el programa de acceso anticipado.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
FLUX 3: modelo multimodal de video, audio e imagen | ComfyUI Wiki