FLUX 3: modelo multimodal de video, audio e imagen
Black Forest Labs presenta FLUX 3, un modelo fundacional multimodal unificado que genera video de 20 segundos con audio nativo, imágenes y predicción de acciones para robótica.
Black Forest Labs ha anunciado FLUX 3, un nuevo modelo fundacional multimodal entrenado conjuntamente en imágenes, video y audio dentro de una arquitectura unificada. El modelo puede generar clips de video de 20 segundos con audio nativo, sintetizar y editar imágenes en múltiples estilos, y se extiende a la predicción de acciones para robótica.
Demostración de FLUX 3: generación de video multimodal con audio nativo (fuente: blog de BFL)
Cómo funciona FLUX 3
FLUX 3 se basa en el enfoque Self-Flow de BFL, que alinea la generación y comprensión multimodal dentro de la misma arquitectura subyacente. En lugar de tratar cada tipo de medio como una tarea separada, el modelo aprende de imágenes, video y audio simultáneamente: el sonido debe coincidir con el impacto, el movimiento debe obedecer a la física y el futuro debe seguir al pasado.
Capacidades de video
FLUX 3 Video puede generar clips con audio nativo de hasta 20 segundos a partir de indicaciones de texto, imágenes o videos existentes. Las capacidades principales incluyen:
- Generación de texto a video con audio nativo
- Imagen a video: animación a partir de un fotograma inicial o usando imágenes como referencias visuales
- Video a video: transferencia de elementos centrales de un clip de origen a una nueva escena
- Continuación generativa a partir de video y audio de entrada
- Fotograma clave a video para transiciones controladas entre momentos definidos
- Generación de diálogos multilingües
- Encadenamiento agéntico de clips individuales en secuencias largas de múltiples tomas
- Generación de tipografía fuerte y diseños animados
En evaluaciones preliminares, FLUX 3 Video fue preferido sobre Grok Imagine Video en hasta el 69% de las comparaciones, sobre Kling v3 Pro en el 60%, sobre Runway Gen-4.5 en el 77% y sobre Luma Ray 3.2 en el 93% de las comparaciones. El modelo es particularmente fuerte en capturar expresiones faciales humanas, asociar sonidos con eventos físicos y capacidades multilingües.
Capacidades de imagen
FLUX 3 puede generar y editar imágenes en una amplia variedad de estilos, proporciones y resoluciones. Las evaluaciones tempranas muestran una mejora significativa con respecto a versiones anteriores de FLUX en el manejo de indicaciones complejas y renderizado de texto multilingüe. Se espera el acceso temprano a FLUX 3 Image en las próximas semanas.
Predicción de acciones
La comprensión del mundo de FLUX 3 se extiende a la predicción de acciones. BFL ha desarrollado FLUX-mimic con mimic robotics, combinando el backbone de video de FLUX 3 con aprendizaje robótico para manipulación diestra. Audi está probando el sistema para tareas de producción, con algunas tareas ajustadas usando tan solo 30 minutos de datos de robot.
Disponibilidad
FLUX 3 Video y FLUX 3 Action están disponibles a través del Acceso Anticipado. Black Forest Labs planea lanzar acceso API, pesos de modelo privados y una versión de código abierto FLUX 3 Dev más adelante este año.
Al momento de escribir esto, aún no hay soporte nativo de ComfyUI para FLUX 3; requiere la API oficial de BFL o el programa de acceso anticipado.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.