FLUX 3: Мультимодальная потоковая модель для прогнозирования видео, изображений, аудио и действий
FLUX 3 — это первая мультимодальная базовая модель Black Forest Labs, совместно обученная на задачах прогнозирования видео, изображений, аудио и действий в рамках единой архитектуры потокового соответствия на основе Self-Flow.
FLUX 3
МультимодальнаяГенерация видеоГенерация аудиоТекст-в-изображениеПрогнозирование действийПервая мультимодальная базовая модель Black Forest Labs, которая совместно обучается на изображениях, видео, аудио и прогнозировании действий в единой архитектуре. Построена на подходе Self-Flow для эффективного мультимодального выравнивания. Поддерживает генерацию видео по тексту с нативным аудио, изображение-в-видео, видео-в-видео, генеративное продолжение аудио и высококачественную генерацию изображений по тексту.
| Разработчик | Black Forest Labs |
| Анонсирован | 2026-07-23 |
| Архитектура | Мультимодальное потоковое соответствие (Self-Flow) |
| Статус | Ранний доступ (Видео), Скоро будет (Изображение, Dev) |
| Возможности | Видео + Аудио, Генерация изображений, Прогнозирование действий |
| Ключевое исследование | Self-Flow |
Что такое FLUX 3?
FLUX 3 — это мультимодальная модель следующего поколения от Black Forest Labs, которая совместно обучается на изображениях, видео и аудио в рамках единой архитектуры. В отличие от предыдущих моделей FLUX, которые фокусировались исключительно на генерации изображений, FLUX 3 формирует общее представление о физическом мире: как объекты держатся вместе, как они движутся и как звучат события.
Ни одна модальность не даёт полного описания реальности. Изображения фиксируют пространственные структуры в определённый момент времени, видео восстанавливает временную динамику, аудио раскрывает причинно-следственные акустические связи, а язык связывает восприятие с инструкциями. FLUX 3 обучается на всех них одновременно, используя взаимные ограничения между модальностями для получения более согласованных и физически обоснованных результатов.
Построенный на подходе Self-Flow для эффективного выравнивания мультимодальной генерации и понимания, FLUX 3 значительно масштабирует вычислительные и данные ресурсы для одновременного обучения на видео, изображениях и аудио.
Что умеет FLUX 3?
Видео + Аудио (FLUX 3 Video: Ранний доступ уже сейчас)
FLUX 3 Video генерирует высокоразнообразные видеоклипы с нативным аудио длиной до 20 секунд в разрешении 720p за одну генерацию:
- Генерация видео по тексту с синхронизированным аудио
- Изображение-в-видео (анимация из начального кадра или визуальных референсов)
- Видео-в-видео с переносом центральных элементов (например, одного и того же персонажа) в новые сцены
- Генеративное продолжение видео-аудио из входного видео и аудио
- Ключевой кадр-в-видео для контролируемых переходов между заданными моментами
- Генерация многоязычного диалога
- Агентная связь отдельных клипов в более длинные многосценные последовательности
- Широкий спектр визуальных стилей и соотношений сторон за пределами обычного кинематографического вывода
- Выразительная мимика, физически обоснованная связь звука и событий, а также многоязычные возможности
Изображение (FLUX 3 Image: Ранний доступ Скоро будет)
FLUX 3 Image предложит синтез текст-в-изображение и редактирование изображений в широком разнообразии стилей, соотношений сторон и разрешений. Предварительные оценки показывают значительные улучшения по сравнению с предыдущими версиями FLUX в обработке сложных промптов и точности генерации текста, включая высокоточное отображение текста на нескольких языках.
Прогнозирование действий (FLUX 3 Action / FLUX-mimic: Доступ для партнёров)
Понимание мира FLUX 3 распространяется на прогнозирование действий через нативную интеграцию (на основе Self-Flow) и путём дообучения предобученного видеобэкбона как динамически-ориентированной основы. В партнёрстве с mimic robotics модель FLUX-mimic видео-действие тестируется на реальных производственных задачах на Audi для ловкого манипулирования и развёртывания в производстве.
План запуска
| Возможность | Доступ | Статус |
|---|---|---|
| FLUX 3 Video | API + частный доступ к весам | Ранний доступ уже сейчас |
| FLUX 3 Image | API + частный доступ к весам | Ранний доступ в ближайшие недели |
| FLUX 3 Action | Исследовательские и коммерческие партнёры (mimic) | Для партнёров сейчас |
| FLUX 3 Dev | Мультимодальный бэкбон с открытыми весами | Будет позже |
Предварительные оценки
В предварительных оценках предпочтений пользователей для 10-секундных видеоклипов по тексту в 720p с аудио:
| Сравнение | Предпочтение |
|---|---|
| против Runway Gen-4.5 | 77% предпочли FLUX 3 |
| против Grok Imagine Video | 69% предпочли FLUX 3 |
| против Kling v3 Pro | 60% предпочли FLUX 3 |
| против Happy Horse v1 | 59% предпочли FLUX 3 |
| против Happy Horse 1.1 | 57% предпочли FLUX 3 |
| против Seedance 2.0 | 52% предпочли FLUX 3 |
| против Luma Ray 3.2 | 93% предпочли FLUX 3 |
|> Эти результаты предварительны, и команда ожидает дальнейших улучшений в ходе фазы раннего доступа. Источник: Black Forest Labs — публикация о FLUX 3.
Ссылки
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.