FLUX 3: Мультимодальная потоковая модель для прогнозирования видео, изображений, аудио и действий

ComfyUI Wiki

FLUX 3 — это первая мультимодальная базовая модель Black Forest Labs, совместно обученная на задачах прогнозирования видео, изображений, аудио и действий в рамках единой архитектуры потокового соответствия на основе Self-Flow.

F

FLUX 3

МультимодальнаяГенерация видеоГенерация аудиоТекст-в-изображениеПрогнозирование действий

Первая мультимодальная базовая модель Black Forest Labs, которая совместно обучается на изображениях, видео, аудио и прогнозировании действий в единой архитектуре. Построена на подходе Self-Flow для эффективного мультимодального выравнивания. Поддерживает генерацию видео по тексту с нативным аудио, изображение-в-видео, видео-в-видео, генеративное продолжение аудио и высококачественную генерацию изображений по тексту.

РазработчикBlack Forest Labs
Анонсирован2026-07-23
АрхитектураМультимодальное потоковое соответствие (Self-Flow)
СтатусРанний доступ (Видео), Скоро будет (Изображение, Dev)
ВозможностиВидео + Аудио, Генерация изображений, Прогнозирование действий
Ключевое исследованиеSelf-Flow

Что такое FLUX 3?

FLUX 3 — это мультимодальная модель следующего поколения от Black Forest Labs, которая совместно обучается на изображениях, видео и аудио в рамках единой архитектуры. В отличие от предыдущих моделей FLUX, которые фокусировались исключительно на генерации изображений, FLUX 3 формирует общее представление о физическом мире: как объекты держатся вместе, как они движутся и как звучат события.

Ни одна модальность не даёт полного описания реальности. Изображения фиксируют пространственные структуры в определённый момент времени, видео восстанавливает временную динамику, аудио раскрывает причинно-следственные акустические связи, а язык связывает восприятие с инструкциями. FLUX 3 обучается на всех них одновременно, используя взаимные ограничения между модальностями для получения более согласованных и физически обоснованных результатов.

Построенный на подходе Self-Flow для эффективного выравнивания мультимодальной генерации и понимания, FLUX 3 значительно масштабирует вычислительные и данные ресурсы для одновременного обучения на видео, изображениях и аудио.

Что умеет FLUX 3?

Видео + Аудио (FLUX 3 Video: Ранний доступ уже сейчас)

FLUX 3 Video генерирует высокоразнообразные видеоклипы с нативным аудио длиной до 20 секунд в разрешении 720p за одну генерацию:

  • Генерация видео по тексту с синхронизированным аудио
  • Изображение-в-видео (анимация из начального кадра или визуальных референсов)
  • Видео-в-видео с переносом центральных элементов (например, одного и того же персонажа) в новые сцены
  • Генеративное продолжение видео-аудио из входного видео и аудио
  • Ключевой кадр-в-видео для контролируемых переходов между заданными моментами
  • Генерация многоязычного диалога
  • Агентная связь отдельных клипов в более длинные многосценные последовательности
  • Широкий спектр визуальных стилей и соотношений сторон за пределами обычного кинематографического вывода
  • Выразительная мимика, физически обоснованная связь звука и событий, а также многоязычные возможности

Изображение (FLUX 3 Image: Ранний доступ Скоро будет)

FLUX 3 Image предложит синтез текст-в-изображение и редактирование изображений в широком разнообразии стилей, соотношений сторон и разрешений. Предварительные оценки показывают значительные улучшения по сравнению с предыдущими версиями FLUX в обработке сложных промптов и точности генерации текста, включая высокоточное отображение текста на нескольких языках.

Прогнозирование действий (FLUX 3 Action / FLUX-mimic: Доступ для партнёров)

Понимание мира FLUX 3 распространяется на прогнозирование действий через нативную интеграцию (на основе Self-Flow) и путём дообучения предобученного видеобэкбона как динамически-ориентированной основы. В партнёрстве с mimic robotics модель FLUX-mimic видео-действие тестируется на реальных производственных задачах на Audi для ловкого манипулирования и развёртывания в производстве.

План запуска

ВозможностьДоступСтатус
FLUX 3 VideoAPI + частный доступ к весамРанний доступ уже сейчас
FLUX 3 ImageAPI + частный доступ к весамРанний доступ в ближайшие недели
FLUX 3 ActionИсследовательские и коммерческие партнёры (mimic)Для партнёров сейчас
FLUX 3 DevМультимодальный бэкбон с открытыми весамиБудет позже

Предварительные оценки

В предварительных оценках предпочтений пользователей для 10-секундных видеоклипов по тексту в 720p с аудио:

СравнениеПредпочтение
против Runway Gen-4.577% предпочли FLUX 3
против Grok Imagine Video69% предпочли FLUX 3
против Kling v3 Pro60% предпочли FLUX 3
против Happy Horse v159% предпочли FLUX 3
против Happy Horse 1.157% предпочли FLUX 3
против Seedance 2.052% предпочли FLUX 3
против Luma Ray 3.293% предпочли FLUX 3

|> Эти результаты предварительны, и команда ожидает дальнейших улучшений в ходе фазы раннего доступа. Источник: Black Forest Labs — публикация о FLUX 3.

Ссылки

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…