FLUX 3: мультимодальная модель видео, аудио и изображений

news

Black Forest Labs представляет FLUX 3 — мультимодальную модель, генерирующую 20-секундное видео со звуком, изображения и прогнозирование действий.

Black Forest Labs анонсировала FLUX 3 — новую мультимодальную фундаментальную модель, обученную совместно на изображениях, видео и аудио в рамках единой архитектуры. Модель может генерировать 20-секундные видеоклипы с нативным аудио, синтезировать и редактировать изображения в различных стилях, а также прогнозировать действия для робототехники.

Демонстрация FLUX 3: мультимодальная генерация видео с нативным аудио (источник: блог BFL)

Как работает FLUX 3

FLUX 3 основана на подходе BFL Self-Flow, который согласует мультимодальную генерацию и понимание в одной архитектуре. Вместо обработки каждого типа медиа как отдельной задачи модель обучается на изображениях, видео и аудио одновременно — звук должен соответствовать удару, движение подчиняться физике, а будущее вытекать из прошлого.

Обзор архитектуры FLUX 3

Возможности видео

FLUX 3 Video способна генерировать клипы с нативным звуком длительностью до 20 секунд на основе текстовых подсказок, изображений или существующих видео. Основные возможности:

  • Генерация видео из текста с нативным звуком
  • Изображение в видео — анимация из начального кадра или использование изображений в качестве визуальных референсов
  • Видео в видео — перенос ключевых элементов исходного клипа в новую сцену
  • Генеративное продолжение из входного видео и аудио
  • Ключевые кадры в видео для контролируемых переходов между заданными моментами
  • Многоязычный диалог генерация
  • Агентная компоновка отдельных клипов в длинные многосценные последовательности
  • Сильная типографика генерация и анимированные дизайны

В предварительных оценках FLUX 3 Video предпочитали Grok Imagine Video в 69% сравнений, Kling v3 Pro — в 60%, Runway Gen-4.5 — в 77% и Luma Ray 3.2 — в 93% случаев. Модель особенно сильна в передаче человеческих выражений лица, ассоциации звуков с физическими событиями и многоязычных возможностях.

Возможности изображений

FLUX 3 может генерировать и редактировать изображения в широком разнообразии стилей, соотношений сторон и разрешений. Ранние оценки показывают значительное улучшение по сравнению с предыдущими версиями FLUX при работе со сложными промптами и многоязычным рендерингом текста. Ранний доступ к FLUX 3 Image ожидается в ближайшие недели.

Прогнозирование действий

Понимание мира FLUX 3 распространяется на прогнозирование действий. BFL разработала FLUX-mimic совместно с mimic robotics, объединив видео-бэкбон FLUX 3 с обучением роботов для ловких манипуляций. Компания Audi тестирует систему для производственных задач, причем некоторые задачи дообучаются всего за 30 минут данных с робота.

Доступность

FLUX 3 Video и FLUX 3 Action доступны через программу раннего доступа. Black Forest Labs планирует выпустить API-доступ, приватные веса моделей и открытую версию FLUX 3 Dev позднее в этом году.

Запросить ранний доступ к FLUX 3

На момент написания статьи в ComfyUI пока нет нативной поддержки FLUX 3 — она требует официального API BFL или участия в программе раннего доступа.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
FLUX 3: мультимодальная модель видео, аудио и изображений | ComfyUI Wiki