MiniMax H3: открытая омнимодальная видеомодель с нативным аудио

ComfyUI Wikinews

MiniMax запускает H3 — омнимодальную видеомодель, создающую 15-секундные 2K-клипы с нативным стереозвуком, пониманием мультимодального контекста и редактированием по инструкциям.

MiniMax официально запустила MiniMax H3 — универсальную омнимодальную генеративную модель, которая совместно понимает текст, изображения, видео и аудио. H3 создаёт видео с нативным стереозвуком в разрешении до 2K и длительностью до 15 секунд, а компания планирует открыть веса модели в ближайшие дни.

H3 продолжает линейку видеомоделей MiniMax Hailuo 01/02. Это модель генерации видео, а не одна из языковых моделей серии M, которые MiniMax открыла ранее в этом году.

Понимание мультимодального контекста

Настоящая творческая работа требует объединения информации из разных модальностей. H3 принимает на вход любую комбинацию текста, изображений, видео и аудио, позволяя описать связь между ними на естественном языке. Официальная демонстрация MiniMax задаёт кадр так: «Используйте движение камеры Хичкока из Видео 1, пусть персонаж из Изображения 2 поёт, а вокал совпадает с Аудио 3». Модель сама справляется с пониманием всех модальностей.

Пример входного изображения из демо H3 от MiniMax

Пример входного изображения, использованного в официальном демо мультимодального контекста H3 от MiniMax

Видео, сгенерированное H3 по единому промпту, объединяющему референсный клип, изображение и аудиодорожку (источник: блог MiniMax)

Ключевые возможности

  • Нативное видео 2K — до 15 секунд на клип в разрешении 2K, реализованное через регенерацию в контексте вместо отдельного модуля суперразрешения.
  • Нативный стереозвук — диалоги, звуковые эффекты и музыка генерируются в том же проходе, что и изображение, без разделения доменов голоса, SFX и музыки.
  • Омни-референсная генерация — до 9 референсных изображений, 3 референсных видео и 3 референсных аудиоклипов могут управлять одной генерацией.
  • Редактирование по инструкциям — редактируйте существующие изображения, видео или аудио, описывая изменение на естественном языке.
  • Перенос движения V2V — переносите движение исходного видео в новую сцену.
  • Качественный рендеринг текста и брендов — создан для рекламы, брендинга, электронной коммерции, дизайна продуктов и UI/UX.

Демо нативного стереозвука

Демо генерации нативного стереозвука (источник: блог MiniMax)

Цены

MiniMax позиционирует соотношение цены и производительности H3 как лидирующее в отрасли: при 2K цена за секунду менее трети стоимости массовых моделей, а при 768p — менее половины цены 720p-тарифов конкурентов. Тариф с оплатой по мере использования начинается от $0,13 за секунду для вывода в 2K.

Доступность

MiniMax H3 уже доступен через API платформы MiniMax и сторонних провайдеров, таких как fal.ai. MiniMax заявляет о планах открыть веса модели в ближайшие дни, с учётом применимых законов и нормативных требований; на момент написания репозиторий на Hugging Face ещё не опубликован, а полный технический отчёт ожидается вскоре.

В ComfyUI H3 доступен через официальный партнёрский узел MiniMax (на основе API), объединённый в ComfyUI 31 июля (Comfy-Org/ComfyUI #15167). Ожидается, что нативная локальная поддержка появится после публикации открытых весов.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3: открытая омнимодальная видеомодель с нативным аудио | ComfyUI Wiki