Открытые веса MiniMax H3 выпущены с нативной поддержкой ComfyUI

ComfyUI Wikinews

Открытые веса MiniMax H3 уже на Hugging Face, нативная поддержка ComfyUI объединена. Файлы bf16, INT8, pruned и NVFP4 и шесть официальных шаблонов.

Выпуск открытых весов H3 от MiniMax, омнимодальной видеомодели, лежащей в основе линейки Hailuo, теперь доступен. Веса опубликованы на Hugging Face, и в тот же день появилась нативная поддержка ComfyUI: pull request Comfy-Org/ComfyUI #15224 был объединён 3 августа, добавив совместную генерацию аудио и видео с четырьмя новыми узлами и шестью официальными шаблонами рабочих процессов.

H3 был запущен 31 июля (прочитать историю запуска). Выпуск открытых весов приносит 33.1B совмещённый аудио-видео диффузионный трансформер на локальные GPU с несколькими вариантами квантования.

Пример входного изображения из официального демо MiniMax

Пример входного изображения из официального мультимодального демо H3 от MiniMax

Видео, сгенерированное H3, объединяющее референсный клип, изображение и аудиодорожку в одном промпте (источник: блог MiniMax)

Обзор системы

H3: универсальная омнимодальная система генерации, состоящая из трёх модулей:

  • H3-Context-IR : управляемая система предобработки и оркестрации, которая анализирует мультимодальный контекст (текст, изображения, видео, аудио) и преобразует его в структурированное промежуточное представление для генерации. Этот модуль не входит в публикацию с открытым исходным кодом; MiniMax предоставляет его как API и публикует руководство по написанию промптов для создания собственной системы.
  • H3-Base : открытый омни-трансформер на 33.1B, генерирующий видео 768p с нативным стереоаудио.
  • H3-Regenerate-2K : регенерирует выход 768p в разрешение 2K in-context, повторно используя исходный мультимодальный контекст. Этот модуль пока не открыт; API воспроизводит полный конвейер 2K.

Открытый релиз покрывает H3-Base в виде двух чекпоинтов под конкретные задачи: FL2VA (текст в видео, первый кадр, последний кадр и первый+последний кадр) и Ref2VA (генерация по референсам из изображений, видео и аудио).

Характеристики вывода

ПунктХарактеристика
Длительность4-15 секунд
Соотношения сторон21:9, 16:9, 4:3, 1:1, 3:4, 9:16
РазрешениеКороткая сторона 768px по умолчанию; 2K через H3-Regenerate-2K
Частота кадров24 FPS
АудиоСтерео 32 кГц, генерируется в том же проходе
Языки11 стабильно поддерживаемых (ar, zh, en, fr, de, it, ja, ko, pt, ru, es)

Режимы ввода

FL2VA принимает 0, 1 или 2 изображения: без изображения это текст в видео, одно изображение это условие первого или последнего кадра, два изображения это условие первого+последнего кадра.

Ref2VA принимает до 9 референсных изображений, 3 референсных видео (2-15 с каждое, максимум 15 с всего) и 3 референсных аудиоклипа (2-15 с каждый, максимум 15 с всего, всегда вместе с изображением или видео). Смешанный ввод ограничен 12 файлами в сумме.

Открытые веса на Hugging Face

Теперь доступны два репозитория:

  • MiniMaxAI/MiniMax-H3 (Hugging Face): официальный релиз в формате Diffusers с вариантами FL2VA и Ref2VA, полным кодом модели и руководствами по написанию промптов (базовое / референс). Распространяется по соглашению MiniMax H3 Community License.
  • Comfy-Org/MiniMax-H3 (Hugging Face): файлы, переупакованные для нативных узлов ComfyUI, готовые к размещению в models/diffusion_models, models/text_encoders и models/vae.
КомпонентФайлы
Диффузионная модельminimax_h3_fl2va_bf16 (61.7 ГБ), minimax_h3_fl2va_int8_convrot (31.7 ГБ), minimax_h3_fl2va_pruned_int8_convrot (19.5 ГБ), плюс соответствующие варианты ref2va_*
Текстовый энкодерqwen3vl_32b_minimax_h3_bf16 (48.0 ГБ), int8_convrot (25.3 ГБ), nvfp4_awq (14.6 ГБ)
VAEminimax_h3_video_vae_fp16 (4.9 ГБ), minimax_h3_audio_vae_fp32 (0.6 ГБ)

Чекпоинты pruned INT8 примерно на 40% меньше стандартных файлов INT8 благодаря предвычисленным таблицам кривых adaLN, а текстовый энкодер NVFP4 AWQ работает на любом GPU.

Нативная поддержка ComfyUI объединена

Нативная поддержка объединена как Comfy-Org/ComfyUI #15224 3 августа, интегрируя однопоточный диффузионный трансформер с упакованными токенами, который совместно денойзит латентные представления видео и стерео аудио, с кондиционированием по скрытым состояниям Qwen3-VL-32B с тегами модальности на токен. За обработку рабочего процесса отвечают четыре новых узла: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo и MiniMaxH3SigmaShift.

Официальные рабочие процессы «текст в видео» и «изображение в видео» доступны для скачивания:

Официальные шаблоны рабочих процессов

Шесть официальных шаблонов выпущены через Comfy-Org/workflow_templates:

ШаблонРежим
video_minimax_h3_t2v.jsonЛокальный: текст в видео
video_minimax_h3_i2v.jsonЛокальный: изображение в видео
video_minimax_h3_r2v.jsonЛокальный: референс в видео
api_minimax_h3_t2v.jsonAPI: текст в видео
api_minimax_h3_r2v.jsonAPI: референс в видео
api_minimax_h3_flf2v.jsonAPI: первый/последний кадр в видео

Пошаговые руководства для локальных рабочих процессов с открытыми весами опубликованы в официальной документации: учебник по рабочему процессу MiniMax H3 с открытым исходным кодом.

Доступность

  • Открытые веса: Доступны на Hugging Face (MiniMaxAI/MiniMax-H3) и переупакованы для ComfyUI на Comfy-Org/MiniMax-H3.
  • ComfyUI: Нативная поддержка объединена в Comfy-Org/ComfyUI #15224; обновите ComfyUI до последней версии, чтобы получить новые узлы.
  • Официальные шаблоны: Шесть рабочих процессов во встроенной галерее шаблонов ComfyUI.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Открытые веса MiniMax H3 выпущены с нативной поддержкой ComfyUI | ComfyUI Wiki