Открытые веса MiniMax H3 выпущены с нативной поддержкой ComfyUI
Открытые веса MiniMax H3 уже на Hugging Face, нативная поддержка ComfyUI объединена. Файлы bf16, INT8, pruned и NVFP4 и шесть официальных шаблонов.
Выпуск открытых весов H3 от MiniMax, омнимодальной видеомодели, лежащей в основе линейки Hailuo, теперь доступен. Веса опубликованы на Hugging Face, и в тот же день появилась нативная поддержка ComfyUI: pull request Comfy-Org/ComfyUI #15224 был объединён 3 августа, добавив совместную генерацию аудио и видео с четырьмя новыми узлами и шестью официальными шаблонами рабочих процессов.
H3 был запущен 31 июля (прочитать историю запуска). Выпуск открытых весов приносит 33.1B совмещённый аудио-видео диффузионный трансформер на локальные GPU с несколькими вариантами квантования.
Пример входного изображения из официального мультимодального демо H3 от MiniMax
Видео, сгенерированное H3, объединяющее референсный клип, изображение и аудиодорожку в одном промпте (источник: блог MiniMax)
Обзор системы
H3: универсальная омнимодальная система генерации, состоящая из трёх модулей:
- H3-Context-IR : управляемая система предобработки и оркестрации, которая анализирует мультимодальный контекст (текст, изображения, видео, аудио) и преобразует его в структурированное промежуточное представление для генерации. Этот модуль не входит в публикацию с открытым исходным кодом; MiniMax предоставляет его как API и публикует руководство по написанию промптов для создания собственной системы.
- H3-Base : открытый омни-трансформер на 33.1B, генерирующий видео 768p с нативным стереоаудио.
- H3-Regenerate-2K : регенерирует выход 768p в разрешение 2K in-context, повторно используя исходный мультимодальный контекст. Этот модуль пока не открыт; API воспроизводит полный конвейер 2K.
Открытый релиз покрывает H3-Base в виде двух чекпоинтов под конкретные задачи: FL2VA (текст в видео, первый кадр, последний кадр и первый+последний кадр) и Ref2VA (генерация по референсам из изображений, видео и аудио).
Характеристики вывода
| Пункт | Характеристика |
|---|---|
| Длительность | 4-15 секунд |
| Соотношения сторон | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Разрешение | Короткая сторона 768px по умолчанию; 2K через H3-Regenerate-2K |
| Частота кадров | 24 FPS |
| Аудио | Стерео 32 кГц, генерируется в том же проходе |
| Языки | 11 стабильно поддерживаемых (ar, zh, en, fr, de, it, ja, ko, pt, ru, es) |
Режимы ввода
FL2VA принимает 0, 1 или 2 изображения: без изображения это текст в видео, одно изображение это условие первого или последнего кадра, два изображения это условие первого+последнего кадра.
Ref2VA принимает до 9 референсных изображений, 3 референсных видео (2-15 с каждое, максимум 15 с всего) и 3 референсных аудиоклипа (2-15 с каждый, максимум 15 с всего, всегда вместе с изображением или видео). Смешанный ввод ограничен 12 файлами в сумме.
Открытые веса на Hugging Face
Теперь доступны два репозитория:
- MiniMaxAI/MiniMax-H3 (Hugging Face): официальный релиз в формате Diffusers с вариантами FL2VA и Ref2VA, полным кодом модели и руководствами по написанию промптов (базовое / референс). Распространяется по соглашению MiniMax H3 Community License.
- Comfy-Org/MiniMax-H3 (Hugging Face): файлы, переупакованные для нативных узлов ComfyUI, готовые к размещению в
models/diffusion_models,models/text_encodersиmodels/vae.
| Компонент | Файлы |
|---|---|
| Диффузионная модель | minimax_h3_fl2va_bf16 (61.7 ГБ), minimax_h3_fl2va_int8_convrot (31.7 ГБ), minimax_h3_fl2va_pruned_int8_convrot (19.5 ГБ), плюс соответствующие варианты ref2va_* |
| Текстовый энкодер | qwen3vl_32b_minimax_h3_bf16 (48.0 ГБ), int8_convrot (25.3 ГБ), nvfp4_awq (14.6 ГБ) |
| VAE | minimax_h3_video_vae_fp16 (4.9 ГБ), minimax_h3_audio_vae_fp32 (0.6 ГБ) |
Чекпоинты pruned INT8 примерно на 40% меньше стандартных файлов INT8 благодаря предвычисленным таблицам кривых adaLN, а текстовый энкодер NVFP4 AWQ работает на любом GPU.
Нативная поддержка ComfyUI объединена
Нативная поддержка объединена как Comfy-Org/ComfyUI #15224 3 августа, интегрируя однопоточный диффузионный трансформер с упакованными токенами, который совместно денойзит латентные представления видео и стерео аудио, с кондиционированием по скрытым состояниям Qwen3-VL-32B с тегами модальности на токен. За обработку рабочего процесса отвечают четыре новых узла: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo и MiniMaxH3SigmaShift.
Официальные рабочие процессы «текст в видео» и «изображение в видео» доступны для скачивания:
- video_minimax_h3_t2v.json (текст в видео)
- video_minimax_h3_i2v.json (изображение в видео)
- video_minimax_h3_r2v.json (референс в видео)
Официальные шаблоны рабочих процессов
Шесть официальных шаблонов выпущены через Comfy-Org/workflow_templates:
| Шаблон | Режим |
|---|---|
| video_minimax_h3_t2v.json | Локальный: текст в видео |
| video_minimax_h3_i2v.json | Локальный: изображение в видео |
| video_minimax_h3_r2v.json | Локальный: референс в видео |
| api_minimax_h3_t2v.json | API: текст в видео |
| api_minimax_h3_r2v.json | API: референс в видео |
| api_minimax_h3_flf2v.json | API: первый/последний кадр в видео |
Пошаговые руководства для локальных рабочих процессов с открытыми весами опубликованы в официальной документации: учебник по рабочему процессу MiniMax H3 с открытым исходным кодом.
Доступность
- Открытые веса: Доступны на Hugging Face (MiniMaxAI/MiniMax-H3) и переупакованы для ComfyUI на Comfy-Org/MiniMax-H3.
- ComfyUI: Нативная поддержка объединена в Comfy-Org/ComfyUI #15224; обновите ComfyUI до последней версии, чтобы получить новые узлы.
- Официальные шаблоны: Шесть рабочих процессов во встроенной галерее шаблонов ComfyUI.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.