MiniMax H3: открытая модель генерации видео омнимодального типа

ComfyUI Wiki

MiniMax H3: открытая модель омнимодальной генерации видео с нативным стереоаудио 32 кГц, выводом 768p и регенерацией 2K in-context. Нативная поддержка ComfyUI.

M

MiniMax H3

Генерация ВидеоНативное АудиоОмнимодальныйТекст в ВидеоИзображение в Видео

MiniMax H3: открытая универсальная омнимодальная модель генерации, которая совместно понимает текст, изображения, видео и аудио и генерирует до 15 секунд видео с нативным стереоаудио 32 кГц за один проход. Это последняя модель в линейке видео Hailuo от MiniMax, основанная на плотном однопоточном омни-трансформере 33.1B с текстовым энкодером Qwen3-VL-32B.

РазработчикMiniMax
Дата выпуска2026-08
АрхитектураПлотный однопоточный омни-трансформер 33.1B (ветвь adaLN 13B)
Текстовый энкодерQwen3-VL-32B (скрытые состояния 50-го слоя)
Видео VAEВременно-причинный VAE, f16t4d24
Аудио VAEСтерео 32 кГц в латентные токены 40 Гц
ЛицензияMiniMax H3 Community License

MiniMax H3 генерирует до 15 секунд видео с частотой 24 FPS и нативным стереоаудио 32 кГц на любом из 11 языков. Вывод по умолчанию использует короткую сторону 768px; модуль H3-Regenerate-2K регенерирует результаты в разрешении 2K in-context. Модель была официально опубликована с открытым исходным кодом 3 августа 2026 года по соглашению MiniMax H3 Community License, а нативная поддержка ComfyUI была объединена в тот же день (Comfy-Org/ComfyUI #15224).

Чекпоинты

ЧекпоинтРежимы
FL2VAТекст в видео, первый кадр, последний кадр, первый+последний
Ref2VAПо референсам: до 9 изображений, 3 видео, 3 аудиоклипа (максимум 12 файлов в смеси)

Ресурсы

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…