MiniMax H3: открытая модель генерации видео омнимодального типа
MiniMax H3: открытая модель омнимодальной генерации видео с нативным стереоаудио 32 кГц, выводом 768p и регенерацией 2K in-context. Нативная поддержка ComfyUI.
MiniMax H3
Генерация ВидеоНативное АудиоОмнимодальныйТекст в ВидеоИзображение в ВидеоMiniMax H3: открытая универсальная омнимодальная модель генерации, которая совместно понимает текст, изображения, видео и аудио и генерирует до 15 секунд видео с нативным стереоаудио 32 кГц за один проход. Это последняя модель в линейке видео Hailuo от MiniMax, основанная на плотном однопоточном омни-трансформере 33.1B с текстовым энкодером Qwen3-VL-32B.
| Разработчик | MiniMax |
| Дата выпуска | 2026-08 |
| Архитектура | Плотный однопоточный омни-трансформер 33.1B (ветвь adaLN 13B) |
| Текстовый энкодер | Qwen3-VL-32B (скрытые состояния 50-го слоя) |
| Видео VAE | Временно-причинный VAE, f16t4d24 |
| Аудио VAE | Стерео 32 кГц в латентные токены 40 Гц |
| Лицензия | MiniMax H3 Community License |
MiniMax H3 генерирует до 15 секунд видео с частотой 24 FPS и нативным стереоаудио 32 кГц на любом из 11 языков. Вывод по умолчанию использует короткую сторону 768px; модуль H3-Regenerate-2K регенерирует результаты в разрешении 2K in-context. Модель была официально опубликована с открытым исходным кодом 3 августа 2026 года по соглашению MiniMax H3 Community License, а нативная поддержка ComfyUI была объединена в тот же день (Comfy-Org/ComfyUI #15224).
Чекпоинты
| Чекпоинт | Режимы |
|---|---|
| FL2VA | Текст в видео, первый кадр, последний кадр, первый+последний |
| Ref2VA | По референсам: до 9 изображений, 3 видео, 3 аудиоклипа (максимум 12 файлов в смеси) |
Ресурсы
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.