MiniMax H3: открытая омнимодальная видеомодель с нативным аудио
MiniMax H3: открытая универсальная омнимодальная модель генерации, видео 768p с нативным стереоаудио 32 кГц, 11 языков и регенерация 2K in-context.
MiniMax H3
Генерация ВидеоНативное АудиоОмнимодальныйТекст в ВидеоИзображение в ВидеоMiniMax H3: открытая универсальная омнимодальная система генерации, которая понимает мультимодальный контекст из текста, изображений, видео и аудио и генерирует до 15 секунд видео с нативным стереоаудио 32 кГц за один проход. Это последняя модель в линейке видео Hailuo от MiniMax, основанная на плотном однопоточном омни-трансформере 33.1B с текстовым энкодером Qwen3-VL-32B.
Пример входного изображения из официального мультимодального демо H3 от MiniMax
MiniMax H3 был официально опубликован с открытым исходным кодом 3 августа 2026 года по соглашению MiniMax H3 Community License. Открытый релиз покрывает H3-Base в виде двух чекпоинтов под конкретные задачи: FL2VA (текст в видео и кондиционирование по первому/последнему кадру) и Ref2VA (генерация по референсам). Система предобработки H3-Context-IR и модуль апскейлинга H3-Regenerate-2K остаются доступными как размещённые API.
Версии
| Версия | Описание |
|---|---|
| H3-Base FL2VA | Режимы текст в видео, первый кадр, последний кадр и первый+последний |
| H3-Base Ref2VA | Генерация по референсам: до 9 изображений, 3 видео и 3 аудиоклипов |
Ключевые возможности
- Нативное стереоаудио: 32 кГц стерео генерируется в том же проходе, что и изображение, без отдельной аудиомодели
- Мультимодальный контекст: любая комбинация текста, изображений, видео и аудио на входе
- Регенерация 2K in-context: H3-Regenerate-2K повторно генерирует вывод 768p в 2K, используя исходный контекст
- 11 языков: ar, zh, en, fr, de, it, ja, ko, pt, ru, es
- Развёртывание: SGLang, vLLM, diffusers и ComfyUI
Установка
MiniMax H3 нативно поддерживается в ComfyUI. Разместите файлы в соответствующих папках:
| Файл | Назначение |
|---|---|
minimax_h3_*_bf16.safetensors или *_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
qwen3vl_32b_minimax_h3_*.safetensors | ComfyUI/models/text_encoders/ |
minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
Официальный репозиторий, переупакованный для ComfyUI (Comfy-Org/MiniMax-H3), предоставляет варианты диффузионной модели bf16, INT8 convrot и pruned INT8, а также варианты текстового энкодера bf16, INT8 и NVFP4 AWQ. Чекпоинты pruned INT8 примерно на 40% меньше стандартных файлов INT8 благодаря предвычисленным таблицам кривых adaLN, а текстовый энкодер NVFP4 AWQ работает на любом GPU.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.