MiniMax H3: открытая омнимодальная видеомодель с нативным аудио

ComfyUI Wiki

MiniMax H3: открытая универсальная омнимодальная модель генерации, видео 768p с нативным стереоаудио 32 кГц, 11 языков и регенерация 2K in-context.

M

MiniMax H3

Генерация ВидеоНативное АудиоОмнимодальныйТекст в ВидеоИзображение в Видео

MiniMax H3: открытая универсальная омнимодальная система генерации, которая понимает мультимодальный контекст из текста, изображений, видео и аудио и генерирует до 15 секунд видео с нативным стереоаудио 32 кГц за один проход. Это последняя модель в линейке видео Hailuo от MiniMax, основанная на плотном однопоточном омни-трансформере 33.1B с текстовым энкодером Qwen3-VL-32B.

Пример входного изображения из официального демо MiniMax

Пример входного изображения из официального мультимодального демо H3 от MiniMax

MiniMax H3 был официально опубликован с открытым исходным кодом 3 августа 2026 года по соглашению MiniMax H3 Community License. Открытый релиз покрывает H3-Base в виде двух чекпоинтов под конкретные задачи: FL2VA (текст в видео и кондиционирование по первому/последнему кадру) и Ref2VA (генерация по референсам). Система предобработки H3-Context-IR и модуль апскейлинга H3-Regenerate-2K остаются доступными как размещённые API.

Версии

ВерсияОписание
H3-Base FL2VAРежимы текст в видео, первый кадр, последний кадр и первый+последний
H3-Base Ref2VAГенерация по референсам: до 9 изображений, 3 видео и 3 аудиоклипов

Ключевые возможности

  • Нативное стереоаудио: 32 кГц стерео генерируется в том же проходе, что и изображение, без отдельной аудиомодели
  • Мультимодальный контекст: любая комбинация текста, изображений, видео и аудио на входе
  • Регенерация 2K in-context: H3-Regenerate-2K повторно генерирует вывод 768p в 2K, используя исходный контекст
  • 11 языков: ar, zh, en, fr, de, it, ja, ko, pt, ru, es
  • Развёртывание: SGLang, vLLM, diffusers и ComfyUI

Установка

MiniMax H3 нативно поддерживается в ComfyUI. Разместите файлы в соответствующих папках:

ФайлНазначение
minimax_h3_*_bf16.safetensors или *_int8_convrot.safetensorsComfyUI/models/diffusion_models/
qwen3vl_32b_minimax_h3_*.safetensorsComfyUI/models/text_encoders/
minimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
minimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

Официальный репозиторий, переупакованный для ComfyUI (Comfy-Org/MiniMax-H3), предоставляет варианты диффузионной модели bf16, INT8 convrot и pruned INT8, а также варианты текстового энкодера bf16, INT8 и NVFP4 AWQ. Чекпоинты pruned INT8 примерно на 40% меньше стандартных файлов INT8 благодаря предвычисленным таблицам кривых adaLN, а текстовый энкодер NVFP4 AWQ работает на любом GPU.

Ресурсы

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…