MiniMax H3: Modelo de vídeo omni-modal abierto con audio nativo

ComfyUI Wikinews

MiniMax lanza H3, un modelo de vídeo omni-modal que genera clips 2K de 15 segundos con audio estéreo nativo, comprensión de contexto multimodal y edición por instrucciones.

MiniMax ha lanzado oficialmente MiniMax H3, un modelo de generación omni-modal de propósito general que comprende conjuntamente texto, imágenes, vídeo y audio. H3 genera vídeo con audio estéreo nativo en resolución de hasta 2K y con una duración de hasta 15 segundos, y la compañía planea publicar los pesos del modelo en los próximos días.

H3 sucede a la línea de modelos de vídeo Hailuo 01/02 de MiniMax. Es un modelo de generación de vídeo, no uno de los modelos de lenguaje de la serie M que MiniMax publicó como código abierto a principios de este año.

Comprensión del contexto multimodal

El trabajo creativo real implica combinar información de distintas modalidades. H3 acepta cualquier combinación de texto, imágenes, vídeo y audio como entrada, y te permite describir la relación entre ellas en lenguaje natural. La demo oficial de MiniMax indica una toma de la siguiente manera: «Toma como referencia el movimiento de cámara de Hitchcock del Vídeo 1, haz que el personaje de la Imagen 2 cante, con las voces coincidiendo con el Audio 3». El modelo gestiona por sí mismo la comprensión de todas las modalidades.

Imagen de ejemplo de entrada de la demo de H3 de MiniMax

Una imagen de ejemplo utilizada como entrada en la demo oficial de contexto multimodal de H3 de MiniMax

Vídeo generado por H3 que combina un clip de referencia, una imagen y una pista de audio en una sola instrucción (fuente: blog de MiniMax)

Capacidades principales

  • Vídeo 2K nativo - hasta 15 segundos por clip en resolución 2K, logrado mediante regeneración en contexto en lugar de un módulo de superresolución independiente.
  • Audio estéreo nativo - el diálogo, los efectos de sonido y la música se generan en la misma pasada que la imagen, sin separación entre los dominios de voz, SFX y música.
  • Generación con referencias omni - hasta 9 imágenes de referencia, 3 vídeos de referencia y 3 clips de audio de referencia pueden guiar una sola generación.
  • Edición basada en instrucciones - edita imágenes, vídeos o audio existentes describiendo el cambio en lenguaje natural.
  • Transferencia de movimiento V2V - traslada el movimiento de un vídeo de origen a una nueva escena.
  • Renderizado potente de texto y marca - diseñado para casos de uso de publicidad, branding, comercio electrónico, diseño de producto y UI/UX.

Demo de audio estéreo nativo

Demo de generación de sonido estéreo nativo (fuente: blog de MiniMax)

Precios

MiniMax posiciona la relación precio-rendimiento de H3 como líder de la industria: en 2K, el precio por segundo es menos de un tercio del de los modelos convencionales, y en 768p es menos de la mitad del precio de los niveles de 720p de la competencia. El precio de pago por uso comienza en $0,13 por segundo para la salida en 2K.

Disponibilidad

MiniMax H3 ya está disponible a través de la API de la plataforma de MiniMax y de proveedores externos como fal.ai. MiniMax afirma que planea abrir los pesos del modelo en los próximos días, sujeto a las leyes y regulaciones aplicables; al momento de escribir este artículo, aún no se ha publicado ningún repositorio en Hugging Face, y se espera pronto un informe técnico completo.

En ComfyUI, H3 está disponible a través del nodo de socio oficial de MiniMax (basado en API), integrado en ComfyUI el 31 de julio (Comfy-Org/ComfyUI #15167). Se espera soporte local nativo una vez que se publiquen los pesos abiertos.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3: Modelo de vídeo omni-modal abierto con audio nativo | ComfyUI Wiki