MiniMax H3 : modèle vidéo omni-modal ouvert avec audio natif

ComfyUI Wikinews

MiniMax lance H3, un modèle vidéo omni-modal qui génère des clips 2K de 15 secondes avec audio stéréo natif, compréhension du contexte multimodal et édition par instructions.

MiniMax a officiellement lancé MiniMax H3, un modèle de génération omni-modal à usage général qui comprend conjointement le texte, les images, la vidéo et l'audio. H3 génère des vidéos avec un audio stéréo natif allant jusqu'à une résolution 2K et une durée de 15 secondes, et la société prévoit de publier les poids du modèle dans les prochains jours.

H3 succède à la gamme de modèles vidéo Hailuo 01/02 de MiniMax. Il s'agit d'un modèle de génération vidéo, et non d'un des modèles de langage de la série M que MiniMax a publiés en open source plus tôt cette année.

Compréhension du contexte multimodal

Le travail créatif réel implique de combiner des informations entre les modalités. H3 accepte n'importe quelle combinaison de texte, d'images, de vidéo et d'audio en entrée, et vous permet de décrire la relation entre eux en langage naturel. La démo officielle de MiniMax demande une prise de vue comme suit : « Référencez le mouvement de caméra hitchcockien de la Vidéo 1, faites chanter le personnage de l'Image 2, avec les voix correspondant à l'Audio 3. » Le modèle gère lui-même la compréhension de toutes les modalités.

Image d'entrée d'exemple de la démo H3 de MiniMax

Une image d'entrée d'exemple utilisée dans la démo officielle de contexte multimodal de H3 de MiniMax

Vidéo générée par H3 combinant un clip de référence, une image et une piste audio dans une seule instruction (source : blog MiniMax)

Capacités clés

  • Vidéo 2K native - jusqu'à 15 secondes par clip en résolution 2K, obtenue par régénération en contexte plutôt que par un module de super-résolution séparé.
  • Audio stéréo natif - les dialogues, les effets sonores et la musique sont générés dans la même passe que l'image, sans séparation entre les domaines voix, SFX et musique.
  • Génération omni-référence - jusqu'à 9 images de référence, 3 vidéos de référence et 3 clips audio de référence peuvent guider une seule génération.
  • Édition par instructions - éditez des images, vidéos ou audios existants en décrivant le changement en langage naturel.
  • Transfert de mouvement V2V - reportez le mouvement d'une vidéo source dans une nouvelle scène.
  • Rendu puissant du texte et des marques - conçu pour la publicité, le branding, le commerce électronique, le design de produit et l'UI/UX.

Démo d'audio stéréo natif

Démo de génération de son stéréo natif (source : blog MiniMax)

Tarifs

MiniMax positionne le rapport prix-performance de H3 comme leader du secteur : en 2K, le prix par seconde est inférieur au tiers de celui des modèles grand public, et en 768p, il est inférieur à la moitié du prix des paliers 720p des concurrents. Le tarif à l'utilisation démarre à 0,13 $ par seconde pour la sortie en 2K.

Disponibilité

MiniMax H3 est disponible dès maintenant via l'API de la plateforme MiniMax et des fournisseurs tiers comme fal.ai. MiniMax indique qu'il prévoit d'ouvrir les poids du modèle dans les prochains jours, sous réserve des lois et réglementations applicables ; au moment de la rédaction, aucun dépôt Hugging Face n'a encore été publié, et un rapport technique complet est attendu prochainement.

Dans ComfyUI, H3 est disponible via le nœud partenaire officiel de MiniMax (basé sur l'API), fusionné dans ComfyUI le 31 juillet (Comfy-Org/ComfyUI #15167). Un support local natif est attendu une fois les poids ouverts publiés.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 : modèle vidéo omni-modal ouvert avec audio natif | ComfyUI Wiki