MiniMax-H3 × Z-Image: injerto de detalle espacial para video H3

ComfyUI Wikinews

La atención espacial de Z-Image pasa a MiniMax-H3 reescalando q_norm: decorados y texturas más ricos, detalle plano entre tomas encadenadas, checkpoints ComfyUI.

MiniMax-H3 × Z-Image (repositorio listo para ComfyUI | repositorio GGUF) es un injerto de detalle espacial comunitario de joeygambino que transpasa el perfil de atención de Z-Image, especializado en texturas, a los bloques posteriores de MiniMax-H3. El resultado es un reemplazo directo de los checkpoints estándar de H3: misma identidad, voces, velocidad y VRAM, con decorados y superficies visiblemente más ricos.

Qué es

Z-Image (Lumina2, un modelo de imagen de 6B conocido por su excepcional renderizado de texturas) y MiniMax-H3 usan ambos normalización Q por cabeza en la atención. El injerto reescala los pesos q_norm de los bloques posteriores de H3 para que atiendan a la textura fina como lo hace Z-Image, sin reentrenamiento, sin conocimiento nuevo ni cambios de arquitectura. Los bloques iniciales se dejan intactos (injertarlos produce un artefacto de celosía en texturas regulares, medido y no adivinado), y la normalización K y las capas feed-forward nunca se modifican.

Esta es la segunda "fusión" en la línea del autor: Joy-LTX 2.5 transfirió el rendimiento de JoyAI-Echo a LTX-2.5 mediante un trasplante de delta de pesos. Aquí el donante es una arquitectura completamente distinta, así que lo que cruza son estadísticas de atención en lugar de pesos, con bloqueo por bloques y dosis controlada, verificado contra líneas base de misma semilla.

Cómo se ve

Vídeos de demostración, tomas continuas de tres planos renderizadas con los archivos de esta página:

Medido en escenas encadenadas, el detalle extra se mantiene plano entre empalmes: una proporción de banda alta de 0.99 en 3 empalmes frente a 1.11 en el original, es decir, sin deriva de nitidez por toma.

Uso en ComfyUI

Coloca el archivo donde viven tus checkpoints de H3 y selecciónalo en tu cargador. Todos los flujos de trabajo de H3 funcionan sin cambios, incluidos los lienzos de cadena sin costuras de MiniMax-H3 Multishot. Las versiones listas para ComfyUI (bf16 / fp8 / int8 / w4a8 / nvfp4) se cargan con el nodo estándar Load Diffusion Model en ComfyUI 0.32+; el repositorio GGUF ofrece horneados curve para tarjetas más pequeñas:

archivopara
*-curve-zs05-Q8_0.gguf32 GB
*-curve-zs05-Q5_1.gguf24-32 GB
*-curve-zs05-Q4_0.gguf16-24 GB

fl2va vs ref2va: misma elección que en H3 estándar, ref2va cuando la identidad y la voz deben persistir (imágenes de referencia, anclaje de voz, banco de identidad), fl2va cuando una toma debe aterrizar en un fotograma dado. Ambos encadenan. En RTX 30/40, el autor informa que las versiones GGUF son 4-8 veces más rápidas que cualquier versión de 4 bits lista para ComfyUI en Ampere.

Verificación

El autor informa de equivalencia de misma semilla frente a la implementación de parche en tiempo de ejecución, identidad mantenida en los rostros entre variantes (la textura facial mejora frente al original), escenas encadenadas de 4 tomas que aterrizan los eventos guionizados sin artefactos, y verificación a nivel de tensores de la matemática del injerto tras el horneado para cada archivo.

Enlaces

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax-H3 × Z-Image: injerto de detalle espacial para video H3 | ComfyUI Wiki