MiniMax H3 Semantic Bridge: adaptador de 11MB para el prompt

ComfyUI Wikinews

La destilación independiente traslada semánticas de SenseNova U1.5 al acondicionamiento de MiniMax H3: un adaptador autónomo de 11MB con nodos ComfyUI y flujos de ejemplo.

MiniMax H3 Semantic Bridge (Hugging Face) es un proyecto de investigación independiente que traslada representaciones semánticas desde SenseNova U1.5 al espacio de acondicionamiento de MiniMax H3 mediante destilación entre arquitecturas. El resultado es un adaptador autónomo de aproximadamente 11MB (v1.0, lanzado el 5 de septiembre) con tres nodos personalizados de ComfyUI, ejecutándose completamente localmente en hardware de consumo. No es un lanzamiento oficial de MiniMax.
MiniMax H3 Semantic Bridge ejemplo de flujo de trabajo ComfyUI

El flujo de trabajo de ejemplo liberado muestra dónde se sitúa el nodo Puente Semántico en un pipeline estándar H3 FL2VA: después del acondicionamiento de texto, antes del muestreo.

¿Por qué no simplemente injertar los pesos?

El autor primero probó el enfoque obvio: transplantar directamente los pesos del transformador desde SenseNova U1.5 hacia MiniMax H3. Falló por completo. Comparando los pesos 2D relevantes, H3 tiene 264 tensors contra los 593 de SenseNova, sin coincidencias exactas de forma, sin coincidencias de transpuesta y sin dimensiones de entrada o salida coincidentes.

La interfaz viable resultó ser las representaciones de acondicionamiento. H3 consume 5120-dimensional text conditioning antes de proyectarlo en su espacio interno de transformador de 5376-dimensional, mientras que la representación de lenguaje de SenseNova es de 4096-dimensional. En lugar de copiar pesos, el proyecto alineó cómo las dos arquitecturas representan el mismo prompt, luego destiló ese mapeo en un adaptador compacto del lado de H3.

La ruta de investigación, totalmente documentada en el repositorio: la alineación de representaciones ocultas alcanzó un coseno de validación de aproximadamente 0.904 en prompts retenidos de la distribución original y 0.749 en 160 prompts estrictos fuera de distribución. Un puente maestro completo (ejecutando SenseNova en tiempo de inferencia) funcionó pero era impráctico, así que fue destilado en un adaptador estudiante que predice la representación derivada del maestro directamente desde el propio acondicionamiento de H3. El estudiante final alcanza 0.996 coseno de representación del maestro y 0.984 coseno de corrección, con corrección fuera de distribución en 0.990.

Lo que hace el adaptador en ComfyUI

El adaptador no es un LoRA, fusión de checkpoint ni injerto de parámetros. En tiempo de inferencia opera solo sobre el acondicionamiento de H3: el nodo transforma el acondicionamiento de texto nativo de H3 en una representación semántica aprendida, iguala su magnitud y lo mezcla nuevamente como residual (C = H + alpha * (S - H)), dejando los pesos del transformador diffusion intactos. SenseNova no es necesario en la inferencia.

El paquete de nodos (zip en HF) proporciona tres nodos:

  • MiniMax H3 Imagen a Video + Puente Semántico: un wrapper de inserción directa alrededor de la ruta estándar de imagen a video de H3
  • MiniMax H3 Puente Semántico: la propia transformación de acondicionamiento, con alpha (por defecto 0.10, ejemplos A/B usan 0.15) y magnitude_match (RECOMENDADO por token) controles
  • MiniMax H3 Limpiar Caché Puente Semántico

Instalación: extraer el zip en ComfyUI/custom_nodes/, poner MiniMaxH3_SemanticBridge_v1.safetensors en ComfyUI/models/semantic_bridge/, y reiniciar. Todo el adaptador es de aproximadamente 11MB.

A lo que apunta: adherencia al prompt, no nuevos estilos

El proyecto se centra en la estructura semántica en lugar de agregar conceptos visuales: composición compleja, relaciones espaciales, anatomía, conteo de objetos, restricciones de texto, materiales e iluminación, y comportamiento de reflexión u oclusión. El ejemplo principal A/B enfatiza un prompt que pide una mano descansando plana sobre una mesa de cristal "con todos los cinco dedos naturalmente separados y claramente visibles", entre muchas otras restricciones simultáneas.

MiniMax H3 NativoCon Puente Semántico
H3 Nativo: la mano derecha se desliza por la mesaPuente Semántico (alfa 0.15): la mano permanece descansando como se solicitó

Segunda mitad del par A/B de mesa de cristal con el puente habilitado (alfa 0.15).

El autor es explícito en que estas son observaciones cualitativas de pares controlados, no un benchmark: el adaptador puede ayudar en algunos prompts, hacer poco en otros, o ocasionalmente empeorar los resultados. Las métricas del espacio de representación no se traducen directamente en ganancias de calidad perceptual.

Alcance: solo FL2VA, y una estación de desarrollo de 24GB

Dos notas prácticas. Primero, v1 funciona solo en la ruta estándar FL2VA / acondicionada por texto. Una variante compatible con Ref2VA fue probada y degradó el canto de audio de referencia y la sincronización labial, así que el README advierte explícitamente contra su uso para generación condicionada por referencia.

Segundo, todo el proyecto (extracción de representación, experimentos de puente, destilación, evaluación) se ejecutó en una sola RTX 3090 Ti con 24GB, sin clúster multi-GPU. Para un experimento sobre transferir comportamiento aprendido entre arquitecturas incompatibles, esa es probablemente la parte más interesante del lanzamiento.

Disponibilidad

  • Adaptador, nodos, flujo de trabajo, materiales de investigación: speach1sdef178/MiniMax-H3-Semantic-Bridge en Hugging Face
  • Licencia: los artefactos derivados del modelo siguen la Licencia de Comunidad de MiniMax H3 (con NOTICE incluido); el maestro SenseNova U1.5 es Apache-2.0 y no se redistribuye
  • Escrito de investigación completo: RESEARCH_ARTICLE.md

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 Semantic Bridge: adaptador de 11MB para el prompt | ComfyUI Wiki