MiniMax H3 Prompt Rewriter LoRA: Reescritura Local de Prompts T2VA
El MiniMax-H3-Prompt-Rewriter-LoRA de Lightx2v convierte prompts cortos en descripciones T2VA estructuradas localmente, con nodos de ComfyUI para Qwen3.6-27B.
El equipo de Lightx2v lanzó MiniMax-H3-Prompt-Rewriter-LoRA (Hugging Face), un adaptador LoRA afinado sobre Qwen3.6-27B que reescribe prompts cortos en las descripciones estructuradas de audio y vídeo que MiniMax H3 espera. Es una alternativa local al flujo de trabajo de prompts Context-IR alojado por MiniMax: se le introduce un prompt junto con la relación de aspecto y la duración, y genera un bloque toma por toma con integrated_multimodal_description, overall_soundscape y non_diegetic_music, listo para la generación en H3.
El nodo de reescritura de prompts en ComfyUI: prompt corto de entrada, descripción estructurada toma por toma, paisaje sonoro y música de salida.
Qué hace
El adaptador convierte un prompt corto más la relación de aspecto y la duración solicitadas en una descripción estructurada de audio y vídeo de H3:
Original prompt + aspect ratio + duration
│
▼
Qwen3.6-27B + this LoRA
│
▼
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...La reescritura amplía la estructura de las tomas, el tiempo, la composición, el movimiento de cámara, la acción física y la continuidad, y añade sonido diegético sincronizado además de música no diegética, preservando la intención original. La versión actual admite la reescritura T2VA solo de texto; la reescritura de primer/último fotograma a vídeo (FL2VA) y la de referencia a vídeo (Ref2VA) están en la hoja de ruta. Ten en cuenta que es una aproximación aprendida del servicio oficial H3-Context-IR, no una réplica exacta.
Nodos de ComfyUI
El miembro de la comunidad pytraveler empaquetó el LoRA como MiniMax-H3-Prompt-Rewriter-ComfyUI (GitHub), instalable a través de ComfyUI-Manager o clonándolo en ComfyUI/custom_nodes/. El paquete incluye tres grupos de nodos:
- Nodo Rewriter: ejecuta Qwen3.6-27B con el LoRA, la implementación de referencia del formato de reescritura
- Nodos Writer: producen la misma salida estructurada desde cualquier GGUF que siga instrucciones, cubriendo T2VA, I2VA, FL2VA, L2VA y Ref2VA con una descarga de aproximadamente 2.6 GB y ~5 GB de VRAM
- Nodos Reference Caption / Multi Reference Caption: convierten una imagen, un clip de audio o un vídeo en el texto de caption que necesitan los nodos Writer
Requisitos de hardware
La ruta del LoRA carga un modelo base de 27 mil millones de parámetros: aproximadamente 16 GB de VRAM en nf4, ~28 GB en int8, o 13 a 19 GB mediante cuantización GGUF con descarga de capas. La comunidad ya está pidiendo a Lightx2v una variante de 4B/8B para bajar la barrera de entrada.
Disponibilidad
El LoRA es un adaptador del lado del texto: reescribe prompts y no incluye los pesos del generador MiniMax-H3. Úsalo con la inferencia de LightX2V o con el paquete de nodos de ComfyUI anterior; el prompt reescrito se introduce en MiniMax-H3 como de costumbre. El modelo base de 27B se descarga desde Hugging Face en el primer uso.
Comparación
Los vídeos siguientes comparan el mismo checkpoint de MiniMax-H3 con configuraciones de inferencia idénticas; solo difiere el método de reescritura de prompts: el prompt sin procesar (sin reescritura) frente a Qwen3.6-27B con el H3-T2VA Context Rewriter LoRA.
| Prompt Original (Sin Reescritura) | H3-T2VA Context Rewriter LoRA |
|---|---|
| Teaser épico de space opera, prompt sin procesar | El mismo prompt, reescrito por el LoRA |
Comentarios
Inicia sesión con GitHub para unirte a la conversación.