XGEN-JING: modelo interactivo egocéntrico sobre MiniMax H3
JING-Flash-v1 de XGEN Labs genera vídeo y audio en primera persona sobre MiniMax H3: cámara por teclado, interacción y diálogo por texto, inferencia en cuatro pasos.
XGEN Labs ha publicado XGEN-JING, un modelo de experiencia interactiva egocéntrica construido sobre MiniMax H3. Mientras que un modelo de vídeo normal genera un clip fijo, JING acepta acciones, imágenes de referencia y un historial de observaciones, y genera vídeo y audio en primera persona: te mueves, interactúas con objetos y mantienes conversaciones.
La portada oficial de XGEN-JING del repositorio del modelo.
Qué hace
El modelo está entrenado para tres comportamientos, todos generados conjuntamente como vídeo más audio:
- Control de cámara. Recorre lugares cotidianos y mundos imaginados con la entrada de teclado, explorando el mismo punto de partida al recorrerlo de forma distinta.
- Interacción y diálogo. Dirige interacciones con objetos y conversaciones con personajes mediante texto en lugar de prompts de movimiento.
- Acondicionamiento por referencia. Compón una experiencia a partir de imágenes de personajes, objetos y escenas tomadas de una historia, de modo que el mismo conjunto de referencias puede explorarse con acciones diferentes.
JING Flash se construye sobre la ruta Ref2VA de MiniMax H3 más FlashGen, el LoRA de H3 de 4 pasos, que es lo que hace posible la inferencia bidireccional en cuatro pasos. El codificador de texto, el tokenizer, el processor, los VAE de vídeo y audio y los programadores provienen todos de MiniMax H3 en formato diffusers en lugar de formar parte del lanzamiento, por lo que solo el transformer jing_flash_v1 es nuevo.
Estado del lanzamiento
Esta es una versión de clase preview, y el plan de lanzamiento lo deja claro:
| Elemento | Estado |
|---|---|
| Modelo bidireccional de cuatro pasos JING-Flash-v1 | Publicado |
| Código y ejemplos de inferencia | Publicado |
| Habilidades de prompt | Publicado |
| Modelo causal | Próximamente |
| Informe técnico | Próximamente |
La distinción importa para lo que significa «interactivo» aquí. Un modelo bidireccional de cuatro pasos genera todo el clip con la secuencia de acciones conocida de antemano; el modelo causal, que respondería paso a paso a medida que pulsas teclas, aún no ha salido. XGEN Labs ha publicado una galería y un vídeo de demostración junto con los pesos.
El repositorio también incluye un documento de habilidades de prompt, que genera casos de inferencia validados a partir de historias e imágenes de referencia.
Disponibilidad
El vídeo de demostración oficial de XGEN-JING.
- Pesos: XGENlabs/XGEN-JING (
jing_flash_v1, además de los recursos de portada y demo) - Código: XGEN-Labs/XGEN-JING
- Página del proyecto: xgenlabs.ai/research.html
- Galería: xgenlabs.ai/gallery.html
No hay soporte para ComfyUI: la ruta de inferencia es diffusers más un entorno de ejecución SGLang fijado a una revisión de diffusion concreta, y la configuración de demo validada reparte el stack entre seis GPU H100 (una para el codificador de texto, una para los VAE de vídeo y audio, y cuatro para el DiT con paralelismo de secuencia), con FlashAttention-4 como backend de atención predeterminado. Hasta que lleguen un modelo causal y una ruta de inferencia más ligera, esto es una mirada hacia dónde se dirigen los modelos interactivos basados en H3 más que algo ejecutable en un equipo local con ComfyUI.
Para el modelo de mundo interactivo anterior sobre la misma base, consulta H3-World.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.