EVOKE 14B: El modelo de mundo interactivo de 3 pasos de Alaya Lab
Alaya Lab publica EVOKE, un modelo de mundo de pesos abiertos de 14B que genera vídeo de 384x640 en 3 pasos, con memoria de estado externa y control del prompt en plena generación.
Resumen
EVOKE ("Endless Interactive World with Bounded State and Long-Horizon Supervision") es el sucesor de AlayaWorld de Alaya Lab. El paper describe un modelo de mundo de tres pasos y sin CFG que reporta resultados de última generación en el benchmark interactivo WBench, manteniéndose competitivo en VBench-Long y VBench-2.0.
El modelo destilado genera 384 x 640 @ 24 fps y se mantiene coherente durante rollouts de 30 segundos, produciendo 1.5 segundos de vídeo cada 2.11 segundos en una sola H200. Los pesos son abiertos en Hugging Face, con lanzadores de inferencia y entrenamiento en el repositorio de GitHub.
Vídeo oficial de resumen de EVOKE
Generación en tres pasos, cero CFG
La mayoría de los modelos de pocos pasos heredan su límite del teacher utilizado para la destilación. EVOKE rediseña el teacher para la generación interactiva de horizonte largo en lugar de tratarlo como un generador fijo: agrupación por fragmentos (chunk-wise), recuperación de fotogramas lejanos y un estado global de atención lineal mantienen la memoria y el cómputo del teacher creciendo linealmente con la duración de la sesión, lo que hace factible la supervisión autoforzada de 30 segundos.
Un objetivo de emparejamiento de distribuciones, aplicado bajo rollouts autoforzados, transfiere esas capacidades a un estudiante de tres pasos que no usa orientación libre de clasificador: una pasada hacia adelante por paso en lugar de dos.
Pipeline de inferencia de EVOKE: el banco de estado del mundo persistente alimenta al denoiser autoregresivo de pocos pasos
Infinito, no con ventana
Los modelos de mundo interactivos se enfrentan a un conflicto: mantener el historial en el contexto del denoiser o en la caché de clave-valor incrementa el coste con la duración de la sesión, mientras que la interacción de baja latencia exige generación de pocos pasos. EVOKE resuelve esto externalizando el estado del mundo persistente:
- Escritura: un modelo de profundidad monocular estima la profundidad de cada fragmento emitido bajo sus poses de cámara conocidas y lo desproyecta en una nube de puntos persistente.
- Lectura: la pose de cámara actual direcciona el banco directamente; hasta ocho fuentes clasificadas por co-visibilidad se fusionan con un scatter con z-buffer por lotes, que devuelve una imagen deformada (warped) más una máscara de visibilidad por píxel.
- Evicción: una ventana de retención opcional, habilitada explícitamente para ejecuciones de escala de horas.
Solo se recupera la información relevante para la vista, por lo que el contexto del denoiser se mantiene acotado sin importar cuánto dure la sesión: no se intercambia la duración de la sesión por memoria.
Cambia el mundo a mitad de vuelo
El conditioning por fragmento permite que el prompt cambie mientras la generación está en curso: sin cortes ni reinicios. Cada secuencia de abajo cambia en el fragmento 3 de 6 (213 fotogramas, 8.9 s):
| Escena | El prompt cambia a | |
|---|---|---|
![]() | tundra congelada, luz polar | una aurora se enciende en todo el cielo |
![]() | navegación persistente por el mundo | la cámara se mueve y gira mientras el mundo mantiene su estado espacial |
Modos de conditioning
| Modo | Entrada | Control de cámara |
|---|---|---|
v2v | vídeo de referencia + pista de pose | sí, continúa más allá de la ventana de referencia |
i2v | un único primer fotograma + pista de pose | sí |
t2v | solo prompt | no (el motor prohíbe warp + t2v) |
Demostración de capacidad: navegar por un mundo generado como en un juego (de la página oficial del proyecto)
Contenido del lanzamiento
El lanzamiento incluye cuatro modelos más los componentes base:
| Directorio | Modelo | Pasos |
|---|---|---|
stage3_post_distillation | el modelo distribuido | 3, libre de CFG |
stage1_camera_control | modelo de múltiples pasos con control de cámara | 50, CFG 5.0 |
stage2_few_step_training | destilación de pocos pasos (pirámide de 3 pasos) | solo entrenamiento |
evoke_teacher | teacher DMD de doble experto | 50, CFG 5.0 |
Cada directorio de EVOKE es el padre de un transformer/ y se carga con from_pretrained(path, subfolder="transformer"). Los modelos destilados se entrenaron solo con conditioning v2v, por lo que i2v y t2v en ellos son zero-shot; solo stage1_camera_control tiene los tres modos dentro de la distribución. El VAE, el codificador de texto, el tokenizer y el scheduler en evoke-base provienen de la base Helios publicada, que los vincula con Wan.
Disponibilidad
EVOKE no tiene soporte nativo de ComfyUI en su lanzamiento. El lanzamiento oficial proporciona lanzadores de inferencia en Python (scripts/inference/infer_post_distill.sh) para los modos de texto a vídeo, imagen a vídeo, vídeo a vídeo y de segmento a mitad de la generación, además de lanzadores de entrenamiento para cada etapa. Se requiere el backend de profundidad ViGeo para el banco de estado del mundo; Depth-Anything-3 es opcional. Los pesos están en Hugging Face en AlayaLab/Evoke.


Comentarios
Inicia sesión con GitHub para unirte a la conversación.