EVOKE 14B: El modelo de mundo interactivo de 3 pasos de Alaya Lab

ComfyUI Wikinews

Alaya Lab publica EVOKE, un modelo de mundo de pesos abiertos de 14B que genera vídeo de 384x640 en 3 pasos, con memoria de estado externa y control del prompt en plena generación.

Alaya Lab ha lanzado EVOKE, un modelo de mundo interactivo de 14B parámetros que genera vídeo de 384x640 a 24 fps en solo 3 pasos de denoising con cero orientación libre de clasificador. La geometría de la escena reside en un banco de estado del mundo indexado por cámara externo, por lo que las sesiones pueden ejecutarse indefinidamente sin que crezca el contexto del denoiser, y los prompts pueden cambiarse a mitad de la generación sin reiniciar.

Resumen

EVOKE ("Endless Interactive World with Bounded State and Long-Horizon Supervision") es el sucesor de AlayaWorld de Alaya Lab. El paper describe un modelo de mundo de tres pasos y sin CFG que reporta resultados de última generación en el benchmark interactivo WBench, manteniéndose competitivo en VBench-Long y VBench-2.0.

El modelo destilado genera 384 x 640 @ 24 fps y se mantiene coherente durante rollouts de 30 segundos, produciendo 1.5 segundos de vídeo cada 2.11 segundos en una sola H200. Los pesos son abiertos en Hugging Face, con lanzadores de inferencia y entrenamiento en el repositorio de GitHub.

Vídeo de resumen de EVOKE

Vídeo oficial de resumen de EVOKE

Generación en tres pasos, cero CFG

La mayoría de los modelos de pocos pasos heredan su límite del teacher utilizado para la destilación. EVOKE rediseña el teacher para la generación interactiva de horizonte largo en lugar de tratarlo como un generador fijo: agrupación por fragmentos (chunk-wise), recuperación de fotogramas lejanos y un estado global de atención lineal mantienen la memoria y el cómputo del teacher creciendo linealmente con la duración de la sesión, lo que hace factible la supervisión autoforzada de 30 segundos.

Un objetivo de emparejamiento de distribuciones, aplicado bajo rollouts autoforzados, transfiere esas capacidades a un estudiante de tres pasos que no usa orientación libre de clasificador: una pasada hacia adelante por paso en lugar de dos.

Pipeline de inferencia de EVOKE

Pipeline de inferencia de EVOKE: el banco de estado del mundo persistente alimenta al denoiser autoregresivo de pocos pasos

Infinito, no con ventana

Los modelos de mundo interactivos se enfrentan a un conflicto: mantener el historial en el contexto del denoiser o en la caché de clave-valor incrementa el coste con la duración de la sesión, mientras que la interacción de baja latencia exige generación de pocos pasos. EVOKE resuelve esto externalizando el estado del mundo persistente:

  • Escritura: un modelo de profundidad monocular estima la profundidad de cada fragmento emitido bajo sus poses de cámara conocidas y lo desproyecta en una nube de puntos persistente.
  • Lectura: la pose de cámara actual direcciona el banco directamente; hasta ocho fuentes clasificadas por co-visibilidad se fusionan con un scatter con z-buffer por lotes, que devuelve una imagen deformada (warped) más una máscara de visibilidad por píxel.
  • Evicción: una ventana de retención opcional, habilitada explícitamente para ejecuciones de escala de horas.

Solo se recupera la información relevante para la vista, por lo que el contexto del denoiser se mantiene acotado sin importar cuánto dure la sesión: no se intercambia la duración de la sesión por memoria.

Cambia el mundo a mitad de vuelo

El conditioning por fragmento permite que el prompt cambie mientras la generación está en curso: sin cortes ni reinicios. Cada secuencia de abajo cambia en el fragmento 3 de 6 (213 fotogramas, 8.9 s):

EscenaEl prompt cambia a
Demo de auroratundra congelada, luz polaruna aurora se enciende en todo el cielo
Demo de control de cámaranavegación persistente por el mundola cámara se mueve y gira mientras el mundo mantiene su estado espacial

Modos de conditioning

ModoEntradaControl de cámara
v2vvídeo de referencia + pista de posesí, continúa más allá de la ventana de referencia
i2vun único primer fotograma + pista de pose
t2vsolo promptno (el motor prohíbe warp + t2v)

Demostración de capacidad: navegar por un mundo generado como en un juego (de la página oficial del proyecto)

Contenido del lanzamiento

El lanzamiento incluye cuatro modelos más los componentes base:

DirectorioModeloPasos
stage3_post_distillationel modelo distribuido3, libre de CFG
stage1_camera_controlmodelo de múltiples pasos con control de cámara50, CFG 5.0
stage2_few_step_trainingdestilación de pocos pasos (pirámide de 3 pasos)solo entrenamiento
evoke_teacherteacher DMD de doble experto50, CFG 5.0

Cada directorio de EVOKE es el padre de un transformer/ y se carga con from_pretrained(path, subfolder="transformer"). Los modelos destilados se entrenaron solo con conditioning v2v, por lo que i2v y t2v en ellos son zero-shot; solo stage1_camera_control tiene los tres modos dentro de la distribución. El VAE, el codificador de texto, el tokenizer y el scheduler en evoke-base provienen de la base Helios publicada, que los vincula con Wan.

Disponibilidad

EVOKE no tiene soporte nativo de ComfyUI en su lanzamiento. El lanzamiento oficial proporciona lanzadores de inferencia en Python (scripts/inference/infer_post_distill.sh) para los modos de texto a vídeo, imagen a vídeo, vídeo a vídeo y de segmento a mitad de la generación, además de lanzadores de entrenamiento para cada etapa. Se requiere el backend de profundidad ViGeo para el banco de estado del mundo; Depth-Anything-3 es opcional. Los pesos están en Hugging Face en AlayaLab/Evoke.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
EVOKE 14B: El modelo de mundo interactivo de 3 pasos de Alaya Lab | ComfyUI Wiki