EVOKE 14B : le modèle de monde interactif en 3 étapes d'Alaya Lab
Alaya Lab publie EVOKE, un modèle de monde à poids ouverts de 14B générant des vidéos 384x640 en 3 étapes, avec mémoire d'état externe et changement d'invite en cours de génération
Aperçu
EVOKE (« Endless Interactive World with Bounded State and Long-Horizon Supervision ») est le successeur d'AlayaWorld d'Alaya Lab. L'article décrit un modèle de monde en trois étapes, sans CFG, qui obtient des résultats de pointe sur le benchmark interactif WBench tout en restant compétitif sur VBench-Long et VBench-2.0.
Le modèle distillé génère du 384 x 640 @ 24 fps et reste cohérent sur des déroulements de 30 secondes, produisant 1,5 seconde de vidéo toutes les 2,11 secondes sur un seul H200. Les poids sont disponibles sur Hugging Face, avec des lanceurs d'inférence et d'entraînement dans le référentiel GitHub.
Vidéo de présentation officielle d'EVOKE
Génération en trois étapes, zéro CFG
La plupart des modèles à quelques étapes héritent de leur plafond de performance de l'enseignant utilisé pour la distillation. EVOKE redessine l'enseignant pour la génération interactive à long horizon au lieu de le traiter comme un générateur fixe : le regroupement par segments, la récupération d'images distantes et un état global à attention linéaire maintiennent la mémoire et le calcul de l'enseignant à une croissance linéaire avec la durée de la session, ce qui rend abordable la supervision auto-imposée sur 30 secondes.
Un objectif d'appariement de distributions, appliqué lors de déroulements auto-imposés, transfère ces capacités à un étudiant en trois étapes qui n'utilise aucune guidance sans classifieur : une passe avant par étape au lieu de deux.
Pipeline d'inférence d'EVOKE : la banque d'états du monde persistante alimente le débruteur autoregressif à quelques étapes
Infini, pas limité à une fenêtre
Les modèles de monde interactifs sont confrontés à un conflit : conserver l'historique dans le contexte du débruteur ou dans le cache clé-valeur augmente le coût avec la durée de la session, tandis que l'interaction à faible latence exige une génération en quelques étapes. EVOKE résout ce problème en externalisant l'état du monde persistant :
- Écriture : un modèle de profondeur monoculaire estime la profondeur de chaque segment émis selon ses poses de caméra connues et le déprojette dans un nuage de points persistant.
- Lecture : la pose de caméra courante adresse directement la banque ; jusqu'à huit sources classées par co-visibilité sont fusionnées avec un scatter à z-buffer par lots, renvoyant une image déformée ainsi qu'un masque de visibilité par pixel.
- Éviction : une fenêtre de rétention optionnelle, activée explicitement pour les exécutions à l'échelle de l'heure.
Seules les informations pertinentes pour la vue sont récupérées, de sorte que le contexte du débruteur reste limité, quelle que soit la durée de la session. Il n'y a aucun compromis entre la durée de session et la mémoire.
Changer le monde en plein vol
Le conditionnement par segment permet de modifier l'invite pendant que le déroulement est en cours, sans coupure ni redémarrage. Chaque séquence ci-dessous effectue la bascule au segment 3 sur 6 (213 images, 8,9 s) :
| Scène | L'invite bascule vers | |
|---|---|---|
![]() | toundra gelée, lumière polaire | une aurore s'embrase dans tout le ciel |
![]() | navigation persistante dans le monde | la caméra se déplace et pivote pendant que le monde conserve son état spatial |
Modes de conditionnement
| Mode | Entrée | Contrôle de caméra |
|---|---|---|
v2v | vidéo de référence + piste de pose | oui, continue au-delà de la fenêtre de référence |
i2v | une unique première image + piste de pose | oui |
t2v | invite uniquement | non (le moteur interdit warp + t2v) |
Démo de capacité : naviguer dans un monde généré comme dans un jeu (à partir de la page officielle du projet)
Contenu de la version
Cette version fournit quatre modèles ainsi que les composants de base :
| Répertoire | Modèle | Étapes |
|---|---|---|
stage3_post_distillation | le modèle fourni | 3, sans CFG |
stage1_camera_control | modèle multi-étapes contrôlable par caméra | 50, CFG 5.0 |
stage2_few_step_training | distillation en quelques étapes (pyramide à 3 étapes) | entraînement uniquement |
evoke_teacher | enseignant DMD à double expert | 50, CFG 5.0 |
Chaque répertoire EVOKE est le parent d'un dossier transformer/ et se charge avec from_pretrained(path, subfolder="transformer"). Les modèles distillés ont été entraînés uniquement sur le conditionnement v2v, donc i2v et t2v sur ces modèles sont en zero-shot ; seul stage1_camera_control possède les trois modes en distribution. Le VAE, l'encodeur de texte, le tokenizer et le scheduler de evoke-base proviennent de la base Helios publiée, qui les rattache à Wan.
Disponibilité
EVOKE ne dispose pas d'une prise en charge native de ComfyUI à son lancement. La version officielle fournit des lanceurs d'inférence Python (scripts/inference/infer_post_distill.sh) pour les modes texte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo et segments en cours de déroulement, ainsi que des lanceurs d'entraînement pour chaque étape. Le backend de profondeur ViGeo est requis pour la banque d'états du monde ; Depth-Anything-3 est optionnel. Les poids sont disponibles sur Hugging Face à l'adresse AlayaLab/Evoke.


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.