EVOKE 14B: Открытая интерактивная мировая модель Alaya Lab с 3 шагами
Alaya Lab выпускает EVOKE, мировую модель с открытыми весами на 14B параметров, генерирующую видео 384x640 за 3 шага, с внешней памятью состояния мира и сменой промпта на лету.
Обзор
EVOKE («Endless Interactive World with Bounded State and Long-Horizon Supervision») является преемником модели AlayaWorld от Alaya Lab. В статье описывается трехшаговая мировая модель без CFG, которая показывает результаты уровня state-of-the-art на интерактивном бенчмарке WBench, оставаясь конкурентоспособной на VBench-Long и VBench-2.0.
Дистиллированная модель генерирует видео 384 x 640 при 24 fps и сохраняет когерентность на протяжении 30-секундных прогонов, создавая 1,5 секунды видео каждые 2,11 секунды на одном H200. Веса открыты на Hugging Face, а скрипты запуска вывода и обучения находятся в репозитории GitHub.
Официальное обзорное видео EVOKE
Генерация за три шага, ноль CFG
Большинство малоплаговых моделей наследуют свой потолок от учителя, используемого для дистилляции. EVOKE перепроектирует учителя для долгосрочной интерактивной генерации, вместо того чтобы рассматривать его как фиксированный генератор: поблочная группировка, извлечение удаленных кадров и глобальное состояние с линейным вниманием позволяют памяти и вычислениям учителя расти линейно вместе с длиной сессии, что делает доступным 30-секундное обучение с самопринуждением (self-forced).
Целевая функция согласования распределений, применяемая при self-forced прогонах, переносит эти возможности на трехшагового студента, который не использует classifier-free guidance: один прямой проход на шаг вместо двух.
Конвейер вывода EVOKE: постоянный банк состояния мира питает авторегрессивный малоплаговый денойзер
Бесконечный, а не оконный
Интерактивные мировые модели сталкиваются с конфликтом: хранение истории в контексте денойзера или в кэше ключ-значение увеличивает затраты с ростом длины сессии, тогда как взаимодействие с низкой задержкой требует малоплаговой генерации. EVOKE решает эту проблему, вынося постоянное состояние мира вовне:
- Запись: монокулярная модель глубины оценивает глубину для каждого сгенерированного блока при известных позах камеры и разворачивает ее в постоянное облако точек.
- Чтение: текущая поза камеры напрямую адресует банк; до восьми источников, ранжированных по совместной видимости, объединяются с помощью пакетного z-buffered scatter, возвращая искаженное изображение плюс попиксельную маску видимости.
- Вытеснение: опциональное окно удержания, включаемое явно для прогонов длительностью в часы.
Извлекается только информация, релевантная текущему обзору, поэтому контекст денойзера остается ограниченным независимо от того, как долго длится сессия: не приходится жертвовать длиной сессии ради памяти.
Изменение мира на лету
Поблочное conditioning позволяет менять промпт во время выполнения прогона: без обрыва и без перезапуска. Каждый из сценариев ниже переключается на блоке 3 из 6 (213 кадров, 8,9 с):
| сцена | промпт переключается на | |
|---|---|---|
![]() | замерзшая тундра, полярный день | по всему небу вспыхивает полярное сияние |
![]() | навигация по постоянному миру | камера движется и поворачивается, а мир сохраняет свое пространственное состояние |
Режимы conditioning
| Режим | Вход | Управление камерой |
|---|---|---|
v2v | эталонное видео + трек поз | да, продолжается за пределами эталонного окна |
i2v | один первый кадр + трек поз | да |
t2v | только промпт | нет (движок запрещает warp + t2v) |
Демонстрация возможностей: навигация по сгенерированному миру как в игре (с официальной страницы проекта)
Состав релиза
Релиз включает четыре модели плюс базовые компоненты:
| Каталог | Модель | Шаги |
|---|---|---|
stage3_post_distillation | поставляемая модель | 3, без CFG |
stage1_camera_control | многошаговая модель с управлением камерой | 50, CFG 5.0 |
stage2_few_step_training | малоплаговая дистилляция (3-шаговая пирамида) | только обучение |
evoke_teacher | учитель DMD с двумя экспертами | 50, CFG 5.0 |
Каждый каталог EVOKE является родительским для transformer/ и загружается через from_pretrained(path, subfolder="transformer"). Дистиллированные модели обучались только на conditioning v2v, поэтому i2v и t2v на них работают в режиме zero-shot; только stage1_camera_control имеет все три режима в дистрибуции. VAE, текстовый энкодер, tokenizer и scheduler в evoke-base взяты из выпущенной базы Helios, которая прослеживает их происхождение до Wan.
Доступность
На момент запуска EVOKE не имеет нативной поддержки ComfyUI. В официальном релизе предоставляются Python-скрипты запуска вывода (scripts/inference/infer_post_distill.sh) для режимов text-to-video, image-to-video, video-to-video и сегментов в середине прогона, а также скрипты запуска обучения для каждого этапа. Для банка состояния мира обязателен бэкенд глубины ViGeo; Depth-Anything-3 опционален. Веса доступны на Hugging Face: AlayaLab/Evoke.


Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.