EVOKE 14B: Открытая интерактивная мировая модель Alaya Lab с 3 шагами

ComfyUI Wikinews

Alaya Lab выпускает EVOKE, мировую модель с открытыми весами на 14B параметров, генерирующую видео 384x640 за 3 шага, с внешней памятью состояния мира и сменой промпта на лету.

Alaya Lab выпустила EVOKE, интерактивную мировую модель на 14B параметров, которая генерирует видео 384x640 при 24 fps всего за 3 шага денойзинга с нулевым classifier-free guidance. Геометрия сцены хранится во внешнем банке состояния мира с индексацией по камере, поэтому сессии могут работать бесконечно без роста контекста денойзера, а промпты можно менять в середине прогона без перезапуска.

Обзор

EVOKE («Endless Interactive World with Bounded State and Long-Horizon Supervision») является преемником модели AlayaWorld от Alaya Lab. В статье описывается трехшаговая мировая модель без CFG, которая показывает результаты уровня state-of-the-art на интерактивном бенчмарке WBench, оставаясь конкурентоспособной на VBench-Long и VBench-2.0.

Дистиллированная модель генерирует видео 384 x 640 при 24 fps и сохраняет когерентность на протяжении 30-секундных прогонов, создавая 1,5 секунды видео каждые 2,11 секунды на одном H200. Веса открыты на Hugging Face, а скрипты запуска вывода и обучения находятся в репозитории GitHub.

EVOKE overview video

Официальное обзорное видео EVOKE

Генерация за три шага, ноль CFG

Большинство малоплаговых моделей наследуют свой потолок от учителя, используемого для дистилляции. EVOKE перепроектирует учителя для долгосрочной интерактивной генерации, вместо того чтобы рассматривать его как фиксированный генератор: поблочная группировка, извлечение удаленных кадров и глобальное состояние с линейным вниманием позволяют памяти и вычислениям учителя расти линейно вместе с длиной сессии, что делает доступным 30-секундное обучение с самопринуждением (self-forced).

Целевая функция согласования распределений, применяемая при self-forced прогонах, переносит эти возможности на трехшагового студента, который не использует classifier-free guidance: один прямой проход на шаг вместо двух.

Конвейер вывода EVOKE

Конвейер вывода EVOKE: постоянный банк состояния мира питает авторегрессивный малоплаговый денойзер

Бесконечный, а не оконный

Интерактивные мировые модели сталкиваются с конфликтом: хранение истории в контексте денойзера или в кэше ключ-значение увеличивает затраты с ростом длины сессии, тогда как взаимодействие с низкой задержкой требует малоплаговой генерации. EVOKE решает эту проблему, вынося постоянное состояние мира вовне:

  • Запись: монокулярная модель глубины оценивает глубину для каждого сгенерированного блока при известных позах камеры и разворачивает ее в постоянное облако точек.
  • Чтение: текущая поза камеры напрямую адресует банк; до восьми источников, ранжированных по совместной видимости, объединяются с помощью пакетного z-buffered scatter, возвращая искаженное изображение плюс попиксельную маску видимости.
  • Вытеснение: опциональное окно удержания, включаемое явно для прогонов длительностью в часы.

Извлекается только информация, релевантная текущему обзору, поэтому контекст денойзера остается ограниченным независимо от того, как долго длится сессия: не приходится жертвовать длиной сессии ради памяти.

Изменение мира на лету

Поблочное conditioning позволяет менять промпт во время выполнения прогона: без обрыва и без перезапуска. Каждый из сценариев ниже переключается на блоке 3 из 6 (213 кадров, 8,9 с):

сценапромпт переключается на
Демо с авроройзамерзшая тундра, полярный деньпо всему небу вспыхивает полярное сияние
Демо управления камеройнавигация по постоянному мирукамера движется и поворачивается, а мир сохраняет свое пространственное состояние

Режимы conditioning

РежимВходУправление камерой
v2vэталонное видео + трек позда, продолжается за пределами эталонного окна
i2vодин первый кадр + трек позда
t2vтолько промптнет (движок запрещает warp + t2v)

Демонстрация возможностей: навигация по сгенерированному миру как в игре (с официальной страницы проекта)

Состав релиза

Релиз включает четыре модели плюс базовые компоненты:

КаталогМодельШаги
stage3_post_distillationпоставляемая модель3, без CFG
stage1_camera_controlмногошаговая модель с управлением камерой50, CFG 5.0
stage2_few_step_trainingмалоплаговая дистилляция (3-шаговая пирамида)только обучение
evoke_teacherучитель DMD с двумя экспертами50, CFG 5.0

Каждый каталог EVOKE является родительским для transformer/ и загружается через from_pretrained(path, subfolder="transformer"). Дистиллированные модели обучались только на conditioning v2v, поэтому i2v и t2v на них работают в режиме zero-shot; только stage1_camera_control имеет все три режима в дистрибуции. VAE, текстовый энкодер, tokenizer и scheduler в evoke-base взяты из выпущенной базы Helios, которая прослеживает их происхождение до Wan.

Доступность

На момент запуска EVOKE не имеет нативной поддержки ComfyUI. В официальном релизе предоставляются Python-скрипты запуска вывода (scripts/inference/infer_post_distill.sh) для режимов text-to-video, image-to-video, video-to-video и сегментов в середине прогона, а также скрипты запуска обучения для каждого этапа. Для банка состояния мира обязателен бэкенд глубины ViGeo; Depth-Anything-3 опционален. Веса доступны на Hugging Face: AlayaLab/Evoke.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
EVOKE 14B: Открытая интерактивная мировая модель Alaya Lab с 3 шагами | ComfyUI Wiki