XGEN-JING: эгоцентричная интерактивная модель на MiniMax H3

ComfyUI Wikinews

JING-Flash-v1 от XGEN Labs создаёт видео и аудио от первого лица на MiniMax H3: управление камерой с клавиатуры, взаимодействие через текст, диалоги и вывод за четыре шага.

XGEN Labs опубликовали XGEN-JING: эгоцентричную интерактивную модель опыта, построенную на MiniMax H3. Там, где обычная видеомодель генерирует фиксированный клип, JING принимает действия, референсные изображения и историю наблюдений, а затем генерирует видео и аудио от первого лица: вы двигаетесь, взаимодействуете с объектами и ведёте беседы.

XGEN-JING cover

Официальная обложка XGEN-JING из репозитория модели.

Что она делает

Модель обучена на три типа поведения, и все они генерируются совместно в виде видео и аудио:

  • Управление камерой. Перемещайтесь по повседневным местам и воображаемым мирам с помощью ввода с клавиатуры, исследуя одну и ту же начальную точку, проходя её по-разному.
  • Взаимодействие и диалог. Управляйте взаимодействием с объектами и разговорами персонажей с помощью текста вместо промптов движения.
  • Референсное условие. Составляйте опыт из изображений персонажей, объектов и сцен, взятых из истории, чтобы один и тот же набор референсов можно было исследовать при разных действиях.

JING Flash построен на пути Ref2VA из MiniMax H3 плюс FlashGen, 4-шаговый LoRA для H3, который и делает возможным четырёхшаговый двунаправленный вывод. Текстовый энкодер, tokenizer, процессор, видео- и аудио-VAE и планировщики берутся из MiniMax H3 в формате diffusers, а не входят в сам релиз, поэтому новым является только трансформер jing_flash_v1.

Статус релиза

Это релиз класса предпросмотра, и план выпуска говорит об этом прямо:

ЭлементСтатус
Четырёхшаговая двунаправленная модель JING-Flash-v1Выпущено
Код вывода и примерыВыпущено
Навыки промптингаВыпущено
Каузальная модельСкоро будет
Технический отчётСкоро будет

Это различие важно для понимания того, что здесь означает «интерактивность». Четырёхшаговая двунаправленная модель генерирует весь клип, когда последовательность действий известна заранее; каузальная модель, которая реагировала бы шаг за шагом по мере нажатия клавиш, ещё не вышла. Вместе с весами XGEN Labs опубликовали галерею и демонстрационное видео.

Также в репозиторий включён документ навыки промптинга, который генерирует проверенные случаи вывода из историй и референсных изображений.

XGEN Labs logo

Доступность

Официальное демонстрационное видео XGEN-JING.

Поддержки ComfyUI нет: путь вывода состоит из diffusers и среды SGLang, закреплённой на конкретной ревизии diffusion, а проверенная демонстрационная конфигурация распределяет весь стек по шести GPU H100 (один для текстового энкодера, один для видео- и аудио-VAE, четыре для DiT с параллелизмом по последовательности), при этом FlashAttention-4 используется как бэкенд внимания по умолчанию. Пока не появились каузальная модель и более лёгкий путь вывода, это скорее взгляд на то, куда движутся интерактивные модели на базе H3, а не то, что можно запустить на локальной машине с ComfyUI.

О более ранней интерактивной модели мира на той же базе см. H3-World.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
XGEN-JING: эгоцентричная интерактивная модель на MiniMax H3 | ComfyUI Wiki