XGEN-JING: эгоцентричная интерактивная модель на MiniMax H3
JING-Flash-v1 от XGEN Labs создаёт видео и аудио от первого лица на MiniMax H3: управление камерой с клавиатуры, взаимодействие через текст, диалоги и вывод за четыре шага.
XGEN Labs опубликовали XGEN-JING: эгоцентричную интерактивную модель опыта, построенную на MiniMax H3. Там, где обычная видеомодель генерирует фиксированный клип, JING принимает действия, референсные изображения и историю наблюдений, а затем генерирует видео и аудио от первого лица: вы двигаетесь, взаимодействуете с объектами и ведёте беседы.
Официальная обложка XGEN-JING из репозитория модели.
Что она делает
Модель обучена на три типа поведения, и все они генерируются совместно в виде видео и аудио:
- Управление камерой. Перемещайтесь по повседневным местам и воображаемым мирам с помощью ввода с клавиатуры, исследуя одну и ту же начальную точку, проходя её по-разному.
- Взаимодействие и диалог. Управляйте взаимодействием с объектами и разговорами персонажей с помощью текста вместо промптов движения.
- Референсное условие. Составляйте опыт из изображений персонажей, объектов и сцен, взятых из истории, чтобы один и тот же набор референсов можно было исследовать при разных действиях.
JING Flash построен на пути Ref2VA из MiniMax H3 плюс FlashGen, 4-шаговый LoRA для H3, который и делает возможным четырёхшаговый двунаправленный вывод. Текстовый энкодер, tokenizer, процессор, видео- и аудио-VAE и планировщики берутся из MiniMax H3 в формате diffusers, а не входят в сам релиз, поэтому новым является только трансформер jing_flash_v1.
Статус релиза
Это релиз класса предпросмотра, и план выпуска говорит об этом прямо:
| Элемент | Статус |
|---|---|
| Четырёхшаговая двунаправленная модель JING-Flash-v1 | Выпущено |
| Код вывода и примеры | Выпущено |
| Навыки промптинга | Выпущено |
| Каузальная модель | Скоро будет |
| Технический отчёт | Скоро будет |
Это различие важно для понимания того, что здесь означает «интерактивность». Четырёхшаговая двунаправленная модель генерирует весь клип, когда последовательность действий известна заранее; каузальная модель, которая реагировала бы шаг за шагом по мере нажатия клавиш, ещё не вышла. Вместе с весами XGEN Labs опубликовали галерею и демонстрационное видео.
Также в репозиторий включён документ навыки промптинга, который генерирует проверенные случаи вывода из историй и референсных изображений.
Доступность
Официальное демонстрационное видео XGEN-JING.
- Веса: XGENlabs/XGEN-JING (
jing_flash_v1, а также ассеты обложки и демо) - Код: XGEN-Labs/XGEN-JING
- Страница проекта: xgenlabs.ai/research.html
- Галерея: xgenlabs.ai/gallery.html
Поддержки ComfyUI нет: путь вывода состоит из diffusers и среды SGLang, закреплённой на конкретной ревизии diffusion, а проверенная демонстрационная конфигурация распределяет весь стек по шести GPU H100 (один для текстового энкодера, один для видео- и аудио-VAE, четыре для DiT с параллелизмом по последовательности), при этом FlashAttention-4 используется как бэкенд внимания по умолчанию. Пока не появились каузальная модель и более лёгкий путь вывода, это скорее взгляд на то, куда движутся интерактивные модели на базе H3, а не то, что можно запустить на локальной машине с ComfyUI.
О более ранней интерактивной модели мира на той же базе см. H3-World.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.