LongLive-Plug: NVIDIA дистиллирует few-step LoRA для H3 и Wan

ComfyUI Wikinews

LongLive-Plug от NVIDIA дистиллирует few-step, CFG и long-context LoRA один раз для каждого бэкбона и переиспользует их в 54 нижестоящих моделях, с весами для MiniMax H3 и Wan.

LongLive-Plug это фреймворк разовой дистилляции (once-for-all) от NVIDIA из команды SANA: вместо того чтобы дистиллировать каждую нижестоящую видеомодель отдельно, он обучает переиспользуемые возможности как LoRA на базовой модели и подключает их к совместимым нижестоящим моделям без переобучения. Веса для MiniMax H3, Wan2.1-T2V-14B и Wan2.2-TI2V-5B появились на Hugging Face 29 сентября 2026 года вместе со статьёй (arXiv 2609.38154).
Сравнение переноса с совпадающими кадрами: нативный, наивный четырёхшаговый, дистилляция под каждую цель и LongLive-Plug

Сопоставленные кадры из рисунка 3 статьи. Наивная четырёхшаговая выборка (второй столбец) размывает кадр; перенесённые адаптеры (четвёртый столбец) держатся на четырёх шагах. Рамками отмечены одинаковые координаты во всех методах.

Одна дистилляция для множества нижестоящих моделей

Создание специализированной видеомодели часто заканчивается этапом дистилляции: чтобы сократить число шагов выборки или чтобы длинные прогоны не разваливались. Обычно этот этап повторяют для каждой модели: собрать данные задачи, запустить учителя, снова оптимизировать. Fine-tune Wan с условием по глубине и мировая модель для робототехники, обученные на одном бэкбоне, каждый оплачивал свой собственный few-step LoRA.

LongLive-Plug делит эту работу на три возможности, которые дистиллируются один раз для каждого семейства бэкбонов, а затем переносятся как обычные LoRA:

  1. Few-step LoRA: меньше шагов выборки, обучение с сопоставлением распределений и учителем с CFG-направлением.
  2. CFG LoRA: сворачивает classifier-free guidance в один условный прямой проход.
  3. Long-context LoRA: исправляет накопление ошибок в каузальных авторегрессивных прогонах.

Адаптеры спроектированы так, чтобы переживать изменения, которые вносит нижестоящая модель. Добавление ветвей условий или расширение выходных каналов не делает их недействительными, поэтому один и тот же набор файлов подключается к полным fine-tune, LoRA для задач и моделям с дополнительными модулями управления.

Вес CFG работает как регулятор

Направление обычно оплачивается дважды за шаг: один условный проход, один безусловный. CFG LoRA убирает второй проход, и поскольку направление дистиллировано в адаптер, сам вес LoRA становится управлением направлением, хотя адаптер обучался при одном фиксированном масштабе. Его повышение усиливает атрибуты промпта без повторного запуска безусловной ветви.

Важная деталь: масштабирование всего связанного LoRA даёт не тот же результат: оно двигает обновление и число шагов вместе и ухудшает вывод. Именно поэтому few-step и CFG адаптеры это отдельные файлы, и поэтому их веса задаются отдельно. Рекомендуемое статьёй соотношение: few-step : CFG = 1 : 0.5, и карточки моделей повторяют, что эти числа это веса адаптеров, а не нативный масштаб CFG модели.

Независимое управление CFG с помощью CFG-only LoRA

Рисунок 5 статьи. Масштабирование только связанного LoRA почти не реагирует на промпт; добавление отдельно взвешенного CFG LoRA усиливает отмеченные рамками атрибуты, тогда как связанный LoRA остаётся неизменным.

Что было выпущено

В коллекции на Hugging Face шесть адаптеров: по одному файлу few-step и одному CFG на каждый бэкбон.

Базовая модельFew-step адаптерCFG адаптерПримечания
MiniMax H3LongLive-Plug-MiniMax-H3-few-step (2.6 GB)LongLive-Plug-MiniMax-H3-cfg (2.6 GB)Формат PEFT. В карточках сказано использовать их пока по отдельности, совместное использование пока не рекомендуется
Wan2.1-T2V-14BLongLive-Plug-Wan2.1-T2V-14B-few-step (1.2 GB)LongLive-Plug-Wan2.1-T2V-14B-cfgВместе с экспортом PEFT поставляется generator_lora_lightx2v.safetensors
Wan2.2-TI2V-5BLongLive-Plug-Wan2.2-TI2V-5B-few-step (1.3 GB)LongLive-Plug-Wan2.2-TI2V-5B-cfgPEFT adapter_model.safetensors

Файл few-step для Wan2.1-14B можно сразу подключить к существующему рабочему процессу Wan: он экспортирован в именовании lightx2v, которое загрузчики LoRA для Wan в ComfyUI уже читают, поэтому он кладётся в ComfyUI/models/loras/ как любой другой speed LoRA для Wan. Адаптеры MiniMax H3 это экспорты PEFT, и их нужно конвертировать, прежде чем ComfyUI их загрузит; Kijai опубликовал конвертированную версию bf16 по адресу Kijai/MiniMax-H3-experimental как minimax_h3_ELM_longlive_plug_4step_lora_bf16.safetensors (1.96 GB).

Охват и стоимость

Статья подтверждает развёртывание без обучения на 54 нижестоящих моделях из трёх семейств бэкбонов (24 на Wan2.1-14B, 24 на Wan2.2-TI2V-5B, шесть на MiniMax H3) и восьми категориях задач: моделирование мира, робототехника, генерация с обусловливанием структурой, управление камерой и траекторией, редактирование и восстановление видео, генерация субъекта и аватара, генерация аудио и RGBA, и адаптация стиля. По сравнению с нативными расписаниями от 20 до 50 шагов подключение дистиллированных на базовой модели адаптеров даёт вывод за четыре шага без CFG: сокращение шагов денойзинга в 5-12.5 раза.

Аргумент о стоимости это вторая половина статьи. Базовая дистилляция занимает около 80 GPU-часов H100 (700 итераций на 32 GPU, примерно 2.5 часа). Дистилляция четырёх нижестоящих задач по отдельности стоит дополнительно 83.9 (глубина), 150.0 (моделирование мира), 86.8 (поза) и 56.1 (робототехника) GPU-часов, всего около 456.8. Переиспользование базовых адаптеров остаётся на фиксированных ~80 GPU-часах, без сбора данных под конкретные задачи.

Дополнительные случаи переноса для Wan2.1-14B

Рисунок 9 статьи: LongVie 2, ABot-PhysWorld, MagicTryOn и Wan-Alpha, охватывающие моделирование мира, робототехнику, обусловливание субъектом и вывод RGBA; для каждого сравниваются два нативных кадра с одинаковыми временными метками после четырёхшагового переноса.

MiniMax H3

Часть выпуска, касающаяся H3, самая узкая. Шесть из 54 проверенных моделей это H3, и статья указывает, что её десять сравнений для H3 это случаи с одним seed без доверительных интервалов по повторным запускам, что нативное значение по умолчанию это опорная рабочая точка, а не истина в последней инстанции, и что статичные кадры не оценивают качество и синхронизацию аудио. Примеры показывают, что четырёхшаговый H3 лучше удерживает контуры персонажей, чем наивная четырёхшаговая выборка Euler, хотя внешний вид всё ещё может отличаться от недистиллированного многошагового результата.

Перенос задач на H3: управление действием и раскрашивание line-art

Рисунок 11 статьи: H3-World с условием прямого действия и LineartAnime, сравнение недистиллированного многошагового вывода, наивной четырёхшаговой выборки и четырёхшагового вывода с LongLive-Plug.

Ограничения

  • Идея переноса работает на тех бэкбонах, для которых она дистиллировалась. У Wan2.1, Wan2.2 и MiniMax H3 свой набор адаптеров, и статья не заявляет о переиспользовании между семействами.
  • Эффект на H3 измерен на десяти случаях с одним seed без доверительных интервалов, а аудиодорожка не входит в оценку.
  • Для MiniMax H3 два адаптера пока следует использовать по одному за раз, поэтому скорость few-step и управление CFG там пока нельзя совместить.
  • Управление направлением это регулятор веса, а не новый сэмплер: файлы few-step и CFG нужно загружать и взвешивать отдельно, чтобы получить и то, и другое.

Доступность

Страница проекта: nvlabs.github.io/LongLive/LongLive-Plug
Статья: arXiv 2609.38154
Демонстрационный фильм: YouTube
Веса: Efficient-Large-Model/longlive-plug
Конвертация для ComfyUI few-step адаптера H3: Kijai/MiniMax-H3-experimental

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
LongLive-Plug: NVIDIA дистиллирует few-step LoRA для H3 и Wan | ComfyUI Wiki