LongLive-Plug: NVIDIA дистиллирует few-step LoRA для H3 и Wan
LongLive-Plug от NVIDIA дистиллирует few-step, CFG и long-context LoRA один раз для каждого бэкбона и переиспользует их в 54 нижестоящих моделях, с весами для MiniMax H3 и Wan.
Сопоставленные кадры из рисунка 3 статьи. Наивная четырёхшаговая выборка (второй столбец) размывает кадр; перенесённые адаптеры (четвёртый столбец) держатся на четырёх шагах. Рамками отмечены одинаковые координаты во всех методах.
Одна дистилляция для множества нижестоящих моделей
Создание специализированной видеомодели часто заканчивается этапом дистилляции: чтобы сократить число шагов выборки или чтобы длинные прогоны не разваливались. Обычно этот этап повторяют для каждой модели: собрать данные задачи, запустить учителя, снова оптимизировать. Fine-tune Wan с условием по глубине и мировая модель для робототехники, обученные на одном бэкбоне, каждый оплачивал свой собственный few-step LoRA.
LongLive-Plug делит эту работу на три возможности, которые дистиллируются один раз для каждого семейства бэкбонов, а затем переносятся как обычные LoRA:
- Few-step LoRA: меньше шагов выборки, обучение с сопоставлением распределений и учителем с CFG-направлением.
- CFG LoRA: сворачивает classifier-free guidance в один условный прямой проход.
- Long-context LoRA: исправляет накопление ошибок в каузальных авторегрессивных прогонах.
Адаптеры спроектированы так, чтобы переживать изменения, которые вносит нижестоящая модель. Добавление ветвей условий или расширение выходных каналов не делает их недействительными, поэтому один и тот же набор файлов подключается к полным fine-tune, LoRA для задач и моделям с дополнительными модулями управления.
Вес CFG работает как регулятор
Направление обычно оплачивается дважды за шаг: один условный проход, один безусловный. CFG LoRA убирает второй проход, и поскольку направление дистиллировано в адаптер, сам вес LoRA становится управлением направлением, хотя адаптер обучался при одном фиксированном масштабе. Его повышение усиливает атрибуты промпта без повторного запуска безусловной ветви.
Важная деталь: масштабирование всего связанного LoRA даёт не тот же результат: оно двигает обновление и число шагов вместе и ухудшает вывод. Именно поэтому few-step и CFG адаптеры это отдельные файлы, и поэтому их веса задаются отдельно. Рекомендуемое статьёй соотношение: few-step : CFG = 1 : 0.5, и карточки моделей повторяют, что эти числа это веса адаптеров, а не нативный масштаб CFG модели.
Рисунок 5 статьи. Масштабирование только связанного LoRA почти не реагирует на промпт; добавление отдельно взвешенного CFG LoRA усиливает отмеченные рамками атрибуты, тогда как связанный LoRA остаётся неизменным.
Что было выпущено
В коллекции на Hugging Face шесть адаптеров: по одному файлу few-step и одному CFG на каждый бэкбон.
| Базовая модель | Few-step адаптер | CFG адаптер | Примечания |
|---|---|---|---|
| MiniMax H3 | LongLive-Plug-MiniMax-H3-few-step (2.6 GB) | LongLive-Plug-MiniMax-H3-cfg (2.6 GB) | Формат PEFT. В карточках сказано использовать их пока по отдельности, совместное использование пока не рекомендуется |
| Wan2.1-T2V-14B | LongLive-Plug-Wan2.1-T2V-14B-few-step (1.2 GB) | LongLive-Plug-Wan2.1-T2V-14B-cfg | Вместе с экспортом PEFT поставляется generator_lora_lightx2v.safetensors |
| Wan2.2-TI2V-5B | LongLive-Plug-Wan2.2-TI2V-5B-few-step (1.3 GB) | LongLive-Plug-Wan2.2-TI2V-5B-cfg | PEFT adapter_model.safetensors |
Файл few-step для Wan2.1-14B можно сразу подключить к существующему рабочему процессу Wan: он экспортирован в именовании lightx2v, которое загрузчики LoRA для Wan в ComfyUI уже читают, поэтому он кладётся в ComfyUI/models/loras/ как любой другой speed LoRA для Wan. Адаптеры MiniMax H3 это экспорты PEFT, и их нужно конвертировать, прежде чем ComfyUI их загрузит; Kijai опубликовал конвертированную версию bf16 по адресу Kijai/MiniMax-H3-experimental как minimax_h3_ELM_longlive_plug_4step_lora_bf16.safetensors (1.96 GB).
Охват и стоимость
Статья подтверждает развёртывание без обучения на 54 нижестоящих моделях из трёх семейств бэкбонов (24 на Wan2.1-14B, 24 на Wan2.2-TI2V-5B, шесть на MiniMax H3) и восьми категориях задач: моделирование мира, робототехника, генерация с обусловливанием структурой, управление камерой и траекторией, редактирование и восстановление видео, генерация субъекта и аватара, генерация аудио и RGBA, и адаптация стиля. По сравнению с нативными расписаниями от 20 до 50 шагов подключение дистиллированных на базовой модели адаптеров даёт вывод за четыре шага без CFG: сокращение шагов денойзинга в 5-12.5 раза.
Аргумент о стоимости это вторая половина статьи. Базовая дистилляция занимает около 80 GPU-часов H100 (700 итераций на 32 GPU, примерно 2.5 часа). Дистилляция четырёх нижестоящих задач по отдельности стоит дополнительно 83.9 (глубина), 150.0 (моделирование мира), 86.8 (поза) и 56.1 (робототехника) GPU-часов, всего около 456.8. Переиспользование базовых адаптеров остаётся на фиксированных ~80 GPU-часах, без сбора данных под конкретные задачи.
Рисунок 9 статьи: LongVie 2, ABot-PhysWorld, MagicTryOn и Wan-Alpha, охватывающие моделирование мира, робототехнику, обусловливание субъектом и вывод RGBA; для каждого сравниваются два нативных кадра с одинаковыми временными метками после четырёхшагового переноса.
MiniMax H3
Часть выпуска, касающаяся H3, самая узкая. Шесть из 54 проверенных моделей это H3, и статья указывает, что её десять сравнений для H3 это случаи с одним seed без доверительных интервалов по повторным запускам, что нативное значение по умолчанию это опорная рабочая точка, а не истина в последней инстанции, и что статичные кадры не оценивают качество и синхронизацию аудио. Примеры показывают, что четырёхшаговый H3 лучше удерживает контуры персонажей, чем наивная четырёхшаговая выборка Euler, хотя внешний вид всё ещё может отличаться от недистиллированного многошагового результата.
Рисунок 11 статьи: H3-World с условием прямого действия и LineartAnime, сравнение недистиллированного многошагового вывода, наивной четырёхшаговой выборки и четырёхшагового вывода с LongLive-Plug.
Ограничения
- Идея переноса работает на тех бэкбонах, для которых она дистиллировалась. У Wan2.1, Wan2.2 и MiniMax H3 свой набор адаптеров, и статья не заявляет о переиспользовании между семействами.
- Эффект на H3 измерен на десяти случаях с одним seed без доверительных интервалов, а аудиодорожка не входит в оценку.
- Для MiniMax H3 два адаптера пока следует использовать по одному за раз, поэтому скорость few-step и управление CFG там пока нельзя совместить.
- Управление направлением это регулятор веса, а не новый сэмплер: файлы few-step и CFG нужно загружать и взвешивать отдельно, чтобы получить и то, и другое.
Доступность
Страница проекта: nvlabs.github.io/LongLive/LongLive-Plug
Статья: arXiv 2609.38154
Демонстрационный фильм: YouTube
Веса: Efficient-Large-Model/longlive-plug
Конвертация для ComfyUI few-step адаптера H3: Kijai/MiniMax-H3-experimental
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.