LongLive-Plug: NVIDIA가 H3와 Wan용 few-step LoRA를 증류하다
NVIDIA의 LongLive-Plug는 few-step, CFG, long-context LoRA를 백본당 한 번만 증류해 54개 다운스트림 모델에서 재사용하며, MiniMax H3와 Wan용 가중치를 제공합니다.
논문 Figure 3의 동일 프레임. 단순 4스텝 샘플링(두 번째 열)은 프레임을 흐리게 만들지만, 전이된 어댑터(네 번째 열)는 4스텝에서도 견딥니다. 상자는 기법 간에 동일한 좌표를 표시합니다.
한 번의 증류, 여러 다운스트림 모델
특화된 비디오 모델을 만드는 작업은 흔히 증류 단계로 끝납니다. 샘플링 스텝을 줄이거나 긴 롤아웃이 일관되게 유지되도록 하기 위해서입니다. 이 단계는 보통 모든 모델마다 반복됩니다. 작업 데이터를 모으고, teacher를 실행하고, 다시 최적화하는 식입니다. 같은 백본으로 학습한 depth 조건화 Wan 파인튜닝과 로보틱스 월드 모델은 각자 자신의 few-step LoRA 비용을 지불했습니다.
LongLive-Plug는 이 작업을 세 가지 기능으로 나누어, 백본 패밀리당 한 번만 증류한 뒤 일반 LoRA처럼 그대로 옮깁니다.
- Few-step LoRA: 샘플링 스텝을 줄이며, 분포 매칭과 CFG 가이드 teacher로 학습합니다.
- CFG LoRA: classifier-free 가이드를 단일 조건부 순전파로 접어 넣습니다.
- Long-context LoRA: causal 오토리그레시브 롤아웃의 오류 누적을 보정합니다.
어댑터는 다운스트림 모델이 가하는 변경에도 살아남도록 설계되었습니다. 조건화 분기를 추가하거나 출력 채널을 확장해도 어댑터는 무효화되지 않으므로, 동일한 파일 세트를 전체 파인튜닝, 작업 LoRA, 추가 제어 모듈이 있는 모델에 붙일 수 있습니다.
CFG 가중치는 다이얼처럼 작동합니다
가이드는 보통 스텝마다 두 번의 비용을 치릅니다. 조건부 순전파 한 번, 무조건부 순전파 한 번입니다. CFG LoRA는 두 번째 순전파를 제거하며, 가이드가 어댑터에 증류되어 있기 때문에 어댑터가 하나의 고정된 크기로 학습되었더라도 LoRA 가중치 자체가 가이드 제어가 됩니다. 가중치를 올리면 무조건부 분기를 다시 실행하지 않고도 프롬프트 속성이 강화됩니다.
중요한 점은 결합된 LoRA 전체를 크기 조절하는 것은 같은 효과가 아니라는 것입니다. 이는 업데이트와 스텝 수를 함께 움직여 출력을 저하시킵니다. 그래서 few-step과 CFG 어댑터가 별도 파일이고, 별도로 가중치를 주는 것입니다. 논문에서 권장하는 비율은 few-step : CFG = 1 : 0.5이며, 모델 카드에서도 이 숫자가 모델의 네이티브 CFG scale이 아니라 어댑터 가중치임을 거듭 밝힙니다.
논문 Figure 5. 결합된 LoRA만 크기 조절하면 프롬프트에 거의 반응하지 않지만, 별도 가중치의 CFG LoRA를 추가하면 결합된 LoRA는 고정된 상태에서 상자 안의 속성이 강화됩니다.
공개된 항목
Hugging Face 컬렉션에는 백본당 few-step 파일 하나와 CFG 파일 하나씩, 총 여섯 개의 어댑터가 있습니다.
| 베이스 모델 | Few-step 어댑터 | CFG 어댑터 | 비고 |
|---|---|---|---|
| MiniMax H3 | LongLive-Plug-MiniMax-H3-few-step (2.6 GB) | LongLive-Plug-MiniMax-H3-cfg (2.6 GB) | PEFT 형식. 카드에서는 당분간 두 파일을 따로 사용하고, 결합 사용은 아직 권장하지 않는다고 밝힙니다 |
| Wan2.1-T2V-14B | LongLive-Plug-Wan2.1-T2V-14B-few-step (1.2 GB) | LongLive-Plug-Wan2.1-T2V-14B-cfg | PEFT 내보내기와 함께 generator_lora_lightx2v.safetensors를 제공 |
| Wan2.2-TI2V-5B | LongLive-Plug-Wan2.2-TI2V-5B-few-step (1.3 GB) | LongLive-Plug-Wan2.2-TI2V-5B-cfg | PEFT adapter_model.safetensors |
Wan2.1-14B few-step 파일은 기존 Wan 워크플로에 바로 넣을 수 있는 파일입니다. ComfyUI의 Wan LoRA 로더가 이미 읽는 lightx2v 명명 방식으로 내보내졌으므로, 다른 Wan 속도 LoRA처럼 ComfyUI/models/loras/에 넣으면 됩니다. MiniMax H3 어댑터는 PEFT 내보내기이므로 ComfyUI에서 로드하려면 변환이 필요합니다. Kijai가 변환된 bf16 버전을 Kijai/MiniMax-H3-experimental에 minimax_h3_ELM_longlive_plug_4step_lora_bf16.safetensors(1.96 GB)로 공개했습니다.
적용 범위와 비용
논문은 세 백본 패밀리에 걸친 54개 다운스트림 모델(Wan2.1-14B에서 24개, Wan2.2-TI2V-5B에서 24개, MiniMax H3에서 6개)과 여덟 가지 작업 카테고리에서 학습 없는 배포를 검증합니다. 카테고리는 월드 모델링, 로보틱스, 구조 조건화 생성, 카메라 및 궤적 제어, 비디오 편집 및 복원, 피사체 및 아바타 생성, 오디오 및 RGBA 생성, 스타일 적응입니다. 네이티브 20~50 스텝 스케줄과 비교해, 베이스에서 증류한 어댑터를 붙이면 4스텝, CFG 없는 추론이 가능하며 디노이징 스텝이 5배에서 12.5배 줄어듭니다.
비용 논거는 논문의 나머지 절반입니다. 베이스 증류에는 약 80 H100 GPU-시간(32개 GPU에서 700회 반복, 약 2.5시간)이 듭니다. 대신 네 가지 다운스트림 작업을 개별적으로 증류하면 depth에 83.9, 월드 모델링에 150.0, 포즈에 86.8, 로보틱스에 56.1 GPU-시간이 추가로 들어 약 총 456.8이 됩니다. 베이스 어댑터를 재사용하면 작업별 데이터 수집 없이 고정된 약 80 GPU-시간에 머뭅니다.
논문 Figure 9: LongVie 2, ABot-PhysWorld, MagicTryOn, Wan-Alpha로, 월드 모델링, 로보틱스, 피사체 조건화, RGBA 출력을 다루며 각각 4스텝 전이 후 동일한 타임스탬프의 네이티브 프레임 두 개와 비교합니다.
MiniMax H3
이번 공개에서 H3 쪽이 가장 좁습니다. 검증된 54개 모델 중 6개가 H3이며, 논문은 H3 비교 10건이 반복 실행 신뢰 구간이 없는 단일 시드 사례라고 밝히고, 네이티브 기본값이 정답이 아니라 참조 운용점이며, 정지 프레임으로는 오디오 품질이나 동기화를 평가하지 않는다고 명시합니다. 예시에서는 4스텝 H3가 단순 4스텝 Euler 샘플링보다 캐릭터 윤곽을 더 잘 유지하지만, 모양은 증류하지 않은 멀티스텝 결과와 여전히 다를 수 있습니다.
논문 Figure 11: 전방 액션 조건의 H3-World와 LineartAnime으로, 증류하지 않은 멀티스텝 추론, 단순 4스텝 샘플링, LongLive-Plug를 사용한 4스텝 추론을 비교합니다.
한계
- 전이 아이디어는 증류 대상으로 삼은 백본에서 작동합니다. Wan2.1, Wan2.2, MiniMax H3는 각자 어댑터 세트를 가지며, 논문은 패밀리 간 재사용을 주장하지 않습니다.
- H3에 대한 효과는 신뢰 구간 없이 단일 시드 10건으로 측정되었고, 오디오 트랙은 평가에 포함되지 않습니다.
- MiniMax H3의 경우 두 어댑터를 당분간 한 번에 하나씩 사용해야 하므로, few-step 속도와 CFG 제어를 아직 함께 조합할 수 없습니다.
- 가이드 제어는 새 샘플러가 아니라 가중치 다이얼입니다. 둘 다 얻으려면 few-step 파일과 CFG 파일을 각각 로드하고 따로 가중치를 주어야 합니다.
이용 가능 정보
프로젝트 페이지: nvlabs.github.io/LongLive/LongLive-Plug
논문: arXiv 2609.38154
데모 영상: YouTube
가중치: Efficient-Large-Model/longlive-plug
H3 few-step 어댑터의 ComfyUI 변환: Kijai/MiniMax-H3-experimental
댓글
GitHub로 로그인하고 토론에 참여하세요.