SelfLift, ComfyUI에 점진적 해상도 샘플링 도입

ComfyUI Wikinews

comfyui-SelfLift는 초기 디노이징을 저해상도에서 실행하고 전체 해상도에서 완료하는, Z-Image, FLUX.2-Klein, MiniMax H3를 위한 학습 없는 속도 향상과 TST 보정을 제공합니다.

comfyui-SelfLift는 SelfLift 점진적 해상도 방법을 ComfyUI로 이식한 것입니다. 첫 디노이징 단계는 저해상도에서 실행되고, 중간 잠재 데이터가 전체 해상도로 리프팅되며, 남은 단계는 그곳에서 완료됩니다. 학습이 필요 없고 이미지 경로에는 추가 모델이 필요하지 않습니다.

SelfLift가 스케줄을 나누는 방식

Z-Image-Turbo, FLUX.2-Klein 같은 소수 단계 모델은 시간 축을 압축하기 때문에, 남은 각 순방향 연산의 공간 비용이 지배적인 항이 됩니다. 점진적 해상도 샘플링은 먼저 저해상도에서 디노이징하여 그 비용을 줄입니다. SelfLift 논문(arXiv:2609.02036)이 지적하는 문제는, 잠재 데이터를 단순히 리프팅한 뒤 남은 몇 단계가 불일치를 흡수하리라 믿으면 눈에 띄는 아티팩트가 남는다는 점입니다.

SelfLift는 대신 모델 자체에서 복구 신호를 도출합니다. 리프팅 이후 고위험 위치의 일부를 픽셀-VAE 앵커 쪽으로 보정하고, 저해상도 프리픽스가 동일한 궤적의 유효한 부분으로 남도록 전환을 설계합니다. 논문에서 보고된 시작점은 Z-Image-Turbo의 경우 8단계 중 6단계를 저해상도에서, FLUX.2-Klein의 경우 4단계 중 3단계입니다.

점진적 해상도 디노이징을 보여주는 SelfLift 티저 이미지

프로젝트 페이지의 SelfLift 티저 이미지입니다.

하나의 패키지에 담긴 세 개의 노드

노드클래스기능
SelfLift Progressive Sampler (Image)SelfLiftImageSampler모델 자체 VAE를 사용하는, rectified-flow 이미지 모델용 점진적 해상도 샘플링
SelfLift Progressive Sampler (MiniMax H3)SelfLiftH3Sampler동일한 아이디어를 H3에 맞춘 실험적 오디오-비디오 적용
H3 Temporal State Transport (TST)SelfLiftH3TSTH3 비디오의 시간적 불균형을 보정하는 MODELMODEL 패치

샘플러는 표준 ComfyUI 샘플러 연결 방식에 맞춰집니다. SamplerCustom처럼 samplersigmas 입력을 받으므로, euler로 설정한 KSamplerSelect와 모델 자체의 스케줄러를 연결하면 됩니다. 다른 샘플러는 의도적으로 거부됩니다.

주요 조정 값은 transition_step(저해상도로 유지되는 단계 수), lowres_scale(기본값 0.5), rho(VAE 앵커 쪽으로 끌어당기는 고위험 위치의 비율, 0이면 비활성화), 보정 강도를 위한 w_min / w_max, 리프팅 보간 방식(nearest 또는 bilinear), 그리고 고해상도 단계에서 다른 체크포인트나 LoRA 스택을 실행할 수 있게 하는 선택적 model_hires입니다. 이 전환은 추가 디노이저 평가를 더하지 않습니다. rho가 0이 아닌 한 N단계 스케줄은 정확히 N으로 유지되며, 여기에 VAE 디코드, 업스케일, 재인코딩 왕복이 한 번 추가됩니다.

SelfLift 개요 다이어그램

SelfLift 개요: 저해상도 프리픽스, 잠재 데이터 리프팅, 앵커링된 고해상도 단계.

MiniMax H3 경로

H3 샘플러는 작성자가 명시적으로 실험적이라고 표시했으며 논문에서 검증되지 않았습니다. 두 가지 리프팅 경로를 제공합니다.

  • 외부 업스케일러(기본값): rho가 0인 설치된 H3 잠재 업스케일러를 사용하는, 학습된 잠재 데이터 전용 리프팅입니다. README에서 크레딧을 밝힌 H3 잠재 업스케일러 가중치와 호환되며, 노드는 models/latent_upscale_models/에서 h3 파일을 가져옵니다.
  • SelfLift-zero: upscaler_model을 none으로 설정하고 rho를 0보다 크게 지정합니다. 작성자가 테스트한 H3 시작점은 rho 0.6w_minw_max를 1로 둔 값으로, 단일 시드 실행에서 논문의 이미지 설정이 H3의 직접 리프팅 경로에 아티팩트를 남긴다는 점을 확인한 뒤 정해졌습니다.

실험적 highres_tiling 옵션은 고해상도 단계를 1~8개의 공간 타일로 나눕니다. 첫 번째 타일의 오디오만 유지하고, 타일 간 어텐션이 없으며 ControlNet을 지원하지 않으므로 품질 설정이라기보다 메모리 타협에 가깝습니다.

Temporal State Transport (TST)

TST는 여기에 이식된 두 번째 논문(arXiv:2609.08505)입니다. 프레임 수준 어텐션 연산자의 부호 있는 스펙트럼 긴장도를 측정하고 불균형한 헤드만 보정하여, 과도하게 혼합된 헤드는 선명하게 하고 파편화된 헤드는 부드럽게 만들며, 더 깊은 레이어와 이전 단계에서 더 강하게 보정합니다. SelfLift 샘플러뿐 아니라 모든 표준 샘플러와 함께 작동하며, 작성자는 런타임 오버헤드가 약 1~2퍼센트라고 보고합니다.

실제로는 사용자가 H3 출력에서 가장 많이 눈치채는 실패를 겨냥합니다. 화면상의 텍스트나 로고처럼 깜빡이거나 변형되는 세부 정보, 인물과 의상의 정체성 드리프트, 물리적으로 불가능한 움직임입니다. tau가 강도 조정 값이며 0.2가 권장 값입니다. 0.5는 눈에 띄게 너무 강합니다. 모델에 없는 세부 정보를 만들어낼 수는 없고, H3 모델에만 적용되며, highres_tiling이 켜져 있으면 건너뜁니다. 로깅 옵션은 모델 순방향마다 진단 라인 하나를 출력하며, 여기에는 보정된 헤드의 비율이 포함됩니다. 작성자가 측정했을 때 헤드의 89~100퍼센트에서 정확한 어텐션 연산자와 일치했다고 합니다.

사용 가능 여부

facok/comfyui-SelfLiftComfyUI/custom_nodes에 복제하고 재시작하면, 모든 노드가 selflift 카테고리에 나타납니다. 이 패키지는 영어와 중국어 문서를 제공하며, H3 리프팅 경로를 조정하기 위한 진단 프리셋 표도 포함되어 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
SelfLift, ComfyUI에 점진적 해상도 샘플링 도입 | ComfyUI Wiki