MiniMax-H3 × Z-Image: H3 비디오를 위한 공간 디테일 그라프트

ComfyUI Wikinews

커뮤니티 그라프트가 q_norm 리스케일링을 통해 Z-Image 의 공간 어텐션을 MiniMax-H3 에 이식합니다: 조인트 간에 평탄한 디테일을 유지하며 더 풍부한 세트와 텍스처를 제공하며, 드롭인 ComfyUI 체크포인트입니다.

MiniMax-H3 × Z-Image (ComfyUI-ready repo | GGUF repo) 는 joeygambino 의 커뮤니티 공간 디테일 그라프트로, Z-Image 의 텍스처 날카로운 어텐션 프로필을 MiniMax-H3 의 후기 블록으로 이식합니다. 결과는 표준 H3 체크포인트의 드롭인 대체제입니다: 동일한 아이덴티티, 보이스, 속도 및 VRAM 을 가지며, 눈에 띄게 더 풍부한 세트와 표면을 제공합니다.

무엇인가

Z-Image(Lumina2, 뛰어난 텍스처 렌더링으로 알려진 6B 이미지 모델) 와 MiniMax-H3 모두 어텐션에서 헤드별 Q 정규화를 사용합니다. 이 그라프트는 재학습, 새로운 지식, 또는 아키텍처 변경 없이 Z-Image 처럼 미세한 텍스처에 어텐션하도록 H3 의 후기 블록 q_norm 가중치를 리스케일링합니다. 초기 블록은 만지지 않습니다(그라프트하면 일반 텍스처에서 격자 아티팩트가 발생하므로 측정된 것이지 추측이 아닙니다), K 정규화와 순전달 레이어는 수정되지 않습니다.

이는 작성자의 라인에서 두 번째 "결합"입니다: Joy-LTX 2.5 은 JoyAI-Echo 의 성능을 가중치 델타 이식을 통해 LTX-2.5 로 이전했습니다. 여기서는 공여자가 완전히 다른 아키텍처이므로, 넘어가는 것은 가중치가 아닌 어텐션 통계이며, 블록 게이트되고 용량 제어되며, 동일 시드 베이스라인과 검증되었습니다.

어떻게 보이는가

데모 비디오, 이 페이지의 파일로 렌더링된 3 샷 연속 촬영:

체인된 장면에서 측정했을 때, 추가 디테일은 조인트 간에 평탄하게 유지됩니다: 3 개의 조인트에서 0.99 의 고대역 비율 대 스톡의 1.11, 즉 샷별 샤프닝 크리프가 없습니다.

ComfyUI 사용법

H3 체크포인트가 있는 곳에 파일을 넣고 로더에서 선택하세요. 모든 H3 워크플로가 변경 없이 작동하며, MiniMax-H3 Multishot 시리스체인 캔버스를 포함합니다. ComfyUI-ready 빌드 (bf16 / fp8 / int8 / w4a8 / nvfp4) 는 ComfyUI 0.32+ 에서 기본 확산 모델 로드 노드로 로드됩니다; GGUF 저장소는 작은 카드를 위해 curve 베이킹을 제공합니다:

파일적합
*-curve-zs05-Q8_0.gguf32 GB
*-curve-zs05-Q5_1.gguf24-32 GB
*-curve-zs05-Q4_0.gguf16-24 GB

fl2va 대 ref2va: 스톡 H3 과 동일한 선택, 아이덴티티와 보이스가 지속되어야 할 때는 ref2va(참조 이미지, 음성 앵커링, 아이덴티티 뱅크), 샷이 제공된 프레임에 맞춰져야 할 때는 fl2va. 둘 다 체인됩니다. RTX 30/40 카드에서 작성자는 GGUF 빌드가 Ampere 의 어떤 4 비트 ComfyUI-ready 버전보다 4-8 배 빠르다고 보고합니다.

검증

작성자는 런타임 패치 구현체에 대한 동일 시드 등가를 보고하며, 변형 전반에 걸쳐 얼굴에서 아이덴티티가 유지됩니다(얼굴 텍스처가 스톡보다 개선됨), 4 샷 체인된 장면이 아티팩트 없이 스크립트된 이벤트를 수행하고, 모든 파일에 대한 베이킹 후 그라프트 수학의 텐서 레벨 검증을 거쳤습니다.

링크

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax-H3 × Z-Image: H3 비디오를 위한 공간 디테일 그라프트 | ComfyUI Wiki