MiniMax-H3 × Z-Image: H3 비디오를 위한 공간 디테일 그라프트
커뮤니티 그라프트가 q_norm 리스케일링을 통해 Z-Image 의 공간 어텐션을 MiniMax-H3 에 이식합니다: 조인트 간에 평탄한 디테일을 유지하며 더 풍부한 세트와 텍스처를 제공하며, 드롭인 ComfyUI 체크포인트입니다.
무엇인가
Z-Image(Lumina2, 뛰어난 텍스처 렌더링으로 알려진 6B 이미지 모델) 와 MiniMax-H3 모두 어텐션에서 헤드별 Q 정규화를 사용합니다. 이 그라프트는 재학습, 새로운 지식, 또는 아키텍처 변경 없이 Z-Image 처럼 미세한 텍스처에 어텐션하도록 H3 의 후기 블록 q_norm 가중치를 리스케일링합니다. 초기 블록은 만지지 않습니다(그라프트하면 일반 텍스처에서 격자 아티팩트가 발생하므로 측정된 것이지 추측이 아닙니다), K 정규화와 순전달 레이어는 수정되지 않습니다.
이는 작성자의 라인에서 두 번째 "결합"입니다: Joy-LTX 2.5 은 JoyAI-Echo 의 성능을 가중치 델타 이식을 통해 LTX-2.5 로 이전했습니다. 여기서는 공여자가 완전히 다른 아키텍처이므로, 넘어가는 것은 가중치가 아닌 어텐션 통계이며, 블록 게이트되고 용량 제어되며, 동일 시드 베이스라인과 검증되었습니다.
어떻게 보이는가
데모 비디오, 이 페이지의 파일로 렌더링된 3 샷 연속 촬영:
체인된 장면에서 측정했을 때, 추가 디테일은 조인트 간에 평탄하게 유지됩니다: 3 개의 조인트에서 0.99 의 고대역 비율 대 스톡의 1.11, 즉 샷별 샤프닝 크리프가 없습니다.
ComfyUI 사용법
H3 체크포인트가 있는 곳에 파일을 넣고 로더에서 선택하세요. 모든 H3 워크플로가 변경 없이 작동하며, MiniMax-H3 Multishot 시리스체인 캔버스를 포함합니다. ComfyUI-ready 빌드 (bf16 / fp8 / int8 / w4a8 / nvfp4) 는 ComfyUI 0.32+ 에서 기본 확산 모델 로드 노드로 로드됩니다; GGUF 저장소는 작은 카드를 위해 curve 베이킹을 제공합니다:
| 파일 | 적합 |
|---|---|
*-curve-zs05-Q8_0.gguf | 32 GB |
*-curve-zs05-Q5_1.gguf | 24-32 GB |
*-curve-zs05-Q4_0.gguf | 16-24 GB |
fl2va 대 ref2va: 스톡 H3 과 동일한 선택, 아이덴티티와 보이스가 지속되어야 할 때는 ref2va(참조 이미지, 음성 앵커링, 아이덴티티 뱅크), 샷이 제공된 프레임에 맞춰져야 할 때는 fl2va. 둘 다 체인됩니다. RTX 30/40 카드에서 작성자는 GGUF 빌드가 Ampere 의 어떤 4 비트 ComfyUI-ready 버전보다 4-8 배 빠르다고 보고합니다.
검증
작성자는 런타임 패치 구현체에 대한 동일 시드 등가를 보고하며, 변형 전반에 걸쳐 얼굴에서 아이덴티티가 유지됩니다(얼굴 텍스처가 스톡보다 개선됨), 4 샷 체인된 장면이 아티팩트 없이 스크립트된 이벤트를 수행하고, 모든 파일에 대한 베이킹 후 그라프트 수학의 텐서 레벨 검증을 거쳤습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.