MiniMax-H3 × Z-Image:H3 视频空间细节移植模型
社区移植通过 q_norm 重缩放将 Z-Image 的空间注意力移植到 MiniMax-H3:更丰富的布景和纹理,接缝处细节平坦,即插即用 ComfyUI checkpoint。
这是什么
Z-Image(Lumina2,一个以卓越纹理渲染著称的 6B 图像模型)和 MiniMax-H3 都在注意力机制中使用每头 Q 归一化。该移植重新缩放 H3 后期块的 q_norm 权重,使其像 Z-Image 一样关注精细纹理,无需重新训练、新知识或架构更改。早期块保持不变(移植它们会在常规纹理中产生晶格伪影,这是测量得出的而非猜测),且 K 归一化和前馈层从未被修改。
这是该作者系列中的第二次“结合”:Joy-LTX 2.5 通过权重差移植将 JoyAI-Echo 的性能转移到 LTX-2.5 上。这里供体是完全不同的架构,所以跨越的是注意力统计量而非权重,经过块门控和剂量控制,并与同种子基线验证。
效果展示
演示视频,本页文件渲染的三镜头连续片段:
在链式场景上测量,额外细节在接缝处保持平坦:3 个接缝上的高频比为 0.99,而原版为 1.11,即没有逐镜头锐化漂移。
ComfyUI 用法
将文件放入您的 H3 checkpoint 所在位置并在加载器中选择它。所有 H3 工作流均可不变地使用,包括 MiniMax-H3 Multishot 无缝链画布。ComfyUI-ready 构建版本(bf16 / fp8 / int8 / w4a8 / nvfp4)在 ComfyUI 0.32+ 上使用标准的 UNet 加载器 node 加载;GGUF 仓库提供针对较小显卡的曲线烘焙:
| 文件 | 适配 |
|---|---|
*-curve-zs05-Q8_0.gguf | 32 GB |
*-curve-zs05-Q5_1.gguf | 24-32 GB |
*-curve-zs05-Q4_0.gguf | 16-24 GB |
fl2va vs ref2va:与原版 H3 选择相同,当身份和声音必须保留时使用 ref2va(参考图像、声音锚定、身份库),当镜头必须落在提供的帧上时使用 fl2va。两者都支持链式。在 RTX 30/40 显卡上,作者报告 GGUF 构建比任何基于 Ampere 的 4 位 ComfyUI-ready 实现快 4-8 倍。
验证
作者报告与运行时补丁实现的同种子等价性,变体间面部身份保持一致(面部纹理优于原版),4 镜头链式场景无伪影地呈现脚本事件,以及每个文件烘焙后的移植数学张量级验证。
评论
使用 GitHub 登录后即可参与讨论。