MiniMax H3 语义桥接:11MB 适配器提升 ComfyUI 提示词遵循度
独立蒸馏项目将 SenseNova U1.5 的语义迁移至 MiniMax H3 的 conditioning 空间,提供包含 ComfyUI 节点和示例工作流的 11MB 独立适配器。
发布的示例工作流展示了语义桥接节点在标准 H3 FL2VA pipeline 中的位置:位于文本 conditioning 之后,sampling 之前。
为何不能直接嫁接权重?
作者首先测试了直观的方法:直接将 SenseNova U1.5 的 Transformer 权重移植到 MiniMax H3。这完全失败了。对比相关 2D 权重,H3 有 264 个 tensor,而 SenseNova 有 593 个,没有精确形状匹配、零转置匹配,也没有匹配的输入或输出 dimensions。
可行的接口实际上是 conditioning representations。H3 在将其投影到内部 5376 维 Transformer 空间之前,会消耗 5120 维的文本 conditioning,而 SenseNova 的语言表示是 4096 维。项目没有复制权重,而是对齐了两种架构如何表示相同的提示词,然后将该映射蒸馏为紧凑的 H3 侧适配器。
研究路径已在仓库中完整记录:hidden-representation alignment 在原始分布的保留提示词上达到了约 0.904 的 validation cosine 相似度,在 160 个严格的 out-of-distribution 提示词上为 0.749。完整的 teacher bridge(在 inference 时运行 SenseNova)可行但不切实际,因此被蒸馏为 student 适配器,直接从 H3 自身的 conditioning 预测 teacher-derived representation。最终 student 模型达到 0.996 teacher-representation cosine 和 0.984 correction cosine,out-of-distribution correction 为 0.990。
适配器在 ComfyUI 中的作用
该适配器不是 LoRA、checkpoint merge 或 parameter graft。在 inference 时,它仅作用于 H3 conditioning:节点将原生 H3 文本 conditioning 转换为学习到的语义表示,进行 magnitude-match,并作为残差混合回去(C = H + alpha * (S - H)),不触碰 diffusion Transformer 权重。Inference 时无需 SenseNova。
节点包 (zip on HF) 提供三个节点:
- MiniMax H3 图像转视频 + 语义桥接:标准 H3 图生视频路径的即插即用包装器
- MiniMax H3 语义桥接:conditioning transform 本身,带有
alpha(默认 0.10,A/B 示例使用 0.15)和magnitude_match(per-token recommended)控制 - MiniMax H3 清除语义桥接缓存
安装:将 zip 解压到 ComfyUI/custom_nodes/,将 MiniMaxH3_SemanticBridge_v1.safetensors 放入 ComfyUI/models/semantic_bridge/,然后 restart。整个适配器约为 11MB。
目标:提示词遵循度,而非新风格
该项目专注于语义结构而非添加视觉概念:复杂构图、空间关系、解剖结构、物体计数、文本约束、材质与光照,以及反射或 occlusion 行为。旗舰 A/B 示例强调了一个提示词,要求一只手平放在玻璃桌面上,“所有五根手指自然分开且清晰可见”,以及其他许多同时存在的约束。
![]() | ![]() |
|---|---|
| 原生 H3:右手在桌面上漂移 | 语义桥接 (alpha 0.15):手保持如提示词所述放置 |
启用桥接后的玻璃桌 A/B 对后半段 (alpha 0.15)。
作者明确指出这些是来自受控对的定性观察,而非 benchmark:适配器可能对某些提示词有帮助,对其他提示词作用不大,或偶尔使结果变差。Representation-space metrics 不会直接转化为 perceptual quality gains。
范围:仅限 FL2VA,以及 24GB 开发设备
两个实用说明。第一,v1 仅在标准 FL2VA / text-conditioned 路径上有效。测试了兼容 Ref2VA 的变体,但降低了 reference-audio 的 singing 和 lip sync 效果,因此 README 明确警告不要用于 reference-conditioned generation。
第二,整个项目(representation extraction、bridge experiments、distillation、evaluation)在单个 24GB RTX 3090 Ti 上运行,无需 multi-GPU cluster。对于在不兼容 architecture 之间转移 learned behavior 的实验来说,这可以说是发布中最有趣的部分。
可用性
- 适配器、节点、工作流、研究材料:speach1sdef178/MiniMax-H3-Semantic-Bridge 在 Hugging Face
- 许可证:模型衍生产物遵循 MiniMax H3 Community License(包含 NOTICE);SenseNova U1.5 teacher 为 Apache-2.0 且不重新分发
- 完整研究文章:RESEARCH_ARTICLE.md


评论
使用 GitHub 登录后即可参与讨论。