MiniMax H3 Prompt Rewriter LoRA:本地 ComfyUI T2VA 提示词重写
Lightx2v 的 MiniMax-H3-Prompt-Rewriter-LoRA 可在本地将简短提示词转换为结构化的 H3 T2VA 描述,并提供适用于 Qwen3.6-27B 适配器的 ComfyUI 节点包。
Lightx2v 团队发布了 MiniMax-H3-Prompt-Rewriter-LoRA(Hugging Face),这是一个在 Qwen3.6-27B 上微调的 LoRA 适配器,可将简短提示词重写为 MiniMax H3 所需的结构化音视频描述。它是 MiniMax 托管的 Context-IR 提示词工作流的本地替代方案:输入提示词以及宽高比和时长,即可输出逐镜头的 integrated_multimodal_description、overall_soundscape 和 non_diegetic_music 代码块,可直接用于 H3 生成。
ComfyUI 中的提示词重写节点:输入简短提示词,输出结构化的逐镜头描述、音景和音乐。
功能简介
该适配器可将简短提示词以及所需的宽高比和时长转换为结构化的 H3 音视频描述:
Original prompt + aspect ratio + duration
│
▼
Qwen3.6-27B + this LoRA
│
▼
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...重写会扩展镜头结构、时间安排、构图、相机运动、物理动作和连续性,并在保留原始意图的同时,添加同步的剧情声音和非剧情音乐。当前版本支持纯文本 T2VA 重写;首帧/尾帧生视频(FL2VA)和参考生视频(Ref2VA)重写已列入路线图。请注意,它是对官方 H3-Context-IR 服务的一种基于学习的近似实现,而非精确复刻。
ComfyUI 节点
社区成员 pytraveler 将 LoRA 打包为 MiniMax-H3-Prompt-Rewriter-ComfyUI(GitHub),可通过 ComfyUI-Manager 安装,或克隆到 ComfyUI/custom_nodes/ 目录中。该节点包包含三个节点分组:
- 重写器节点:运行带有 LoRA 的 Qwen3.6-27B,是重写格式的参考实现
- 写入器节点:可从任何可遵循指令的 GGUF 生成相同的结构化输出,覆盖 T2VA、I2VA、FL2VA、L2VA 和 Ref2VA,下载量约 2.6 GB,VRAM 约 5 GB
- 参考描述 / 多参考描述节点:将图像、音频片段或视频转换为写入器节点所需的描述文本
硬件要求
LoRA 方案需要加载一个 270 亿参数的基础模型:约需 16 GB VRAM(nf4 量化),int8 下约 28 GB,或通过 GGUF 量化配合层卸载(layer offloading)压缩至 13 至 19 GB。社区已经在呼吁 Lightx2v 推出 4B/8B 变体,以降低使用门槛。
获取方式
该 LoRA 是一个文本侧适配器:它只负责重写提示词,不包含 MiniMax-H3 生成器的权重。可将其与 LightX2V 推理或上述 ComfyUI 节点包配合使用;重写后的提示词会照常输入 MiniMax-H3。27B 基础模型会在首次使用时从 Hugging Face 下载。
对比
下面的视频在相同的推理设置下对比了同一个 MiniMax-H3 检查点;只有提示词重写方法不同:原始提示词(不重写)对比使用 H3-T2VA Context Rewriter LoRA 的 Qwen3.6-27B。
| 原始提示词(不重写) | H3-T2VA Context Rewriter LoRA |
|---|---|
| 史诗级太空歌剧预告片,使用原始提示词 | 相同提示词,由 LoRA 重写 |
评论
使用 GitHub 登录后即可参与讨论。