MiniMax H3 Prompt Rewriter LoRA: локальное переписывание промптов T2VA
MiniMax-H3-Prompt-Rewriter-LoRA от Lightx2v превращает короткие промпты в структурированные описания H3 T2VA локально, с пакетом узлов ComfyUI для адаптера Qwen3.6-27B.
Команда Lightx2v выпустила MiniMax-H3-Prompt-Rewriter-LoRA (Hugging Face): адаптер LoRA, дообученный на Qwen3.6-27B, переписывает короткие промпты в структурированные аудио-видео описания, ожидаемые MiniMax H3. Это локальная альтернатива размещенному в облаке рабочему процессу промптов Context-IR от MiniMax: подайте в него промпт, соотношение сторон и длительность, и он выдаст покадровый блок integrated_multimodal_description, overall_soundscape и non_diegetic_music, готовый для генерации H3.
Нода переписывания промптов в ComfyUI: короткий промпт на входе, структурированное покадровое описание, звуковой ландшафт и музыка на выходе.
Что это делает
Адаптер преобразует короткий промпт с указанными соотношением сторон и длительностью в структурированное аудио-видео описание H3:
Original prompt + aspect ratio + duration
│
▼
Qwen3.6-27B + this LoRA
│
▼
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...Переписывание расширяет структуру кадров, тайминг, композицию, движение камеры, физические действия и непрерывность, а также добавляет синхронизированный диегетический звук и недиегетическую музыку, сохраняя исходный замысел. Текущий релиз поддерживает переписывание только текстовой T2VA; переписывание первый/последний кадр-в-видео (FL2VA) и референс-в-видео (Ref2VA) запланированы на будущее. Обратите внимание, что это обученное приближение официального сервиса H3-Context-IR, а не точная копия.
Узлы ComfyUI
Участник сообщества pytraveler упаковал LoRA как MiniMax-H3-Prompt-Rewriter-ComfyUI (GitHub), устанавливаемый через ComfyUI-Manager или клонированием в ComfyUI/custom_nodes/. Пакет включает три группы узлов:
- Нода Rewriter: запускает Qwen3.6-27B с LoRA, эталонная реализация формата переписывания
- Узлы Writer: создают тот же структурированный выход из любого GGUF, следующего инструкциям, охватывая T2VA, I2VA, FL2VA, L2VA и Ref2VA, при загрузке примерно 2,6 ГБ и ~5 ГБ VRAM
- Узлы Reference Caption / Multi Reference Caption: преобразуют изображение, аудиоклип или видео в текст подписи, необходимый узлам Writer
Требования к оборудованию
Путь LoRA загружает базовую модель с 27 миллиардами параметров: примерно 16 ГБ VRAM в nf4, ~28 ГБ в int8 или 13–19 ГБ с помощью квантования GGUF с выгрузкой слоев. Сообщество уже просит Lightx2v о варианте 4B/8B, чтобы снизить порог входа.
Доступность
LoRA работает на текстовой стороне: он переписывает промпты и не включает веса генератора MiniMax-H3. Используйте его для вывода через LightX2V или указанный выше пакет узлов ComfyUI; переписанный промпт подается в MiniMax-H3 как обычно. Базовая модель 27B скачивается с Hugging Face при первом использовании.
Сравнение
Видео ниже сравнивают один и тот же чекпойнт MiniMax-H3 с идентичными настройками вывода; отличается только метод переписывания промптов: исходный промпт (без переписывания) против Qwen3.6-27B с H3-T2VA Context Rewriter LoRA.
| Оригинальный промпт (без переписывания) | H3-T2VA Context Rewriter LoRA |
|---|---|
| Эпичный тизер космической оперы, исходный промпт | Тот же промпт, переписанный LoRA |
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.