MiniMax H3 Prompt Rewriter LoRA: 로컬 T2VA 프롬프트 재작성

ComfyUI Wikinews

Lightx2v의 MiniMax-H3-Prompt-Rewriter-LoRA는 짧은 프롬프트를 구조화된 H3 T2VA 설명으로 로컬에서 변환하며, Qwen3.6-27B 어댑터용 ComfyUI 노드 팩도 함께 사용할 수 있습니다.

Lightx2v 팀이 MiniMax-H3-Prompt-Rewriter-LoRA (Hugging Face)를 공개했습니다. 이 LoRA 어댑터는 Qwen3.6-27B에 파인튜닝된 것으로, 짧은 프롬프트를 MiniMax H3가 기대하는 구조화된 오디오-비디오 설명으로 재작성합니다. 이는 MiniMax가 호스팅하는 Context-IR 프롬프트 워크플로의 로컬 대안입니다. 프롬프트에 화면 비율과 재생 시간을 입력하면, H3 생성에 바로 사용할 수 있는 샷별 integrated_multimodal_description, overall_soundscape, non_diegetic_music 블록을 출력합니다.

ComfyUI의 프롬프트 재작성 노드: 왼쪽에 짧은 프롬프트, 오른쪽에 구조화된 샷별 설명, 사운드스케이프 및 음악 필드

ComfyUI의 프롬프트 재작성 노드: 짧은 프롬프트 입력, 구조화된 샷별 설명, 사운드스케이프와 음악 출력.

기능

이 어댑터는 짧은 프롬프트와 요청된 화면 비율 및 재생 시간을 구조화된 H3 오디오-비디오 설명으로 변환합니다.

Original prompt + aspect ratio + duration
                    │
                    ▼
          Qwen3.6-27B + this LoRA
                    │
                    ▼
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...

이 재작성은 원래 의도를 유지하면서 샷 구조, 타이밍, 구도, 카메라 움직임, 물리적 동작, 연속성을 확장하고 동기화된 다이제틱 사운드와 논다이제틱 음악을 추가합니다. 현재 릴리스는 텍스트 전용 T2VA 재작성을 지원하며, FL2VA(첫 번째/마지막 프레임 기반 비디오 생성)와 Ref2VA(레퍼런스 기반 비디오 생성) 재작성은 로드맵에 있습니다. 이는 공식 H3-Context-IR 서비스의 학습 기반 근사치이며, 정확한 복제품이 아닙니다.

ComfyUI 노드

커뮤니티 멤버 pytraveler가 이 LoRA를 MiniMax-H3-Prompt-Rewriter-ComfyUI (GitHub)로 패키징했습니다. ComfyUI-Manager를 통해 설치하거나 ComfyUI/custom_nodes/에 클론하여 설치할 수 있습니다. 이 팩은 세 가지 노드 그룹을 제공합니다:

  • Rewriter 노드: LoRA와 함께 Qwen3.6-27B를 실행하며, 재작성 형식의 레퍼런스 구현입니다.
  • Writer 노드: 지시를 따르는 모든 GGUF에서 동일한 구조화된 출력을 생성합니다. T2VA, I2VA, FL2VA, L2VA, Ref2VA를 지원하며, 다운로드 약 2.6GB, VRAM 약 5GB가 필요합니다.
  • Reference Caption / Multi Reference Caption 노드: 이미지, 오디오 클립 또는 비디오를 Writer 노드에 필요한 캡션 텍스트로 변환합니다.

하드웨어 요구 사항

LoRA 방식은 270억 파라미터 베이스 모델을 로드합니다. 대략 nf4에서 16GB VRAM, int8에서 약 28GB, 또는 레이어 오프로딩을 통한 GGUF 양자화로 13~19GB가 필요합니다. 커뮤니티는 이미 진입 장벽을 낮추기 위해 Lightx2v에 4B/8B 변형을 요청하고 있습니다.

사용 방법

LoRA는 텍스트 측 어댑터입니다. 프롬프트를 재작성하며 MiniMax-H3 생성기 가중치는 포함하지 않습니다. 이를 LightX2V 추론이나 위의 ComfyUI 노드 팩과 함께 사용하세요. 재작성된 프롬프트는 평소와 같이 MiniMax-H3에 입력됩니다. 27B 베이스 모델은 최초 사용 시 Hugging Face에서 다운로드됩니다.

비교

아래 비디오는 동일한 MiniMax-H3 checkpoint와 동일한 추론 설정을 사용한 비교입니다. 프롬프트 재작성 방법만 다릅니다. 즉, 원본 프롬프트(재작성 없음)와 H3-T2VA Context Rewriter LoRA를 적용한 Qwen3.6-27B의 결과를 보여줍니다.

원본 프롬프트 (재작성 없음)H3-T2VA Context Rewriter LoRA
장대한 스페이스 오페라 티저, 원본 프롬프트동일한 프롬프트, LoRA로 재작성됨

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
MiniMax H3 Prompt Rewriter LoRA: 로컬 T2VA 프롬프트 재작성 | ComfyUI Wiki