TaoMate-H3: MiniMax H3용 Alibaba 실시간 스트리밍 LoRA
Alibaba의 TaoLive AIGC 팀이 3-step LoRA 런타임 TaoMate-H3를 오픈소스로 공개했습니다. 동기화된 오디오와 비디오를 청크 단위로 스트리밍해 35 FPS 장편 MiniMax H3 생성까지 지원합니다.
개요
TaoMate는 few-step 결합 오디오-비디오 생성을 위한 앵커 기반 영구 메모리 프레임워크로, 프로젝트 논문과 프로젝트 페이지에 설명되어 있습니다. 활성 컨텍스트 캐시를 확장하는 대신 불변 시각 앵커를 유지하고, 완료된 비디오 및 오디오 블록을 고정 용량의 동적 상태로 압축한 뒤 모달리티별 잔차 어텐션을 통해 해당 상태를 검색합니다. 참조 인식 변조 방법은 비디오 특징을 앵커 모양 통계에 조건화하며, 앵커 보존 인과 컨텍스트 증류는 학습 중 앵커가 흔들리지 않도록 유지합니다.
| 지표 | 값 |
|---|---|
| 스트리밍 출력 | 35 FPS |
| 단일 디바이스 지연 | 130.3 s / 1441 frames |
| 백본 | 22.1B (MiniMax H3) |
| 장기 일관성 | 0.9520 |
| 오디오 비동기 | 0.000 |
공개된 런타임은 음성, 사운드 효과, 비디오를 하나의 동기화된 타임라인에서 생성하며, KV 캐시 핸드오프가 깔끔하게 이루어져 프롬프트 경계를 넘어 시각적 정체성, 목소리, 움직임을 유지합니다. 각 5초 블록은 --prompt-json 파일을 통해 자체 프롬프트를 가질 수 있으며, 생성은 480p, 768p, 정렬된 1080p에서 실행됩니다. 검증된 하드웨어 구성은 텐서 및 시퀀스 병렬 처리를 적용한 8 x H20 96 GB입니다.
공식 데모 릴의 샘플 프레임: 스트리밍 블록 전반에 걸쳐 유지되는 한 명의 내레이터 캐릭터.
공개된 내용
- 런타임 코드: 청크 생성, 블록별 프롬프트 스케줄링, 스테이지 병렬 실행을 포함한 전체 스트리밍 추론 스택. TaoLiveAIGC/TaoMate-H3에서 확인할 수 있습니다.
- 3-step LoRA 어댑터: step-3000 generator EMA 체크포인트(rank 128, alpha 128, FP32 텐서)로, Hugging Face의 TaoLiveAIGC/TaoMate-H3에서 제공되며 MiniMax H3 FL2VA 베이스 모델과 함께 사용합니다.
- 데모 갤러리: 프로젝트 페이지에서 무중단 30분 다큐멘터리 내레이터를 포함한 샘플 릴을 볼 수 있습니다.
공식 데모: 동기화된 오디오와 함께 생성된 10초 클레이 로봇 클립.
커뮤니티 반응
이번 공개는 MiniMax H3 커뮤니티에서 빠르게 주목을 받았습니다. 일주일 만에 GitHub 스타 150개 이상을 모았고, 커뮤니티 멤버들은 단일 GPU 사용을 위한 실용적인 투 샘플러 워크플로를 찾아냈습니다. 먼저 고스텝 품질 샘플러로 장면을 구성한 다음, 마지막 세 스텝을 TaoMate LoRA로 완료하는 방식입니다. 테스터들은 다른 turbo LoRA에서 흔히 보이는 과하게 익힌 듯한 느낌 없이 강력한 시각 품질을 보고하면서도, 빠른 움직임보다 정적이거나 느린 장면에서 훨씬 잘 작동한다고 언급했습니다. LoRA의 ComfyUI 호환 safetensors 변환본도 커뮤니티 멤버가 제공하고 있습니다.
이용 가능 여부
TaoMate-H3는 MiniMax H3 베이스 모델이 필요하며, MiniMax H3 커뮤니티 라이선스에 따라 SM90(Hopper) GPU를 사용하는 Linux를 대상으로 합니다. 런타임 코드, 설치 가이드, 프롬프트 파일 형식은 GitHub 저장소에 있으며, LoRA 어댑터는 Hugging Face에 있습니다. 스트리밍 런타임 자체를 위한 네이티브 ComfyUI 노드는 없으며, 단일 GPU 사용자는 대신 커뮤니티 워크플로를 통해 LoRA를 사용합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.