TaoMate-H3: MiniMax H3용 Alibaba 실시간 스트리밍 LoRA

ComfyUI Wikinews

Alibaba의 TaoLive AIGC 팀이 3-step LoRA 런타임 TaoMate-H3를 오픈소스로 공개했습니다. 동기화된 오디오와 비디오를 청크 단위로 스트리밍해 35 FPS 장편 MiniMax H3 생성까지 지원합니다.

Alibaba의 Taobao and Tmall Group 산하 TaoLive AIGC 팀MiniMax H3 기반의 저지연 스트리밍 런타임 TaoMate-H3를 공개했습니다. 이 런타임은 동기화된 오디오와 비디오를 작은 청크 단위로 생성합니다. 이 프레임워크는 35 FPS 스테이지 병렬 출력을 달성하고 30분 이상의 무중단 생성을 지원하며, rank-128 3-step LoRA 어댑터를 런타임 코드와 함께 GitHub에 공개했습니다(스타 150개 이상).

개요

TaoMate는 few-step 결합 오디오-비디오 생성을 위한 앵커 기반 영구 메모리 프레임워크로, 프로젝트 논문프로젝트 페이지에 설명되어 있습니다. 활성 컨텍스트 캐시를 확장하는 대신 불변 시각 앵커를 유지하고, 완료된 비디오 및 오디오 블록을 고정 용량의 동적 상태로 압축한 뒤 모달리티별 잔차 어텐션을 통해 해당 상태를 검색합니다. 참조 인식 변조 방법은 비디오 특징을 앵커 모양 통계에 조건화하며, 앵커 보존 인과 컨텍스트 증류는 학습 중 앵커가 흔들리지 않도록 유지합니다.

지표
스트리밍 출력35 FPS
단일 디바이스 지연130.3 s / 1441 frames
백본22.1B (MiniMax H3)
장기 일관성0.9520
오디오 비동기0.000

공개된 런타임은 음성, 사운드 효과, 비디오를 하나의 동기화된 타임라인에서 생성하며, KV 캐시 핸드오프가 깔끔하게 이루어져 프롬프트 경계를 넘어 시각적 정체성, 목소리, 움직임을 유지합니다. 각 5초 블록은 --prompt-json 파일을 통해 자체 프롬프트를 가질 수 있으며, 생성은 480p, 768p, 정렬된 1080p에서 실행됩니다. 검증된 하드웨어 구성은 텐서 및 시퀀스 병렬 처리를 적용한 8 x H20 96 GB입니다.

공식 데모 릴의 TaoMate-H3 샘플 프레임: 항구 리포터

공식 데모 릴의 샘플 프레임: 스트리밍 블록 전반에 걸쳐 유지되는 한 명의 내레이터 캐릭터.

공개된 내용

공식 데모: 동기화된 오디오와 함께 생성된 10초 클레이 로봇 클립.

커뮤니티 반응

이번 공개는 MiniMax H3 커뮤니티에서 빠르게 주목을 받았습니다. 일주일 만에 GitHub 스타 150개 이상을 모았고, 커뮤니티 멤버들은 단일 GPU 사용을 위한 실용적인 투 샘플러 워크플로를 찾아냈습니다. 먼저 고스텝 품질 샘플러로 장면을 구성한 다음, 마지막 세 스텝을 TaoMate LoRA로 완료하는 방식입니다. 테스터들은 다른 turbo LoRA에서 흔히 보이는 과하게 익힌 듯한 느낌 없이 강력한 시각 품질을 보고하면서도, 빠른 움직임보다 정적이거나 느린 장면에서 훨씬 잘 작동한다고 언급했습니다. LoRA의 ComfyUI 호환 safetensors 변환본도 커뮤니티 멤버가 제공하고 있습니다.

이용 가능 여부

TaoMate-H3는 MiniMax H3 베이스 모델이 필요하며, MiniMax H3 커뮤니티 라이선스에 따라 SM90(Hopper) GPU를 사용하는 Linux를 대상으로 합니다. 런타임 코드, 설치 가이드, 프롬프트 파일 형식은 GitHub 저장소에 있으며, LoRA 어댑터는 Hugging Face에 있습니다. 스트리밍 런타임 자체를 위한 네이티브 ComfyUI 노드는 없으며, 단일 GPU 사용자는 대신 커뮤니티 워크플로를 통해 LoRA를 사용합니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
TaoMate-H3: MiniMax H3용 Alibaba 실시간 스트리밍 LoRA | ComfyUI Wiki