TaoMate-H3: MiniMax H3向けAlibabaのリアルタイムストリーミングLoRA
AlibabaのTaoLive AIGCチームが、音声とビデオをチャンク単位で同期ストリーミングし、MiniMax H3で35 FPSの長尺生成を実現する3ステップLoRAランタイム、TaoMate-H3をオープンソース化しました。
概要
TaoMateは、少ステップの音声・ビデオ同時生成のためのアンカー誘導型の永続メモリフレームワークで、プロジェクトの論文とプロジェクトページで説明されています。アクティブなコンテキストキャッシュを拡張する代わりに、不変のビジュアルアンカーを保持し、完了したビデオブロックとオーディオブロックを固定容量の動的状態に圧縮し、モダリティ固有の残差アテンションを通じてそれらの状態を取得します。参照認識変調方法は、アンカーの外観統計に基づいてビデオ特徴を条件付けし、アンカー保持因果コンテキスト蒸留によってトレーニング中もアンカーを擾乱なく保ちます。
| 指標 | 値 |
|---|---|
| ストリーミング出力 | 35 FPS |
| 単一デバイス遅延 | 130.3 秒 / 1441 フレーム |
| バックボーン | 22.1B (MiniMax H3) |
| 長尺一貫性 | 0.9520 |
| オーディオ同期ずれ | 0.000 |
リリースされたランタイムは、音声、サウンドエフェクト、ビデオを1つの同期タイムライン上で生成し、プロンプト境界をまたいで視覚的アイデンティティ、声、動きを保持するクリーンなKVキャッシュの受け渡しを実現します。各5秒ブロックは --prompt-json ファイルを通じて独自のプロンプトを持つことができ、生成は480p、768p、および調整済みの1080pで実行されます。検証済みのハードウェア構成は、テンソル並列とシーケンス並列を備えた8 x H20 96 GBです。
公式デモリールのサンプルフレーム: ストリーミングブロックをまたいで1人のナレーターキャラクターが維持されています。
リリース内容
- ランタイムコード: TaoLiveAIGC/TaoMate-H3にある完全なストリーミング推論スタック。チャンク生成、ブロックごとのプロンプトスケジューリング、ステージ並列実行を含みます
- 3ステップLoRAアダプター: Hugging FaceのTaoLiveAIGC/TaoMate-H3にあるstep-3000ジェネレーターEMAチェックポイント (ランク128、アルファ128、FP32テンソル)。MiniMax H3 FL2VAベースモデルと組み合わせて使用します
- デモギャラリー: プロジェクトページにある、無停止の30分ドキュメンタリーナレーターなどのサンプルリール
公式デモ: 同期オーディオ付きで生成された10秒のクレイロボットクリップ。
コミュニティの反応
このリリースはMiniMax H3コミュニティで素早く注目を集めました。1週間で150以上のGitHubスターを獲得し、コミュニティメンバーは単一GPUで使える実用的な2サンプラーワークフローを見つけました。まず高ステップ品質のサンプラーでシーンを構築し、最後の3ステップをTaoMate LoRAで完了させるというものです。テスターは、他のturbo LoRAによく見られる過剰に仕上がった見た目がなく高い視覚品質を報告する一方で、静的またはゆっくりしたシーンの方が速い動きよりもはるかにうまく機能すると指摘しています。LoRAのComfyUI互換safetensors変換も、コミュニティメンバーから入手可能です。
利用可能性
TaoMate-H3はMiniMax H3ベースモデルを必要とし、MiniMax H3コミュニティライセンスの下、SM90 (Hopper) GPUを搭載したLinuxを対象としています。ランタイムコード、インストールガイド、プロンプトファイル形式はGitHubリポジトリにあり、LoRAアダプターはHugging Faceにあります。ストリーミングランタイム自体にはネイティブのComfyUIノードはありません。単一GPUユーザーは代わりにコミュニティワークフローを通じてLoRAを利用します。
コメント
GitHubでサインインしてディスカッションに参加しましょう。