HuMo:人体中心ビデオ生成モデル - ダウンロード

ComfyUI Wiki

HuMoはByteDance Researchによる統合された人体中心ビデオ生成フレームワークであり、テキスト、画像、オーディオ駆動の人体ビデオ生成をサポートします。

H

HuMo

ビデオ人体ビデオ生成テキストから動画へオーディオ駆動ByteDance

ByteDance Researchによる統合型人体中心ビデオ生成フレームワーク。テキスト、画像、オーディオなどマルチモーダル入力から高品質で制御可能な人体ビデオを生成します。テキスト-画像、テキスト-オーディオ、テキスト-画像-オーディオの各生成モードに対応。1.7Bおよび17Bパラメータのバリエーションで、FP8量子化オプションも利用可能です。

開発者ByteDance Research
リリース日2025-08
アーキテクチャDiffusion Transformer
モデルサイズ1.7B, 17B (FP16 + FP8)
ライセンスApache 2.0
機能テキスト-画像、テキスト-オーディオ、テキスト-画像-オーディオの人体ビデオ生成
必須オーディオエンコーダーWhisper Large V3 (含む)

Guides and workflows related to this model series.

No articles found.

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…