HuMo:人体中心ビデオ生成モデル - ダウンロード
ComfyUI Wiki
HuMoはByteDance Researchによる統合された人体中心ビデオ生成フレームワークであり、テキスト、画像、オーディオ駆動の人体ビデオ生成をサポートします。
H
HuMo
ビデオ人体ビデオ生成テキストから動画へオーディオ駆動ByteDanceByteDance Researchによる統合型人体中心ビデオ生成フレームワーク。テキスト、画像、オーディオなどマルチモーダル入力から高品質で制御可能な人体ビデオを生成します。テキスト-画像、テキスト-オーディオ、テキスト-画像-オーディオの各生成モードに対応。1.7Bおよび17Bパラメータのバリエーションで、FP8量子化オプションも利用可能です。
| 開発者 | ByteDance Research |
| リリース日 | 2025-08 |
| アーキテクチャ | Diffusion Transformer |
| モデルサイズ | 1.7B, 17B (FP16 + FP8) |
| ライセンス | Apache 2.0 |
| 機能 | テキスト-画像、テキスト-オーディオ、テキスト-画像-オーディオの人体ビデオ生成 |
| 必須オーディオエンコーダー | Whisper Large V3 (含む) |
Guides and workflows related to this model series.
No articles found.
コメント
GitHubでサインインしてディスカッションに参加しましょう。