LongCat Video Avatar 1.5:Meituan(美团)のオープン音声駆動アバターモデルとComfyUI対応
Meituan(美团)がLongCat-Video-Avatarを1.5にアップグレード。Whisper-Largeによるリップシンク、DMD2による8ステップ蒸留、マルチ音声サポートに加え、音声から動画へのアバター生成を実現するComfyUIカスタムノードも紹介します。
LongCat-Video-Avatar 1.5は、Meituan(美团)による音声駆動型の人物動画生成のためのオープンソースフレームワークのアップグレード版です。LongCat-Video基盤モデルをベースに、Audio-Text-to-Video(AT2V)、Audio-Text-Image-to-Video(ATI2V)、動画継続生成をネイティブサポートし、単一または複数の音声ストリームに対応した、安定した本番品質のアバター動画を生成します。
1.5の新機能
- Whisper-Large音声エンコーダーがWav2Vec2を置き換え、明らかに滑らかで自然な口元の動きを実現
- DMD2による8ステップの蒸留推論で、コスト効率に優れた運用と高い視覚的忠実度を両立
- 本番対応の安定性:正確なリップシンク、全身の時間的安定性、長尺動画でも厳格なアイデンティティの一貫性を維持
- スタイライズド領域への汎化:アニメ、動物、複数人のインタラクション、物体の操作など、多様なシーンでロバストに動作
プロジェクトページでは、リップシンクと3Dアニメーションについて、商用サービスとのサイドバイサイド比較を確認できます。
ComfyUIサポート
コミュニティ製ノードパックのComfyUI-LongCat-Avatarは、公式のAvatar 1.5パイプラインをComfyUIに移植したものです。単一・複数音声によるアバター生成、Whisper-large-v3による音声条件付け、必須のDMD蒸留LoRA、3種類のウェイトモード(単一ファイルの.safetensors DiT、公式シャーディングチェックポイント、公式INT8シャーディングチェックポイント)に対応し、480pと720pの解像度をカバーする9つのノードを提供します。
モデルファイルはスタンダードなComfyUIフォルダ(models/loras、models/vae、models/audio_encoders、models/diffusion_models)に配置します。ノードは公式のシャーディングチェックポイントを自動ダウンロードすることもできます。このパックのサンプルワークフローは次のとおりです。
入手方法
ウェイト、技術報告書、推論コードは、公式のLongCat-Videoリポジトリおよびプロジェクトページから入手できます。
コメント
GitHubでサインインしてディスカッションに参加しましょう。