LongCat Video Avatar 1.5:Meituan(美团)のオープン音声駆動アバターモデルとComfyUI対応

ComfyUI Wikinews

Meituan(美团)がLongCat-Video-Avatarを1.5にアップグレード。Whisper-Largeによるリップシンク、DMD2による8ステップ蒸留、マルチ音声サポートに加え、音声から動画へのアバター生成を実現するComfyUIカスタムノードも紹介します。

LongCat-Video-Avatar 1.5は、Meituan(美团)による音声駆動型の人物動画生成のためのオープンソースフレームワークのアップグレード版です。LongCat-Video基盤モデルをベースに、Audio-Text-to-Video(AT2V)Audio-Text-Image-to-Video(ATI2V)動画継続生成をネイティブサポートし、単一または複数の音声ストリームに対応した、安定した本番品質のアバター動画を生成します。

LongCat Video Avatar 1.5デモ

1.5の新機能

  • Whisper-Large音声エンコーダーがWav2Vec2を置き換え、明らかに滑らかで自然な口元の動きを実現
  • DMD2による8ステップの蒸留推論で、コスト効率に優れた運用と高い視覚的忠実度を両立
  • 本番対応の安定性:正確なリップシンク、全身の時間的安定性、長尺動画でも厳格なアイデンティティの一貫性を維持
  • スタイライズド領域への汎化:アニメ、動物、複数人のインタラクション、物体の操作など、多様なシーンでロバストに動作

プロジェクトページでは、リップシンクと3Dアニメーションについて、商用サービスとのサイドバイサイド比較を確認できます。

リップシンク比較

ComfyUIサポート

コミュニティ製ノードパックのComfyUI-LongCat-Avatarは、公式のAvatar 1.5パイプラインをComfyUIに移植したものです。単一・複数音声によるアバター生成、Whisper-large-v3による音声条件付け、必須のDMD蒸留LoRA、3種類のウェイトモード(単一ファイルの.safetensors DiT、公式シャーディングチェックポイント、公式INT8シャーディングチェックポイント)に対応し、480pと720pの解像度をカバーする9つのノードを提供します。

モデルファイルはスタンダードなComfyUIフォルダ(models/lorasmodels/vaemodels/audio_encodersmodels/diffusion_models)に配置します。ノードは公式のシャーディングチェックポイントを自動ダウンロードすることもできます。このパックのサンプルワークフローは次のとおりです。

LongCat Video Avatar ComfyUIワークフロー

入手方法

ウェイト、技術報告書、推論コードは、公式のLongCat-Videoリポジトリおよびプロジェクトページから入手できます。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
LongCat Video Avatar 1.5:Meituan(美团)のオープン音声駆動アバターモデルとComfyUI対応 | ComfyUI Wiki