LongCat Video Avatar 1.5: Meituan의 오픈 소스 오디오 기반 아바타 모델

ComfyUI Wikinews

Meituan이 LongCat-Video-Avatar를 1.5로 업그레이드하여 Whisper-Large 립싱크, DMD2 8단계 증류, 멀티 오디오 지원을 제공하며, 오디오 기반 비디오 아바타를 위한 ComfyUI 커스텀 노드도 지원합니다.

LongCat-Video-Avatar 1.5는 Meituan이 업그레이드한 오디오 기반 인간 비디오 생성 오픈소스 프레임워크입니다. LongCat-Video 파운데이션 모델을 기반으로 구축되어 단일 또는 다중 오디오 스트림으로 작동하며, Audio-Text-to-Video(AT2V), Audio-Text-Image-to-Video(ATI2V)비디오 연속 생성을 기본 지원하여 안정적이고 프로덕션급 아바타 비디오를 생성합니다.

LongCat Video Avatar 1.5 데모

1.5의 새로운 기능

  • Whisper-Large 오디오 인코더가 Wav2Vec2를 대체하여 눈에 띄게 더 부드럽고 자연스러운 입술 움직임을 제공합니다.
  • DMD2 기반 8단계 증류 추론으로 비용 효율적인 서빙과 높은 시각적 충실도의 균형을 제공합니다.
  • 프로덕션급 안정성: 정확한 립싱크, 긴 비디오에서의 전신 시간적 안정성, 엄격한 신원 일관성을 보장합니다.
  • 스타일화된 도메인 일반화: 애니메이션, 동물, 다중 인물 상호작용, 객체 조작 전반에서 강건하게 동작합니다.

프로젝트 페이지에는 립싱크 및 3D 애니메이션에 대한 상용 서비스와의 나란한 비교 결과가 포함되어 있습니다:

립싱크 비교

ComfyUI 지원

커뮤니티 노드 팩인 ComfyUI-LongCat-Avatar는 공식 Avatar 1.5 파이프라인을 ComfyUI에 적용합니다. 9개의 노드가 단일 및 다중 오디오 아바타 생성, Whisper-large-v3 오디오 조건화, 필수 DMD 증류 LoRA, 그리고 세 가지 가중치 모드(단일 파일 .safetensors DiT, 공식 샤딩 체크포인트, 공식 INT8 샤딩 체크포인트)를 480p 및 720p 해상도에서 지원합니다.

모델 파일은 표준 ComfyUI 폴더(models/loras, models/vae, models/audio_encoders, models/diffusion_models)에 배치하며, 노드가 공식 샤딩 체크포인트를 자동으로 다운로드할 수 있습니다. 이 노드 팩의 예제 워크플로:

LongCat Video Avatar ComfyUI 워크플로

다운로드

가중치, 기술 보고서 및 추론 코드는 공식 LongCat-Video 저장소프로젝트 페이지에서 확인할 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
LongCat Video Avatar 1.5: Meituan의 오픈 소스 오디오 기반 아바타 모델 | ComfyUI Wiki