NVIDIA Cosmos3-Edge: 비디오 생성을 위한 4B 오픈 옴니모달 월드 모델
NVIDIA가 텍스트, 이미지, 작업 궤적에서 비디오, 이미지, 오디오를 생성하는 4B Mixture-of-Transformers 월드 모델인 Cosmos3-Edge를 출시했습니다. ComfyUI 커뮤니티 노드에서 사용할 수 있습니다.
NVIDIA Cosmos3-Edge는 오픈 옴니모달 월드 모델 제품군인 Cosmos 3의 최신 멤버입니다. 이 4B Mixture-of-Transformers(MoT) 모델은 텍스트, 이미지, 비디오, 작업 궤적을 입력으로 받아 일관성 있는 텍스트, 이미지, 비디오, 작업 출력을 생성하며, 물리 AI 애플리케이션을 위한 세계 시뮬레이션, 미래 예측, 작업 추론을 포괄합니다.
Cosmos 3란 무엇인가
Cosmos 3는 이해, 생성, 시뮬레이션, 작업을 단일 트랜스포머로 통합합니다. 오토리그레시브 타워가 이산 텍스트 토큰을 처리하는 반면, diffusion 트랜스포머는 반복적인 denoising을 통해 이미지, 비디오, 오디오, 작업을 합성합니다. 별도의 텍스트 인코더는 없습니다. 언어 토큰과 diffusion 토큰이 하나의 공유 트랜스포머를 통과하므로, 모델은 체크포인트에서 자체 아키텍처를 읽습니다.
| 모델 | 크기 | 주요 특징 |
|---|---|---|
| Cosmos3-Edge | 4B | 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 작업 조건부 생성 (Nemotron-dense 백본) |
| Cosmos3-Nano | 16B | 옴니모달: 텍스트, 이미지, 비디오, 오디오 + 작업 |
| Cosmos3-Super | 64B | 가장 큰 옴니모달 모델 |
| Cosmos3-Super-Image2Video-4Step | 64B | DMD2 증류, 4단계 이미지 기반 비디오 생성 |
| Cosmos3-Super-Text2Image-4Step | 64B | DMD2 증류, 4단계 텍스트 기반 이미지 생성 |
Cosmos3-Edge는 256p 및 480p 해상도에서 텍스트와 이미지 입력을 지원하며, 16:9, 4:3, 1:1, 3:4, 9:16 종횡비를 지원합니다. 또한 작업 조건화는 Franka Panda 암, 자율 주행 차량, 드론, 카메라 궤적과 같은 다양한 로봇 구현체에서 작동합니다. 아래 출력은 모델 카드의 작업 조건부 오디오-비디오 생성을 보여줍니다.
ComfyUI 지원
Cosmos3는 ComfyUI 코어에 포함되어 있지 않지만, 커뮤니티 노드 팩 ComfyUI-Cosmos3는 내장 KSampler / SamplerCustomAdvanced 스택을 통해 텍스트 기반 비디오 생성 및 이미지 기반 비디오 생성용 Cosmos3-Edge를 포함한 전체 Cosmos3 제품군을 지원합니다.
ComfyUI-Cosmos3를ComfyUI/custom_nodes/에 복제하고requirements.txt에 나열된 요구 사항을 설치합니다.nvidia/Cosmos3-Edge와 같은 체크포인트를ComfyUI/models/cosmos3/<name>/에 다운로드합니다. 로더가transformer/config.json에서 아키텍처를 읽으므로 수동 설정이 필요 없습니다.uni_pc_bh2flow-matching 스케줄로 샘플링합니다. 텍스트 타워는 프롬프트당 한 번 프리필(prefill)되며 해당 K/V가 denoising 단계에 걸쳐 재사용됩니다.
이 팩에는 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 오디오-비디오 공동 생성, 4단계 증류 Super 체크포인트용 예제 워크플로가 포함되어 있습니다.
가용성
가중치(Weights)는 Hugging Face에서 공개되어 있으며, 모델 컬렉션은 huggingface.co/collections/nvidia/cosmos3에서 확인할 수 있습니다. 공식 추론 및 학습 코드는 NVIDIA Cosmos 저장소와 Cosmos Framework에 있으며, 기술 보고서는 Cosmos 3 연구 페이지에서 볼 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.