NVIDIA Cosmos3-Edge:用于视频生成的 4B 开放全模态世界模型
NVIDIA 发布 Cosmos3-Edge,一款 40 亿参数的混合 Transformer 世界模型,可从文本、图像和操作轨迹生成视频、图像和音频,并支持 ComfyUI 社区节点。
NVIDIA Cosmos3-Edge 是 Cosmos 3 开放全模态世界模型家族的最新成员。这款 40 亿参数的混合 Transformer(MoT)模型以文本、图像、视频和操作轨迹为输入,生成连贯的文本、图像、视频和操作输出,涵盖 Physical AI 应用中的世界模拟、未来预测和操作推理。
Cosmos 3 是什么
Cosmos 3 在单个 Transformer 中统一了理解、生成、模拟和操作:自回归塔负责处理离散文本 token,而扩散 Transformer 通过迭代去噪合成图像、视频、音频和操作。该模型没有独立的文本编码器,语言和扩散 token 通过同一个共享 Transformer 运行,因此模型会从 checkpoint 中读取自身的架构。
| 模型 | 参数量 | 亮点 |
|---|---|---|
| Cosmos3-Edge | 4B | 文生视频、图生视频、操作条件生成(Nemotron 稠密骨干) |
| Cosmos3-Nano | 16B | 全模态:文本、图像、视频、音频 + 操作 |
| Cosmos3-Super | 64B | 最大的全模态模型 |
| Cosmos3-Super-Image2Video-4Step | 64B | DMD2 蒸馏,4 步图生视频 |
| Cosmos3-Super-Text2Image-4Step | 64B | DMD2 蒸馏,4 步文生图 |
Cosmos3-Edge 支持 256p 和 480p 的文本与图像输入,宽高比涵盖 16:9、4:3、1:1、3:4 和 9:16,其操作条件功能适用于多种机器人形态,如 Franka Panda 机械臂、自动驾驶车辆、无人机和相机轨迹。以下输出展示了模型卡片中的操作条件音视频生成效果:
ComfyUI 支持
Cosmos3 不属于 ComfyUI 核心组件,但社区节点包 ComfyUI-Cosmos3 通过内置的 KSampler / 自定义采样器(高级)技术栈支持完整的 Cosmos3 系列,包括用于文生视频和图生视频的 Cosmos3-Edge:
- 将
ComfyUI-Cosmos3克隆到ComfyUI/custom_nodes/并安装其requirements.txt依赖项 - 将模型(如
nvidia/Cosmos3-Edge)下载到ComfyUI/models/cosmos3/<name>/;加载器会从transformer/config.json读取架构,因此无需手动设置 - 使用
uni_pc_bh2流匹配调度进行采样;文本塔在每个提示词中预填充一次,其 K/V 会在去噪步骤中复用
该节点包附带文生视频、图生视频、音视频联合生成以及 4 步蒸馏 Super 模型的示例工作流:
获取方式
模型权重已在 Hugging Face 上开放,模型集合位于 huggingface.co/collections/nvidia/cosmos3。官方推理和训练代码位于 NVIDIA Cosmos 仓库 和 Cosmos Framework 中,技术报告可在 Cosmos 3 研究页面 上获取。
评论
使用 GitHub 登录后即可参与讨论。