ComfyUI Wan 3.0:通过 API 节点实现 30 秒视频生成
ComfyUI Wikinews
阿里巴巴 Wan 3.0 现已通过三个 API 节点登陆 ComfyUI:原生 30 秒单遍视频、支持 20 个参考资产的 Omni Creation(使用 @ 语法)以及指令视频编辑。
Wan 3.0,阿里巴巴最新的视频生成模型,现已通过三个 API 节点登陆 ComfyUI:Wan 3.0 文生视频,Wan 3.0 图生视频和Wan 3.0 参考视频(官方 ComfyUI 博客)。相比前代,主要变化是原生 30 秒单次输出,无需拼接,为连续相机运动和完整场景留出了充足空间。
来自 ComfyUI 博客公告的 Wan 3.0 生成示例
模型亮点
- 原生 30 秒时长单次完成,可选范围从 2 到 30 秒,并提供“自动”模式让模型选择最佳长度。
- Omni Creation 参考:每轮生成最多支持 20 个资产,包括 10 张图像、5 个视频和 5 个音频片段,直接在提示词中使用 @ 语法引用,例如
@Image1引用角色卡片或@Video2引用相机运动。 - 文档和网页解析:提案文档或 Wiki 页面可作为素材用于生成成片。
- 指令精确编辑:移除或替换元素、重新布光场景或改变动作,同时保持画面其余部分不动。现有素材也可进行扩展,总输入加输出最长可达 30 秒。
- 提示词输入扩展至 20,000 字符。
- 分辨率和比例:支持 480p、720p 和 1080p,涵盖 16:9、9:16、4:3、3:4 和 1:1。480p 层级为本版本新增,用于低成本草稿。提供“自适应”宽高比选项,并可关闭音频生成。
如何在 ComfyUI 中使用
将 ComfyUI 更新至 v0.33.4 或更高版本,或打开 Comfy Cloud。节点可在节点库中找到,模板面板提供三个官方工作流:
- Wan 3.0 文生视频:提示词生成带音频的 30 秒视频。
官方 Wan 3.0 文生视频模板
- Wan 3.0 图生视频:为静态图像添加同步音频动画。
官方 Wan 3.0 图生视频模板
- Wan 3.0 参考视频:组合角色卡片、用于相机运动的视频和用于语音音色的音频片段,每个均在提示词中通过 @ 语法引用。
Wan 3.0 生成通过 ComfyUI 的 API 节点系统运行,因此不需要本地权重下载,计费遵循每个分辨率层级的 API 价格。480p 层级使草稿迭代保持低成本,然后再提交至 1080p 最终输出。
对于本地开源权重工作流,Wan 2.2 系列在 ComfyUI 中仍可用并拥有原生支持,而 Wan 3.0 生成本身目前通过 API 节点运行。
评论
使用 GitHub 登录后即可参与讨论。