Edit Anything v2:适用于 LTX-2.5 的多指令视频编辑
ComfyUI Wikinews
Edit Anything v2 为 LTX-2.5 引入多指令视频编辑功能:通过 rank-128 IC-LoRA,在单一提示词中实现替换、移除、添加和重风格化,并附带即用型 ComfyUI 工作流。
Edit Anything v2 (Hugging Face | Civitai) 是由 Alissonerdx 发布的针对 LTX-2.5 (22B dev) 的 rank-128 指令 IC-LoRA。与早期 LTX-2.3 版本不同,它可在单一提示词中执行多项编辑操作:替换、移除、添加、重风格化,无需参考图像,并附带即用型 ComfyUI 工作流。
v2 新增内容
首次 Edit Anything 发布(六月,此处有介绍)针对 LTX-2.3,提供三个独立轨道:运动迁移、无参考多任务 LoRA 以及参考 V2V 构建。Edit Anything v2 是一次彻底重启:
- 基于 LTX-2.5 —— 从头开始在 LTX-2.5 22B dev 上训练,而非 LTX-2.3 LoRA 的延续。包含 2750 对对齐的源/编辑视频对,rank 128 / alpha 128,分辨率 704×384,73 帧。
- 单个提示词中的多项操作 —— “将紫色的道奇挑战者替换为绿色的兰博基尼,并且 添加一个带有坠落炸弹的电影末日场景,并且 将天空重风格化为日落”全部在一次通过中完成。v1 只能一次执行一个操作。
- 无参考图像 —— 源视频作为引导输入,指令作为文本输入,编辑后的视频输出。无需 RoPE 技巧,无需侧边模块,无需遮罩。
- 提示词增强器 —— 用自然语言编写,系统将其转换为适当的指令提示词。
示例
每个片段均为三面板对比:源引导 | 第一遍 | 第二遍(放大)。
替换背景,保留舞者
edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.替换汽车 + 保留主体
edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.同时进行两次编辑
edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.ComfyUI 使用
从 Hugging Face 仓库加载 workflows/EditAnythingLTX2.5.json,或使用 BFSnodes 的 LTX Multiple Controls 节点手动连接。与训练匹配的设置如下:
| 输入 | 值 |
|---|---|
guide_video | 你的源视频 |
guide_source_id | 0 |
guide_layout | overlap |
guide_ref_resize_mode | match_target |
guide_downscale_factor | 1 |
保持 identity_image、mask_video 和 identity_mask_image 已断开连接 —— LoRA 训练时未包含任何这些组件。
建议起始设置:LoRA 强度 1.0,CFG 3–5,30 步,不使用 LightX2V。训练盒子大小为 704×384, 73 帧;其他尺寸和长度属于外推,会首先导致时间一致性下降。
提示词规则
每个提示词都以触发词 edit_anything: 开头,后跟每条编辑的一句话。模型仅理解四个动词(按可靠性从高到低):替换、添加、移除、重风格化。重要规则:
- 每条指令 10 到 20 个单词;过短丢失描述,过长漂移。
- 每个
Add对应一个物体;对于群体或人群,请在现有区域上使用Replace。 - 将每条指令锚定到可见内容(“在男子左侧”,“在画面右侧的桌子上”)。
- 描述状态而非方式 —— “站在绿草地上”,而非“优雅地游泳”。
Restyle针对区域而非整个片段;对于全片外观,在承载该外观的区域上编写两三条 Restyle 指令。Make it <style>和Turn it into <style>不起作用 —— 请使用Restyle。
局限性
编辑词汇仅限于这四个动词;改变帧内容极少的编辑(细微移除)可靠性最低;没有参考图像支持(“添加此对象”配合图片仍未解决);且长于训练盒子的片段会首先失去时间一致性。与 v1 一样,这些是研究实验 —— 预期会出现失败,并根据提示词进行迭代。
评论
使用 GitHub 登录后即可参与讨论。