M87是适用于Krea 2 Turbo的早期预览版美学LoRA,能够增强构图、光照、氛围和视觉质感——让生成结果更具电影感和艺术感,而不锁定特定风格。
ComfyUI 新闻与开源模型动态
ComfyUI 生态最新动态:开源模型发布、自定义节点、工作流与工具更新。
Alissonerdx 发布 LTX-Best-Face-ID,一款用于 LTX-2 的参考转视频身份保持 LoRA,使用重叠条件控制、TASS-RoPE 源相位标记和 ArcFace 身份损失。ComfyUI 中使用无需白底参考图。
图像编辑Ostris 在 AI Toolkit 中推送了对 Krea 2 模型使用参考图像进行训练的支持,实现了编辑风格 LoRA 的训练,仅需 1750 步即可掌握如“把这个做成独眼巨人”这样的概念。
MIT
Tanmay Patil 发布了 Krea 2 Depth ControlNet-LoRA,为 Krea 2 增加了深度条件图像生成能力。支持 Krea 2 Raw 和 Turbo 两种基础模型,深度一致性达到 0.99 Pearson 相关系数。
Krea-2-Community
文生图Flux2-Klein-9B-True-V2 是 wikeeyang 基于 FLUX.2-klein-9B 的最新全量微调版本,在照片真实感、提示词遵循、LoRA兼容性和图像编辑方面均有显著提升。
FLUX-1-dev-non-commercial
美团发布 LongCat 2.0,一个拥有 1 百万 token 上下文窗口的 1.6 万亿参数 MoE 语言模型,完全基于 AI ASIC 硬件训练。模型权重即将在 MIT 许可证下发布。
Alissonerdx 发布了 Edit Anything,这是一款基于 Apache-2.0 开源许可的 LTX-2.3 视频编辑 LoRA,支持运动迁移、无参考多任务编辑以及参考视频转视频——全部通过 ComfyUI 的 BFSnodes 实现。
Comfy MCP:让你的AI智能体成为创意技术专家
Comfy Org 推出 Comfy MCP,通过模型上下文协议将AI智能体与ComfyUI连接起来。智能体现在可以通过自然语言搜索模型、执行工作流并生成图像、视频和3D内容。
Kandinsky Lab(Sber)发布 KVAE-Audio,一个 1.669 亿参数的连续音频自编码器,在 48kHz 全带宽下实现语音、音乐和通用声音的最优重建质量。
ilkerzgi 发布超过 1,500 个 Krea 2 风格 LoRA:一个庞大的开源风格库
ilkerzgi 已在 Hugging Face 上发布了超过 1,500 个 Krea 2 风格 LoRA,涵盖从插画到摄影的 7 个类别。每个 LoRA 均可直接在 ComfyUI 中使用。
视频编辑fal.ai 发布了 LTX-2.3 3DREAL IC-LoRA,这是一个用于 LTX-Video 的上下文 LoRA,可将粗糙的 3D 布局和 CG 渲染转换为逼真、电影感的视频,同时保留原始构图和相机运动。
Open-Weights
多模态NVIDIA 开源 LocateAnything-3B,一款采用并行框解码(PBD)的视觉语言定位模型,能够快速精准地定位物体,支持物体检测、GUI 元素定位、OCR 定位以及基于点的定位,适用于多种领域
Open-Weights
视频编辑WhatDreamsCost 发布了 LTX Director 2.0,这是对免费开源 ComfyUI 视频编辑工具的重大更新,新增了完整的视频支持、IC-LoRA 集成、音频局部重绘、用于选择性重新生成的重拍模式以及全面 UI 改造。
FuzzPuppy 发布了 LTX-2.3 Foley LoRA,这是一个视频转音频 LoRA,可为 LTX-2.3 生成的视频添加逼真、视觉同步的音效,而不叠加背景音乐。
图生视频香港科技大学C4G实验室发布DomainShuttle,一个基于Wan2.2-T2V-14B构建的Apache-2.0开放域主体驱动视频生成模型。该模型采用Domain-MoT、视频-参考DualRoPE和跨对一致性损失,实现了灵活的域内保真度和跨域风格迁移。
Apache-2.0
文生图Krea.ai 发布了 Krea 2 Raw 和 Turbo,一款开放权重的 12.9B 参数扩散Transformer,用于文生图生成。ComfyUI 原生支持,并提供即用工作流。
Krea-2-Community
图像编辑Boogu-Image-0.1-Edit 是 Boogu-Image 系列中采用 Apache 2.0 许可证的图像编辑模型,提供基于指令的图像编辑功能,采用统一的多模态理解与生成架构。
Apache-2.0
语音合成Higgs TTS 3 是一个 40 亿参数的文本转语音模型,支持 100 多种语言,具备零样本语音克隆、丰富的情感控制以及内联韵律/音效功能,适用于语音代理应用。
Open-Weights
文生视频Sulphur 2 是 LTX 2.3 的社区微调版本,提供文生视频和图生视频功能,内置提示词增强器和蒸馏 LoRA,基于 12.5 万段以上精选视频片段训练而成。
Open-Weights
OpenMOSS 发布 MOVA - 开源音视频同步生成模型
OpenMOSS 团队发布 MOVA (MOSS Video and Audio),这是一个端到端的音视频同步生成基础模型,支持单次推理生成视频和音频,实现精确的口型同步和环境感知音效,完全开源模型权重、训练和推理代码
Open-Weights