新加坡国立大学团队推出 OmniConsistency 项目,仅需 2600 对图像和 500 小时 GPU 训练即可实现接近 GPT-4o 水平的图像风格化一致性,现已支持 ComfyUI 节点
Open-Weights
ComfyUI 生态最新动态:开源模型发布、自定义节点、工作流与工具更新。
新加坡国立大学团队推出 OmniConsistency 项目,仅需 2600 对图像和 500 小时 GPU 训练即可实现接近 GPT-4o 水平的图像风格化一致性,现已支持 ComfyUI 节点
Open-Weights
Black Forest Labs 推出 FLUX.1 Kontext 系列模型,首次实现基于文本和图像输入的上下文感知编辑,支持角色一致性保持和本地化编辑功能
Open-Weights
文生图字节跳动与密歇根州立大学联合提出ID-Patch方法,实现多身份个性化图像生成,提升身份保持与生成效率,适用于合影、广告等多角色场景。
Open-Weights
角色动画腾讯发布 HunyuanVideo-Avatar,支持通过图片和音频生成高保真、情感可控的数字人视频,适用于短视频、电商广告等多场景。
Open-Weights
Pixel-Reasoner 基于 Qwen2,具备全局与局部像素级视觉理解和推理能力,支持细节放大分析,推动视觉语言模型新进展。
MIT
IndexTTS发布1.5版本,显著提升模型稳定性和英语性能,支持拼音发音纠正和标点符号控制停顿,在多项测试中超越主流TTS系统
Open-Weights
图生 3D阶跃星辰发布Step1X-3D开源框架,可从单张图像生成高质量3D几何体和纹理,包含200万高质量数据集、完整训练代码和模型权重
Open-Weights
多模态字节跳动发布 BAGEL,一个具备 7B 活跃参数的开源多模态基础模型,支持文本、图像、视频等多模态数据的理解与生成,在多项公开基准测试中表现优异。
Open-Weights
文生图近期 ComfyUI 更新后,部分自定义节点可能导致前端异常,本文汇总了受影响的插件及解决方法,建议及时更新或卸载相关插件。
Open-Weights
多模态腾讯推出的多模态视频定制生成框架HunyuanCustom,支持文本、图像、音频和视频条件,实现多场景下的高一致性视频生成
Open-Weights
图像编辑Insert Anything是一个开源的统一框架,能够将参考图像中的人物、物体和服装等元素无缝插入到目标场景中,支持多种场景应用
Open-Weights
文生视频
多模态Step1X-Edit是一个功能强大的开源图像编辑框架,支持自然语言指令编辑图像,提供类似于GPT-4o和Gemini2 Flash的图像编辑能力。
Open-Weights
局部重绘Flex.2-preview是一款具有通用控制和内置修复绘制功能的开源文本到图像扩散模型,为创作者提供更强大的图像生成工具
Open-Weights
图生视频Sand AI开源了MAGI-1,这是一个能够逐块生成视频的自回归模型,提供24B和4.5B参数版本,支持多种视频生成方式
Open-Weights
图生视频SkyworkAI发布全新开源视频生成模型SkyReels-V2,支持无限长度视频生成,同时兼具文生视频和图生视频功能
Open-Weights
语音合成Nari Labs推出开源文本转语音模型Dia 1.6B,能够直接从文本生成多角色对话,支持情感表达和非语言交流
Open-Weights
多模态昆仑万维SkyReels团队发布并开源SkyReels-V2,这是全球首个使用扩散强迫框架的无限时长电影生成模型,能够生成高质量、长时间的视频内容
Open-Weights
文生图Shakker Labs推出全新的FLUX.1-dev-ControlNet-Union-Pro-2.0模型,优化控制效果,支持多种控制模式,模型尺寸更小
Open-Weights