图生 3D腾讯开源混元3D 2.0系统采用两阶段生成架构,实现高质量3D模型创建,支持多模态输入,显著提升几何精度与纹理质量
Open-Weights
ComfyUI 生态最新动态:开源模型发布、自定义节点、工作流与工具更新。
图生 3D腾讯开源混元3D 2.0系统采用两阶段生成架构,实现高质量3D模型创建,支持多模态输入,显著提升几何精度与纹理质量
Open-Weights
文生视频潞晨科技发布Open-Sora 2.0开源视频生成模型,仅用20万美元训练成本实现接近顶级商业模型的性能表现
Open-Weights
图生视频
多模态
文生图智谱AI团队(THUDM)发布CogView4开源图像生成模型,支持中英双语输入与汉字生成,在多项基准测试中表现领先
Open-Weights
多模态Sesame团队推出基于双Transformer架构的对话语音模型CSM,通过端到端学习实现拟真对话交互,开源核心架构并提供在线演示
Open-Weights
阿里巴巴正式开源其最新视频生成模型 Wan2.1,该模型仅需 8GB 显存即可运行,支持高清视频生成、动态字幕和多语言配音,在 VBench 榜单上以 86.22% 的总分超越 Sora 等模型
Open-Weights
阿里巴巴国际数字商业集团(AIDC-AI)发布 ComfyUI Copilot 插件,通过自然语言交互和 AI 驱动功能简化 ComfyUI 的使用体验,支持中文交互,提供智能节点推荐等功能
Open-Weights
阿里巴巴宣布其最新视频生成模型 WanX 2.1 将于2025年第二季度开源,该模型支持高清视频生成、动态字幕和多语言配音,在VBench榜单上以84.7%的总分位居榜首
Open-Weights
多模态Google 推出全新的 PaliGemma 2 mix 模型,支持图像描述、OCR、目标检测等多种视觉任务,提供 3B、10B 和 28B 三种规模版本
Open-Weights
昆仑万维发布开源视频生成模型 SkyReels-V1,支持文生视频和图生视频,具备电影级光影效果和自然动作表现,并已开放商用
Open-Weights
研究人员提出了一种新的视频重照明方法 Light-A-Video,通过一致光注意力(CLA)和渐进式光融合(PLF)实现了时间上平滑的视频重照明效果
Open-Weights
StepFun发布开源文生视频模型Step-Video-T2V,拥有300亿参数,支持生成长达204帧的高质量视频,并提供在线体验平台
Open-Weights
图生 3D阿里巴巴最新开源项目 InspireMusic 是一个基于 FunAudioLLM 的综合音频生成框架,支持音乐制作、歌曲生成等多种音频合成任务。
Open-Weights
文生图阿里巴巴研究院开源图像生成工具ACE++,通过上下文感知内容填充技术,支持单图输入生成角色一致的新图像,提供在线体验与三类专用模型。
Open-Weights