语音合成Higgs TTS 3 是一个 40 亿参数的文本转语音模型,支持 100 多种语言,具备零样本语音克隆、丰富的情感控制以及内联韵律/音效功能,适用于语音代理应用。
Open-Weights
ComfyUI 生态最新动态:开源模型发布、自定义节点、工作流与工具更新。
语音合成Higgs TTS 3 是一个 40 亿参数的文本转语音模型,支持 100 多种语言,具备零样本语音克隆、丰富的情感控制以及内联韵律/音效功能,适用于语音代理应用。
Open-Weights
文生视频Sulphur 2 是 LTX 2.3 的社区微调版本,提供文生视频和图生视频功能,内置提示词增强器和蒸馏 LoRA,基于 12.5 万段以上精选视频片段训练而成。
Open-Weights
OpenMOSS 团队发布 MOVA (MOSS Video and Audio),这是一个端到端的音视频同步生成基础模型,支持单次推理生成视频和音频,实现精确的口型同步和环境感知音效,完全开源模型权重、训练和推理代码
Open-Weights
阿里巴巴通义实验室发布 Z-Image-Base,这是 Z-Image 系列的非蒸馏基础模型,保留了完整的生成潜力,为社区微调和定制开发提供理想基础
Open-Weights
DeepSeek 开源 DeepSeek-OCR-2,引入全新 DeepEncoder V2 视觉编码器,通过视觉因果流机制模仿人类阅读逻辑,在 OmniDocBench v1.5 上达到 91.09% 准确率
Open-Weights
月之暗面正式发布 Kimi K2.5,这是一个 1T 参数的原生多模态 Agent 模型,在 15 万亿混合视觉和文本 token 上持续预训练,支持图像、视频理解,并引入 Agent Swarm 自主协作机制
Open-Weights
阿里巴巴通义千问开源 Qwen3-TTS 系列语音生成模型,采用 Dual-Track 双轨建模实现 97ms 超低延迟,支持 3 秒音色克隆、自然语言音色设计,覆盖 10 种主流语言
Open-Weights
微软开源 VibeVoice-ASR,一个 9B 参数的统一语音识别模型,能够一次性处理长达 60 分钟的音频,在单一推理过程中联合完成识别、说话人日志与时间戳生成
Open-Weights
NVIDIA 开源 PersonaPlex-7B-v1,一款基于 Moshi 架构的 70 亿参数全双工语音对话模型,支持边听边说、自然打断和角色定制,中断响应延迟低至 240 毫秒
Open-Weights
文生视频Stable Video Infinity 2.0 Pro 版本正式发布,新增对 Wan 2.2 基础模型的支持,提供 HIGH 和 LOW 两种版本的 LoRA 模型,可在 ComfyUI 中生成无限长度的视频内容
图像编辑Qwen-Image-Layered 可以将图像分解为多个 RGBA 图层,每个图层可以独立编辑而不影响其他内容,支持重新着色、替换、删除、调整大小和移动等操作
Open-Weights
图生 3D微软推出TRELLIS.2,一个40亿参数的大型3D生成模型,可在数秒内将图像转换为高质量的3D资产,支持完整PBR材质和复杂拓扑结构
Open-Weights
清华大学团队开源 TurboDiffusion,一个视频生成加速框架,可在单个 RTX 5090 上实现 100-205 倍的端到端扩散生成加速,同时保持视频质量
阿里云 PAI 团队发布 Z-Image-Turbo-Fun-Controlnet-Union,一个为 Z-Image-Turbo 设计的 ControlNet 模型,支持 Canny、HED、Depth、Pose 和 MLSD 等控制条件
Open-Weights
文生图阿里巴巴 AIDC-AI 团队发布 Ovis-Image,一个专注于高质量文本渲染的7B参数文生图模型,在多项文本渲染基准测试中表现出色,可在单张高端GPU上高效运行
Open-Weights
阿里巴巴通义实验室发布Z-Image-Turbo,一个6B参数的高效图像生成模型,仅需8步采样即可生成高质量图像,在16GB显存消费级显卡上流畅运行
Open-Weights
多模态ByteDance推出Sa2VA多模态模型,结合SAM2与LLaVA技术,实现图像和视频的密集分割与视觉问答,在多项基准测试中达到最佳性能
Open-Weights
腾讯发布混元图像3.0,这是首个开源商用级原生多模态生图模型,总参数达80B,具备世界知识推理能力,支持千字级复杂语义理解
Open-Weights
Nunchaku 团队发布了优化版本的 4-Bit Lightning Qwen-Image-Edit-2509 模型,支持 4/8 步快速推理,在 8GB 显存环境下也能流畅运行
阿里巴巴通义实验室推出Wan-Animate,一个基于Wan2.2的统一角色动画框架,支持角色动画生成和视频角色替换,现已开源模型权重和推理代码
Open-Weights