SenseNova-U1.5 预览:商汤科技推出 4K 图像生成与编辑
商汤科技的 SenseNova-U1.5-8B-MoT-Preview 将 4K 文生图和更强大的图像编辑能力集成于一个统一模型中,并可通过 SenseNova_U1 自定义节点包获得 ComfyUI 支持。
**商汤科技(SenseTime)**已开源 SenseNova-U1.5-8B-MoT(预览版),这是其 U 系列原生统一多模态模型的最新成员。该预览版基于 NEO-unify 架构 构建,专注于图像生成与编辑:它可以根据文本生成最高 原生 4K 图像,并能针对单张或多张参考图像执行详细的编辑指令。
SenseNova-U1.5(预览版)的技术进展概览
该版本是原始 SenseNova-U1 系列的后续版本,同时开源了预训练启动器和配置文件。模型权重可在 Hugging Face 和 ModelScope 上获取。
U1.5 的改进
从逐补丁预测到补丁联合重建
原始的 U1 使用 MLP 头独立重建每个 RGB 补丁,这会在高分辨率下将 token 边界暴露为网格图案。U1.5 采用通过 ConvDecoder 实现的渐进式空间重建:视觉 token 被重塑为二维特征网格,并通过多个 Pixel Shuffle 阶段进行上采样,中间使用 3x3 卷积让相邻补丁相互交互并融合为连续图像。这大幅抑制了网格状伪影,并提高了下游微调时的鲁棒性。
从指令遵循到视觉保持
U1.5 对其图像编辑语料库进行了大规模清洗、筛选和合成,改善了中英文平衡,并扩大了对单图像和多图像参考场景的覆盖。这种无编码器架构仅使用单序列的参考图像 token,就能实现强大的指令遵循以及主体身份和结构保持。
从格式暴露到跨任务泛化
尽管生成和编辑语料库只包含简单的 JSON 格式提示词,U1.5 仍能很好地泛化到长且结构化的指令。这表明原生统一多模态建模无需专门的提示词模板训练,就能跨任务迁移理解能力和视觉规划技能。
示例展示:文生图
SenseNova-U1.5 生成的细节丰富的复古广告海报,展示了密集文本渲染和复杂布局控制能力
具有精细纹理和光照细节的照片级真实水下场景
示例展示:图像编辑
涵盖风格迁移、主体身份保持和区域可控修改的编辑示例
基准测试亮点
在 Qwen-Image Bench 上,U1.5-Preview 在每一个类别上都优于原始 U1,其中美学和一致性方面的提升最大。启用 Prompt Enhance(PE)后,预览版的综合得分为 55.17(英文)/ 55.22(中文),与同一评测中的 Qwen Image 2 相当。
在图像编辑方面,U1.5-Preview 在 ImgEdit-Bench 上的综合得分达到 4.37(高于 U1 的 3.90),在 WeEdit 上的平均得分为 6.852,在所报告的对比中优于 Qwen-Image-2、FireRed-Image-Edit 和 LongCat-Image-Edit。
ComfyUI 支持
社区开发者 smthemex 已在 ComfyUI_SenseNova_U1 自定义节点包中添加了 U1.5 支持,覆盖 GGUF、INT8 和 FP8 权重格式(参见 smthem/SenseNova-U1-8B-MoT-Merger-gguf)。该节点包还支持 A3B-MoT MoE 变体、8 步 LoRA 和 Infographic-V3 模型。
点击放大。该自定义节点包内置了文生图和图生图的即用示例工作流。
要本地运行,请安装自定义节点,并将量化权重放入 ComfyUI/models/gguf/ 或 ComfyUI/models/diffusion_models/ 目录:
cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txt获取方式
- 模型权重: Hugging Face 上的 sensenova/SenseNova-U1.5-8B-MoT-Preview 以及 ModelScope 上的 SenseNova-U1.5-8B-MoT-Preview
- 代码: OpenSenseNova/SenseNova-U1(推理、训练和 PE 工具)
- 论文: arXiv 2605.12500
- ComfyUI 节点: smthemex/ComfyUI_SenseNova_U1
使用官方 Python 推理时,请结合参考实现设置 cfg_scale=4.0、timestep_shift=3.0 和 num_steps=50。SenseN
评论
使用 GitHub 登录后即可参与讨论。