2026-08-05 09:23
商汤开源轻量统一多模态模型 U1.5-Lite 预览版
文本核心速览
- 开源8B统一多模态模型—商汤发布SenseNova U1.5-Lite-Preview,仅8B-MoE参数,实现视觉理解、推理、生成与编辑的贯通,为U1的系统性迭代。
- 原生支持4K生成与编辑—模型原生支持4K图像生成,分辨率大幅提升,细节纹理更真实,同时强化中英文文字生成、复杂版式与图像编辑稳定性。
- 技术架构创新优化—商汤重新设计生成头以减弱网格伪影,训练扩展至4K,并重组编辑数据与任务,强化原图内容、主体身份和非编辑区域的保持。
- 基准测试显著提升—Qwen-Image-Bench从47.14升至55.20,ImgEdit-Bench从3.90升至4.37,GEdit-Bench中英文分别提升至8.17和8.05。
- 轻量路线推动社区探索—该模型验证了8B参数即可实现高分辨率生成与精细编辑,通过架构创新换取能力增长,为轻量级多模态模型迭代提供范本。
商汤开源轻量统一多模态模型 U1.5-Lite-Preview
商汤科技今日宣布,面向社区开源轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。这款模型并非简单的规模升级,而是基于 SenseNova U1 的系统性迭代,在同一架构中贯通了视觉理解、推理、生成与编辑四大能力。
轻量体量,能力跃升
最引人注目的是其轻量体量——仅以 8B-MoE 的参数规模,就将能力推进到 4K 分辨率、更精细的真实质感以及更复杂的视觉控制。商汤表示,如果说 U1 验证了统一架构的可行性,那么 U1.5 要进一步证明能力能否持续扩展。
四大核心方向显著提升
相比 U1,U1.5-Lite-Preview 在四个核心方向带来了显著提升:
- 原生支持 4K 图像生成:分辨率大幅提升,细节表现更丰富。
- 更精细的局部纹理与真实世界质感:图像细节更加自然逼真。
- 更准确的中英文文字生成与复杂版式组织:文字渲染能力增强,排版更合理。
- 更稳定的图像编辑和视觉指令遵循:编辑效果更可控,指令理解更准确。
技术细节优化
在技术细节上,商汤针对网格伪影和高分辨率细节建模问题,重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练扩展至 4K 分辨率。在图像编辑方面,模型重新组织了编辑数据与训练任务,强化对原图内容、主体身份、空间结构和非编辑区域的保持能力,确保在完成目标修改的同时尽可能保留原图中不需改动的部分。
多项基准测试大幅提升
测评结果印证了这轮优化的实际效果:
| 基准测试 | 之前 | 之后 |
|---|---|---|
| Qwen-Image-Bench | 47.14 | 55.20(配合提示词增强) |
| ImgEdit-Bench | 3.90 | 4.37 |
| GEdit-Bench(英文) | 7.47 | 8.17 |
| GEdit-Bench(中文) | 7.42 | 8.05 |
整体来看,生成质量与编辑稳定性均有明显跃升,尤其在图像编辑的指令遵循与原图保持方面进步突出。
以架构创新换取能力增长
商汤强调,U1.5-Lite-Preview 的核心思路是不盲目扩大模型规模,而是对生成与编辑全链路进行系统性优化。这种“以架构创新换取能力增长”的路线,为轻量级多模态模型的持续迭代提供了一个值得关注的范本——当 8B 参数就能跑通 4K 生成与精细编辑,统一多模态架构的潜力或许才刚刚开始释放。
总结:U1.5-Lite-Preview 证明了在轻量级参数规模下,通过架构创新与数据优化,依然可以实现高分辨率生成与复杂编辑能力。商汤开源这一模型,有望推动社区在统一多模态领域进行更多探索。
来源: aibase阅读原文