时间:2026年8月3日
地点:中国上海
人物:商汤科技(SenseTime)、北京商报、量子位
事件详情:商汤科技于 8 月 3 日正式开源轻量级统一多模态模型预览版本 SenseNova U1.5-Lite-Preview。该模型延续商汤自研的 NEO-Unify 架构,将语言、视觉语义与像素生成整合进同一套模型,覆盖视觉理解、推理、生成与编辑四大能力。模型参数规模仅为 8B-MoT,原生支持 4K 图像直出,在生成质量、细节还原、中英文文字渲染与版式组织方面显著超越 4 月发布的 U1,多项主流评测效果可比肩商用闭源模型。代码与权重已同步发布至 GitHub、Hugging Face 与魔搭社区。商汤同步推出 Prompt Enhance Skill 实验工具,可将简短描述自动扩写为包含主体、布局、风格等要素的完整创作方案,面向专业用户的 U1 Pro 也在邀测中。
背景:多模态大模型长期面临理解与生成架构割裂的难题,传统方案要么用 CLIP 类模块拼接,要么引入扩散模型外挂,难以在单一模型内原生贯通。2026 年 4 月商汤发布 SenseNova U1 首次展示 NEO-Unify 统一架构路线,将像素与语言端到端融合。U1.5-Lite-Preview 是对该路线的系统性迭代,以 8B 轻量规模实现 4K 原生输出,验证统一架构可同时承载高分辨率生成、复杂信息表达与编辑控制。同期,谷歌 Gemini、OpenAI GPT-image-1、阿里 Qwen-Image 等也在推进原生多模态生成,行业竞争从拼接式方案转向原生架构。
影响:
- 8B 规模原生 4K 多模态显著降低开发者部署门槛,普通 GPU 即可运行
- 统一架构减少系统复杂度,企业应用集成成本下降
- 开源生态补齐国内原生多模态版图,与闭源方案形成正面对标
- 编辑与控制能力提升将推动 AI 创作工具从一次性生成向可持续迭代演进
总结:商汤 U1.5-Lite-Preview 验证了原生统一多模态架构的可扩展性,在 8B 轻量规模下交出 4K 直出、可编辑、可控的答卷。对于内容创作、广告设计、营销素材等高频视觉生产场景,企业可低成本获得与闭源商用模型相当的生成能力,国内开源多模态生态进入新的阶段。
参考来源:
- https://mparticle.uc.cn/article_org.html?uc_param_str=frdnsnpfvecpntnwprdssskt#!wm_cid=766931938882625536!!wm_id=1d2d859a7da24a0187a2256ca80b9f80
- https://finance.sina.cn/stock/jdts/2026-08-03/detail-inimafqi2580060.d.html
- https://m.itbear.com.cn/html/2026-08/1478896.html
- https://m.163.com/dy/article/L3EK8K4H0519DFFO.html
- https://finance.sina.cn/stock/jdts/2026-08-03/detail-inikzzhc6091446.d.html
- https://article.pchome.net/info/15235.html
- https://www.bbtnews.com.cn/2026/0803/601196.shtml
- https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
- https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview