商汤开源 SenseNova-Vision 统一视觉模型
经典视觉,并回大模型
商汤在7月13日晚正式发布并全面开源了日日新SenseNova-Vision——一个把检测、分割、深度、3D重建等经典视觉任务原生统一进大模型的视觉模型。这不是把几个专家模型打包封装,而是让视觉成为通用基础模型的原生能力。

SenseNova-Vision的核心变革,是打破了「一个任务一个模型」的孤岛。过去做目标检测、图像分割、深度预测,往往要各自训练一套模型;商汤的做法是把这些任务统一表述为通用基础模型可理解的多模态生成问题,在同一个表征空间里联合训练。模型因此获得了跨任务的知识互补——深度估计的知识能强化分割的空间理解,分割又能辅助检测的边界判断。
实测里有几个超出预期的点。面对训练集从未出现过的游戏画面,模型无需重训就能同时做表面法向、实例分割和关键点检测;面对密密麻麻重叠的鱼群或货架商品,它能像外科手术一样精准剥离每个个体;在含镜面反射的复杂室内,它能过滤倒影、准确估计真实空间方向。换句话说,它不只看,而是在理解物理世界的几何逻辑。
性能上,SenseNova-Vision以单模型在检测、分割、深度、多视角3D四项核心视觉任务上比肩甚至超越专用专家模型,对标的包括语义导向的Youtu-VL和生成导向的Vision Banana。商汤同步开源了模型权重、数据,以及包含5000万条样本的训练语料库SenseNova-Vision Corpus-50M,等于把复现门槛直接降到社区可触及的水平。对高校实验室和中小团队而言,这相当于省去从零搭建检测、分割多套管线的成本,能把精力集中在应用创新而非重复造轮子上。
把视线拉远,这是视觉AI从执行工具走向世界理解模型的一步。商汤已连续十年位居中国视觉AI市场份额第一,这次把视觉能力融进统一多模态基座,也为7月18日WAIC 2026的论坛埋了伏笔。说到底,开源加统一架构,降低了视觉应用的门槛,开发者一个模型就能覆盖高频视觉需求,研发周期和部署成本都跟着往下走。