商汤发布并开源SenseNova-Vision 把四大视觉任务统一进一个大模型
从多模型拼接走向大一统
计算机视觉那条「一个任务对应一个模型」的老路,被商汤撕开了一道口子。7月13日,商汤宣布正式发布并全面开源日日新 SenseNova-Vision 理解生成统一视觉大模型,目标是把视觉变成通用基础模型的「原生能力」。
过去做视觉,是个苦差事。检测要一套模型,分割要另一套,测深度、做 3D 重建又各来一套,企业每上线一个能力就得养一个模型,彼此之间还不互通,维护成本和算力开销都居高不下。SenseNova-Vision 想解决的,正是这种「碎片化」。
过去行业的「统一视觉」,多半是把检测、分割、深度预测等多个专家模型打包封装,本质还是割裂的。SenseNova-Vision 的核心变革在于,让所有经典视觉任务——目标检测、图像分割、深度预测、3D 重建——都 原生融入 同一个大模型体系,统一表述为多模态生成问题。
这种「原生融入」带来双向增益。一方面,视觉领域几十年的高质量数据,直接反哺大模型底座的视觉理解能力;另一方面,大语言模型的推理能力反过来让视觉任务融会贯通,甚至能用语言直接定义一个新的视觉任务。
在评测上,SenseNova-Vision 以「单模型」在四大核心视觉领域大范围领跑:结构化视觉理解、稠密几何预测、分割能力、多视角 3D 几何,比肩甚至超越了各领域专用的「专家模型」。比如它能 零样本泛化、读懂未知游戏画面,也能在重叠鱼群中把每条鱼分割出来,还能看穿镜面反射、还原真实空间几何。
商汤在视觉 AI 领域连续十年位居中国市场份额第一,2025年还首登视频分析赛道全球第一。把这种行业领先的视觉能力,塞进统一多模态大模型体系,代表视觉 AI 从「执行工具」向「世界理解模型」的跨越。代码和权重已在 GitHub 的 OpenSenseNova 仓库开源。
对开发者来说,最直观的好处是省事:以前要集成五六个模型才能覆盖的检测、分割、深度、3D,现在一个接口就能调;对行业来说,这意味着视觉能力可以像「插件」一样,直接长进大模型里,而不是永远当外挂。