商湯開源 SenseNova-Vision 統一視覺模型

經典視覺,並回大模型

2026-07-15 10:16

商湯在7月13日晚正式釋出並全面開源了日日新SenseNova-Vision——一個把檢測、分割、深度、3D重建等經典視覺任務原生統一進大模型的視覺模型。這不是把幾個專家模型打包封裝,而是讓視覺成為通用基礎模型的原生能力。

商湯 SenseNova-Vision 統一視覺模型示意
商湯 SenseNova-Vision 統一視覺模型示意

SenseNova-Vision的核心變革,是打破了「一個任務一個模型」的孤島。過去做目標檢測、影象分割、深度預測,往往要各自訓練一套模型;商湯的做法是把這些任務統一表述為通用基礎模型可理解的多模態生成問題,在同一個表徵空間裡聯合訓練。模型因此獲得了跨任務的知識互補——深度估計的知識能強化分割的空間理解,分割又能輔助檢測的邊界判斷。

實測裡有幾個超出預期的點。面對訓練集從未出現過的遊戲畫面,模型無需重訓就能同時做表面法向、例項分割和關鍵點檢測;面對密密麻麻重疊的魚群或貨架商品,它能像外科手術一樣精準剝離每個個體;在含鏡面反射的複雜室內,它能過濾倒影、準確估計真實空間方向。換句話說,它不只看,而是在理解物理世界的幾何邏輯

效能上,SenseNova-Vision以單模型在檢測、分割、深度、多視角3D四項核心視覺任務上比肩甚至超越專用專家模型,對標的包括語義導向的Youtu-VL和生成導向的Vision Banana。商湯同步開源了模型權重、資料,以及包含5000萬條樣本的訓練語料庫SenseNova-Vision Corpus-50M,等於把復現門檻直接降到社群可觸及的水平。對高校實驗室和中小團隊而言,這相當於省去從零搭建檢測、分割多套管線的成本,能把精力集中在應用創新而非重複造輪子上。

把視線拉遠,這是視覺AI從執行工具走向世界理解模型的一步。商湯已連續十年位居中國視覺AI市場份額第一,這次把視覺能力融進統一多模態基座,也為7月18日WAIC 2026的論壇埋了伏筆。說到底,開源加統一架構,降低了視覺應用的門檻,開發者一個模型就能覆蓋高頻視覺需求,研發週期和部署成本都跟著往下走