商湯釋出並開源SenseNova-Vision 把四大視覺任務統一進一個大模型

從多模型拼接走向大一統

2026-07-14 10:32

計算機視覺那條「一個任務對應一個模型」的老路,被商湯撕開了一道口子。7月13日,商湯宣佈正式釋出並全面開源日日新 SenseNova-Vision 理解生成統一視覺大模型,目標是把視覺變成通用基礎模型的「原生能力」。

過去做視覺,是個苦差事。檢測要一套模型,分割要另一套,測深度、做 3D 重建又各來一套,企業每上線一個能力就得養一個模型,彼此之間還不互通,維護成本和算力開銷都居高不下。SenseNova-Vision 想解決的,正是這種「碎片化」。

過去行業的「統一視覺」,多半是把檢測、分割、深度預測等多個專家模型打包封裝,本質還是割裂的。SenseNova-Vision 的核心變革在於,讓所有經典視覺任務——目標檢測、影象分割、深度預測、3D 重建——都 原生融入 同一個大模型體系,統一表述為多模態生成問題。

這種「原生融入」帶來雙向增益。一方面,視覺領域幾十年的高質量資料,直接反哺大模型底座的視覺理解能力;另一方面,大語言模型的推理能力反過來讓視覺任務融會貫通,甚至能用語言直接定義一個新的視覺任務。

在評測上,SenseNova-Vision 以「單模型」在四大核心視覺領域大範圍領跑:結構化視覺理解、稠密幾何預測、分割能力、多視角 3D 幾何,比肩甚至超越了各領域專用的「專家模型」。比如它能 零樣本泛化、讀懂未知遊戲畫面,也能在重疊魚群中把每條魚分割出來,還能看穿鏡面反射、還原真實空間幾何。

商湯在視覺 AI 領域連續十年位居中國市場份額第一,2025年還首登影片分析賽道全球第一。把這種行業領先的視覺能力,塞進統一多模態大模型體系,代表視覺 AI 從「執行工具」向「世界理解模型」的跨越。程式碼和權重已在 GitHub 的 OpenSenseNova 倉庫開源。

對開發者來說,最直觀的好處是省事:以前要整合五六個模型才能覆蓋的檢測、分割、深度、3D,現在一個介面就能調;對行業來說,這意味著視覺能力可以像「外掛」一樣,直接長進大模型裡,而不是永遠當外掛。