深度報告
-
SenseNova U1 Pro 是商湯科技在 2026 世界人工智慧大會(WAIC)上釋出的旗艦級原生多模態大模型,2026 年 7 月 18 日在上海正式亮相。它主打「交付級」的複雜圖文創作,能原生輸出 8K 超高畫質影象,並圍繞一個複雜目標做數十輪自我規劃、生成、檢查和修正。商湯把它定位成「面向長程任務的交付級原生多模態智慧體基座」,明確對標 OpenAI 的 GPT-Image 2。目前只開放邀請測試,正式版、API 和定價要等到 2026 年 8 月才公開。
-
SenseNova U1 Pro 出自商湯科技(SenseTime),公司總部在中國上海,是國內做視覺 AI 起家的頭部廠商,在計算機視覺領域有十餘年積累。這款模型屬於「日日新 SenseNova U」系列的旗艦版本,釋出現場由商湯董事長兼 CEO 徐立主講,聯合創始人、首席科學家林達華(Dahua Lin)做技術演示。 商湯走的是「開源打口碑 + 閉源打營收」的分層路線。今年 4 月,它先開源了基礎模型 SenseNova U1(Lite 版本,Apache 2.0 協議),到 7 月中旬,U1 和配套的 SenseNova-Skills 程式碼庫在 GitHub 上的 Star 數合計突破 8500。今年 6 月,U1 使用者人均日生圖量跳到 107 張,比 5 月漲了近 3 倍,說明模型已經切進了真實工作流。這次的 U1 Pro 則是閉源的頂格版本,另外還有 U1 Standard(開源輕量)和 U1 Fast(高併發低成本)兩條產品線做補充。
-
U1 Pro 圍繞「一個複雜目標,持續理解、規劃、執行、檢查和修正」來設計,官方總結了四項核心能力。 第一是專業級設計美感,影象生成從「細節逼真」推進到「構圖、色彩、排版都有設計感」,目標是弱化那股「AI 味」,直接達到可交付水準。第二是原生 8K 輸出,最高支援 7680×4320 解析度直出,畫素是 4K 的 4 倍,放大後文字、線條、圖示依然清晰,號稱能經得起印刷和展覽級的檢驗。第三是高密度圖文控制,在資訊量很大的版面裡仍能維持整體排版,文字渲染出錯率很低。第四是長程 Agentic 閉環思維,能圍繞複雜目標跑數十輪的「生成迴圈」,一邊畫一邊自查,發現圖示放錯、文字拼錯就自己改,還能對整體風格和區域性文字做同步精準編輯。 實際演示裡,U1 Pro 交付過三個硬核案例:為 WAIC 九週年畫的 4:1 超寬畫幅水墨長卷《智會世圖》,把 2018 到 2026 年九屆大會的關鍵節點串成一幅東方美學地圖;一次性輸出《沙影之刃》完整世界觀設定加 22 個邏輯連貫的電影分鏡;還配合辦公助手「小浣熊」,在世界盃開賽一個月前就預測出黑馬維德角出線,在 12 家參與預測的大模型裡排第二,並自動生成了一張決賽資料視覺化報告。這些能力已經落地在商湯的辦公工具「小浣熊」和影片創作平臺「Seko」裡。
-
截至 2026 年 7 月,U1 Pro 還沒有公佈任何定價。商湯明確說,正式版會在 2026 年 8 月面向公眾開放,屆時同步推出 API 服務和商業化定價。目前唯一的接觸方式是透過商湯 SenseNova 平臺申請邀測,沒有公開 API,也沒有可下載的權重。 從商業邏輯看,商湯的打法是分層變現:U1 Pro 閉源、做頂格 8K 交付級能力賺營收;U1 Standard 和 Lite 開源,靠社群共建打口碑;U1 Fast 走高併發低成本,適合規模化呼叫。基礎 SenseNova 平臺此前推出過 Token Plan,首月試用期每個模型每 5 小時重新整理 1500 次免費呼叫。目標客戶覆蓋辦公、電商、教育出版、影視動漫、城市規劃等需要專業視覺交付的場景。
-
由於 U1 Pro 還處於邀測階段,真正上手的使用者不多,公開評價主要來自媒體和少數體驗者的實測。整體口碑偏正面,被反覆稱讚的是它在超長圖、高資訊密度版面上的穩定性——同一個「二十四節氣」國畫長卷提示詞,U1 Pro 能完整呈現 24 個節氣並逐一標註日期序號,而對照的 GPT-Image 2 出現內容缺失。做學術海報時,U1 Pro 一鍵輸出的版面資訊密度極高,還帶可識別的二維碼,商用完成度受到認可。 也有實測者提到,模型的長處其實不只在 8K 解析度,更在於「圍繞一個完整目標組織畫面」的能力,能把資訊、版式、人物、材質和風格放進同一次任務裡。不過因為公眾還用不上,這些評價的樣本量有限,真實工作流下的穩定性還需要更大範圍驗證。
-
媒體普遍把 U1 Pro 看作「設計」賽道的重磅入局者。商湯自己的判斷是:繼程式設計能力之後,設計正在成為頂級多模態模型的下一個主戰場,覆蓋產品開發、平面設計、工業設計、影片製作和城市規劃等場景。 技術層面,行業關注的焦點是 NEO-Unify 架構。這套架構由商湯聯合南洋理工大學研發,最大的特點是「做減法」——它去掉了傳統多模態模型裡的視覺編碼器和 VAE(變分自編碼器),讓畫素和文字進入同一個 Mixture-of-Transformer(MoT)主幹網路,理解和生成共用一套表徵,不再有「翻譯接縫」。密集小字之所以容易在傳統模型裡糊掉,正是因為這兩道接縫,而 NEO-Unify 把它們都刪了。林達華把這種統一形容成「思考、理解和創作在一個大腦裡面統一,就像編劇和導演融為一體」。
-
最主要的質疑是:目前幾乎所有對比資料都來自商湯自己的演示,沒有第三方獨立基準測試。U1 Pro 對標 GPT-Image 2 的說法、8K 對 4K 的解析度優勢、文字渲染出錯率「極低」的表述,都還是廠商口徑,尚未經過外部驗證。模型的引數量、訓練細節、速率限制、生產環境延遲也都沒公佈,連一份 U1 Pro 專屬的技術報告都還沒有,公開的只有底層 NEO-Unify 架構的論文。 其次是可用性門檻。邀測階段名額有限,普通使用者短期內摸不到,正式定價要等 8 月,價效比究竟如何還是未知數。功能邊界上,U1 Pro 目前不能直接生成 3D 模型檔案,專注超高畫質 2D 資產,需要 3D 的場景仍要配 Blender 或專門的 3D 生成模型。此外,商湯把模型定位成「理解·生成·行動」,但目前演示基本集中在靜態影象生成,所謂「行動」(工具呼叫、Agentic 工作流)的能力還沒真正落地展示,這塊故事能不能兌現值得觀察。
-
U1 Pro 適合對圖文交付質量要求高的專業使用者:需要做資訊圖、商業 PPT、宣傳海報、學術海報、科普圖解的職場人和設計師;要做影視分鏡、角色概念設計的創意從業者;以及電商、教育出版等需要批次高質量視覺產出的團隊。它的核心價值是「少抽卡」——如果真能在 8K 下第一兩次就把文字、版式、構圖做對,就能省下反覆調圖的時間成本。 不適合的場景也很清楚:需要 3D 模型輸出的、追求即時低成本快速出圖的(這更適合 U1 Fast),或者現在就要穩定 API 接入生產的使用者,最好等 8 月正式版和定價出來再評估。替代方案上,海外可以看 GPT-Image 2、Seedream、Nano Banana Pro 等,國內即夢等產品也在同一賽道。
-
SenseNova U1 Pro 的野心不是「畫得更好看」,而是把 AI 生圖從「輔助玩具」推向「設計生產力智慧體」——用原生統一架構、8K 超清、長程自審和高密度圖文可控,去啃「交付級」這塊硬骨頭。技術路線有想象力,演示效果也夠抓眼球,但成色最終要看 8 月的定價、API 表現,以及第三方獨立評測能不能坐實那些廠商口徑的優勢。在那之前,它更像一份有說服力的「預告片」,而非可以立刻上生產線的成品。
使用者評論
-
BryanPhillips_X—拿到邀測資格試了一輪,最直觀的感受就是不用抽卡了。以前用別的模型出海報,一張能用的圖前面廢十幾張,放大一看文字全糊。U1 Pro跑了五組品牌海報,四組構圖配色直接能交付,只有一組排版偏保守,但也不用大改。做設計半年來第一次沒在Photoshop裡修AI出圖的排版。 -
Carolyn.Coleman_77—8K原生直出這點是真能打,不是後期超分放大那種。我做過一張4比1的超寬資訊長圖,裡面塞了兩百多個漢字加幾十個圖示模組,放大到區域性文字線條依然清晰穩定,一點都不發虛。做展板、戶外大屏、印刷物料的終於不用在清晰度和資訊密度之間二選一了。 -
馬欣潔—說到底還是邀測,普通人現在根本摸不到,等8月吧。 -
MoonWalkerAllen—定價還沒出,說是8月連API一起放,就看價效比了。 -
bigelephant720—那張WAIC九週年的水墨長卷刷屏了,第一眼真以為是清明上河圖那種手繪。4比1的超寬畫幅裡滿城人物山水樓閣,放大看騎馬的官員、彈琵琶的樂師、賣香料的胡商,每個人物神態動作服飾都不一樣,完全沒有AI那種複製貼上的敷衍感,而且時間線從2018鋪到2026還串得很順,確實驚豔。 -
KHughes52037—最戳我的是圖文混排終於靠譜了。以前AI一碰中文字就翻車,做資訊圖示題logo全是亂碼。U1 Pro的文字渲染準確率高很多,做彙報PPT配圖基本不用逐字檢查,但保險起見我還是會掃一遍。 -
PAriv—二十四節氣那張長圖確實完整,24個節氣順序日期都對,同樣提示詞GPT-Image-2就有缺失,資訊圖這塊商湯是真佔優。 -
NAmil—實測下來它的長處其實不只是8K,而是能圍繞一個完整目標把資訊、版式、人物、材質、風格塞進同一次任務裡,這種整體組織能力比單純堆畫素難多了。 -
AaronWrightQ—客觀說也不是沒短板。特別複雜的跨模態推理偶爾會區域性邏輯斷裂,超長文字的字間距還有最佳化空間,Agentic迴圈在極端長程任務下的穩定性也得再看。但這算新正規化初期的正常邊界,不是架構性毛病。 -
冬雪_8—問一下現在3D能出嗎?我看邊界寫的還是專注2D超高畫質,遊戲原畫分鏡可以,但3D模型還得配Blender是吧? -
John_Ortiz_Max—對標GPT-Image 2這個姿態擺得很足,但目前五組對比全是商湯自己的演示,第三方獨立評測一個都還沒出,引數量也沒公佈,先觀望。 -
JaimeSantana—會自己打草稿、審一遍再精修,這個「長程自審」比一次性出圖靠譜太多了。 -
Julie.Butler01—NEO-unify這套架構思路挺狠的,直接把視覺編碼器和VAE都砍了,讓畫素和文字進同一個MoT主幹原生建模。以前的多模態模型理解和生成是兩套體系,中間靠對齊模組勉強連,密集小字就是卡在這兩道翻譯接縫上才容易糊。現在共享一套表徵,原生統一確實從根上解決了不少老毛病,文字渲染穩很多,這一步走得比堆引數有意思。 -
Mason.Chavez369—開源打口碑閉源打營收這套打法挺聰明的,U1 Lite先鋪開GitHub都8000多star了,Pro閉源頂格收錢,節奏拿捏得不錯。 -
GRamirezQ—學術海報那張資訊密度是真高,架構圖基準表格還帶能掃的二維碼,GPT那版留白太多密度上不去。搞科研做poster的可以蹲一波。 -
STurnerIII—做電商美工的表示很期待,海報主圖和活動banner一直是痛點,旺季一天要出幾十張,用別的AI出圖光調文字排版就得反覆折騰。要真能像宣傳的那樣一版直出商用成品,文字不亂碼版式不翻車,能省下大把改圖時間。就怕正式版排隊和限流,還有8月的定價別太離譜。 -
purpleduck186—告別AI味這句我一開始以為是營銷話術,直到看到那組咖啡品牌海報,低飽和暖棕配一抹橙紅,留白夠、字型剋制統一,是有品味那種,不是單純逼真。 -
MrCameronZhang_2024—國產生圖這波是真起來了。 -
STmit—小浣熊和Seko裡已經能用上了,辦公和短劇分鏡這兩條線打通了,落地場景比純發模型實在。 -
BrittanyKellyII—16000×24000的導演級分鏡,40到60格還帶景別機位標註,這個規格聽著就離譜,獨立創作者不用逐鏡頭抽卡拼了。 -
JeffreyButler—WAIC現場看的,徐立那幅鋪滿整面迎賓牆的長卷太震撼了,說是直出的當場有點不敢信。 -
Cheryl_AdamsK—能互動不等於能交付,這句話說得確實精準,戳中了這兩年生圖模型最大的幻覺。就是希望別光釋出會好看,正式版穩定性和價格能跟得上才算數。 -
Alice_SanchezIII—林達華把它叫「創作模型」,說交付的是一個活在數字裡的設計師,這個類比挺到位,跟coding模型交付一個會敲程式碼的程式設計師是一個邏輯。