深度报告
-
SenseNova U1 Pro 是商汤科技在 2026 世界人工智能大会(WAIC)上发布的旗舰级原生多模态大模型,2026 年 7 月 18 日在上海正式亮相。它主打「交付级」的复杂图文创作,能原生输出 8K 超高清图像,并围绕一个复杂目标做数十轮自我规划、生成、检查和修正。商汤把它定位成「面向长程任务的交付级原生多模态智能体基座」,明确对标 OpenAI 的 GPT-Image 2。目前只开放邀请测试,正式版、API 和定价要等到 2026 年 8 月才公开。
-
SenseNova U1 Pro 出自商汤科技(SenseTime),公司总部在中国上海,是国内做视觉 AI 起家的头部厂商,在计算机视觉领域有十余年积累。这款模型属于「日日新 SenseNova U」系列的旗舰版本,发布现场由商汤董事长兼 CEO 徐立主讲,联合创始人、首席科学家林达华(Dahua Lin)做技术演示。 商汤走的是「开源打口碑 + 闭源打营收」的分层路线。今年 4 月,它先开源了基础模型 SenseNova U1(Lite 版本,Apache 2.0 协议),到 7 月中旬,U1 和配套的 SenseNova-Skills 代码库在 GitHub 上的 Star 数合计突破 8500。今年 6 月,U1 用户人均日生图量跳到 107 张,比 5 月涨了近 3 倍,说明模型已经切进了真实工作流。这次的 U1 Pro 则是闭源的顶格版本,另外还有 U1 Standard(开源轻量)和 U1 Fast(高并发低成本)两条产品线做补充。
-
U1 Pro 围绕「一个复杂目标,持续理解、规划、执行、检查和修正」来设计,官方总结了四项核心能力。 第一是专业级设计美感,图像生成从「细节逼真」推进到「构图、色彩、排版都有设计感」,目标是弱化那股「AI 味」,直接达到可交付水准。第二是原生 8K 输出,最高支持 7680×4320 分辨率直出,像素是 4K 的 4 倍,放大后文字、线条、图标依然清晰,号称能经得起印刷和展览级的检验。第三是高密度图文控制,在信息量很大的版面里仍能维持整体排版,文字渲染出错率很低。第四是长程 Agentic 闭环思维,能围绕复杂目标跑数十轮的「生成循环」,一边画一边自查,发现图标放错、文字拼错就自己改,还能对整体风格和局部文字做同步精准编辑。 实际演示里,U1 Pro 交付过三个硬核案例:为 WAIC 九周年画的 4:1 超宽画幅水墨长卷《智会世图》,把 2018 到 2026 年九届大会的关键节点串成一幅东方美学地图;一次性输出《沙影之刃》完整世界观设定加 22 个逻辑连贯的电影分镜;还配合办公助手「小浣熊」,在世界杯开赛一个月前就预测出黑马佛得角出线,在 12 家参与预测的大模型里排第二,并自动生成了一张决赛数据可视化报告。这些能力已经落地在商汤的办公工具「小浣熊」和视频创作平台「Seko」里。
-
截至 2026 年 7 月,U1 Pro 还没有公布任何定价。商汤明确说,正式版会在 2026 年 8 月面向公众开放,届时同步推出 API 服务和商业化定价。目前唯一的接触方式是通过商汤 SenseNova 平台申请邀测,没有公开 API,也没有可下载的权重。 从商业逻辑看,商汤的打法是分层变现:U1 Pro 闭源、做顶格 8K 交付级能力赚营收;U1 Standard 和 Lite 开源,靠社区共建打口碑;U1 Fast 走高并发低成本,适合规模化调用。基础 SenseNova 平台此前推出过 Token Plan,首月试用期每个模型每 5 小时刷新 1500 次免费调用。目标客户覆盖办公、电商、教育出版、影视动漫、城市规划等需要专业视觉交付的场景。
-
由于 U1 Pro 还处于邀测阶段,真正上手的用户不多,公开评价主要来自媒体和少数体验者的实测。整体口碑偏正面,被反复称赞的是它在超长图、高信息密度版面上的稳定性——同一个「二十四节气」国画长卷提示词,U1 Pro 能完整呈现 24 个节气并逐一标注日期序号,而对照的 GPT-Image 2 出现内容缺失。做学术海报时,U1 Pro 一键输出的版面信息密度极高,还带可识别的二维码,商用完成度受到认可。 也有实测者提到,模型的长处其实不只在 8K 分辨率,更在于「围绕一个完整目标组织画面」的能力,能把信息、版式、人物、材质和风格放进同一次任务里。不过因为公众还用不上,这些评价的样本量有限,真实工作流下的稳定性还需要更大范围验证。
-
媒体普遍把 U1 Pro 看作「设计」赛道的重磅入局者。商汤自己的判断是:继编程能力之后,设计正在成为顶级多模态模型的下一个主战场,覆盖产品开发、平面设计、工业设计、视频制作和城市规划等场景。 技术层面,行业关注的焦点是 NEO-Unify 架构。这套架构由商汤联合南洋理工大学研发,最大的特点是「做减法」——它去掉了传统多模态模型里的视觉编码器和 VAE(变分自编码器),让像素和文字进入同一个 Mixture-of-Transformer(MoT)主干网络,理解和生成共用一套表征,不再有「翻译接缝」。密集小字之所以容易在传统模型里糊掉,正是因为这两道接缝,而 NEO-Unify 把它们都删了。林达华把这种统一形容成「思考、理解和创作在一个大脑里面统一,就像编剧和导演融为一体」。
-
最主要的质疑是:目前几乎所有对比数据都来自商汤自己的演示,没有第三方独立基准测试。U1 Pro 对标 GPT-Image 2 的说法、8K 对 4K 的分辨率优势、文字渲染出错率「极低」的表述,都还是厂商口径,尚未经过外部验证。模型的参数量、训练细节、速率限制、生产环境延迟也都没公布,连一份 U1 Pro 专属的技术报告都还没有,公开的只有底层 NEO-Unify 架构的论文。 其次是可用性门槛。邀测阶段名额有限,普通用户短期内摸不到,正式定价要等 8 月,性价比究竟如何还是未知数。功能边界上,U1 Pro 目前不能直接生成 3D 模型文件,专注超高清 2D 资产,需要 3D 的场景仍要配 Blender 或专门的 3D 生成模型。此外,商汤把模型定位成「理解·生成·行动」,但目前演示基本集中在静态图像生成,所谓「行动」(工具调用、Agentic 工作流)的能力还没真正落地展示,这块故事能不能兑现值得观察。
-
U1 Pro 适合对图文交付质量要求高的专业用户:需要做信息图、商业 PPT、宣传海报、学术海报、科普图解的职场人和设计师;要做影视分镜、角色概念设计的创意从业者;以及电商、教育出版等需要批量高质量视觉产出的团队。它的核心价值是「少抽卡」——如果真能在 8K 下第一两次就把文字、版式、构图做对,就能省下反复调图的时间成本。 不适合的场景也很清楚:需要 3D 模型输出的、追求即时低成本快速出图的(这更适合 U1 Fast),或者现在就要稳定 API 接入生产的用户,最好等 8 月正式版和定价出来再评估。替代方案上,海外可以看 GPT-Image 2、Seedream、Nano Banana Pro 等,国内即梦等产品也在同一赛道。
-
SenseNova U1 Pro 的野心不是「画得更好看」,而是把 AI 生图从「辅助玩具」推向「设计生产力智能体」——用原生统一架构、8K 超清、长程自审和高密度图文可控,去啃「交付级」这块硬骨头。技术路线有想象力,演示效果也够抓眼球,但成色最终要看 8 月的定价、API 表现,以及第三方独立评测能不能坐实那些厂商口径的优势。在那之前,它更像一份有说服力的「预告片」,而非可以立刻上生产线的成品。
用户评论
-
BryanPhillips_X—拿到邀测资格试了一轮,最直观的感受就是不用抽卡了。以前用别的模型出海报,一张能用的图前面废十几张,放大一看文字全糊。U1 Pro跑了五组品牌海报,四组构图配色直接能交付,只有一组排版偏保守,但也不用大改。做设计半年来第一次没在Photoshop里修AI出图的排版。 -
Carolyn.Coleman_77—8K原生直出这点是真能打,不是后期超分放大那种。我做过一张4比1的超宽信息长图,里面塞了两百多个汉字加几十个图标模块,放大到局部文字线条依然清晰稳定,一点都不发虚。做展板、户外大屏、印刷物料的终于不用在清晰度和信息密度之间二选一了。 -
马欣洁—说到底还是邀测,普通人现在根本摸不到,等8月吧。 -
MoonWalkerAllen—定价还没出,说是8月连API一起放,就看性价比了。 -
bigelephant720—那张WAIC九周年的水墨长卷刷屏了,第一眼真以为是清明上河图那种手绘。4比1的超宽画幅里满城人物山水楼阁,放大看骑马的官员、弹琵琶的乐师、卖香料的胡商,每个人物神态动作服饰都不一样,完全没有AI那种复制粘贴的敷衍感,而且时间线从2018铺到2026还串得很顺,确实惊艳。 -
KHughes52037—最戳我的是图文混排终于靠谱了。以前AI一碰中文字就翻车,做信息图标题logo全是乱码。U1 Pro的文字渲染准确率高很多,做汇报PPT配图基本不用逐字检查,但保险起见我还是会扫一遍。 -
PAriv—二十四节气那张长图确实完整,24个节气顺序日期都对,同样提示词GPT-Image-2就有缺失,信息图这块商汤是真占优。 -
NAmil—实测下来它的长处其实不只是8K,而是能围绕一个完整目标把信息、版式、人物、材质、风格塞进同一次任务里,这种整体组织能力比单纯堆像素难多了。 -
AaronWrightQ—客观说也不是没短板。特别复杂的跨模态推理偶尔会局部逻辑断裂,超长文本的字间距还有优化空间,Agentic循环在极端长程任务下的稳定性也得再看。但这算新范式初期的正常边界,不是架构性毛病。 -
冬雪_8—问一下现在3D能出吗?我看边界写的还是专注2D超高清,游戏原画分镜可以,但3D模型还得配Blender是吧? -
John_Ortiz_Max—对标GPT-Image 2这个姿态摆得很足,但目前五组对比全是商汤自己的演示,第三方独立评测一个都还没出,参数量也没公布,先观望。 -
JaimeSantana—会自己打草稿、审一遍再精修,这个「长程自审」比一次性出图靠谱太多了。 -
Julie.Butler01—NEO-unify这套架构思路挺狠的,直接把视觉编码器和VAE都砍了,让像素和文字进同一个MoT主干原生建模。以前的多模态模型理解和生成是两套体系,中间靠对齐模块勉强连,密集小字就是卡在这两道翻译接缝上才容易糊。现在共享一套表征,原生统一确实从根上解决了不少老毛病,文字渲染稳很多,这一步走得比堆参数有意思。 -
Mason.Chavez369—开源打口碑闭源打营收这套打法挺聪明的,U1 Lite先铺开GitHub都8000多star了,Pro闭源顶格收钱,节奏拿捏得不错。 -
GRamirezQ—学术海报那张信息密度是真高,架构图基准表格还带能扫的二维码,GPT那版留白太多密度上不去。搞科研做poster的可以蹲一波。 -
STurnerIII—做电商美工的表示很期待,海报主图和活动banner一直是痛点,旺季一天要出几十张,用别的AI出图光调文字排版就得反复折腾。要真能像宣传的那样一版直出商用成品,文字不乱码版式不翻车,能省下大把改图时间。就怕正式版排队和限流,还有8月的定价别太离谱。 -
purpleduck186—告别AI味这句我一开始以为是营销话术,直到看到那组咖啡品牌海报,低饱和暖棕配一抹橙红,留白够、字体克制统一,是有品味那种,不是单纯逼真。 -
MrCameronZhang_2024—国产生图这波是真起来了。 -
STmit—小浣熊和Seko里已经能用上了,办公和短剧分镜这两条线打通了,落地场景比纯发模型实在。 -
BrittanyKellyII—16000×24000的导演级分镜,40到60格还带景别机位标注,这个规格听着就离谱,独立创作者不用逐镜头抽卡拼了。 -
JeffreyButler—WAIC现场看的,徐立那幅铺满整面迎宾墙的长卷太震撼了,说是直出的当场有点不敢信。 -
Cheryl_AdamsK—能交互不等于能交付,这句话说得确实精准,戳中了这两年生图模型最大的幻觉。就是希望别光发布会好看,正式版稳定性和价格能跟得上才算数。 -
Alice_SanchezIII—林达华把它叫「创作模型」,说交付的是一个活在数字里的设计师,这个类比挺到位,跟coding模型交付一个会敲代码的程序员是一个逻辑。