SenseNova U1 Pro

商汤发布的旗舰原生多模态大模型,主打交付级复杂图文创作与原生 8K 超清输出

詳細レポート

  • SenseNova U1 Pro は、2026 年の世界人工知能会議 (WAIC) で SenseTime Technology によって発表されたフラッグシップのネイティブ マルチモーダル大型モデルです。これは、2026 年 7 月 18 日に上海で正式に発表されました。「納品レベル」の複雑なグラフィックスとテキストの作成に焦点を当てており、8K 超高解像度画像をネイティブに出力でき、複雑な目標に沿って数十回の自己計画、生成、検査、および修正を実行できます。 SenseTime は、これを「長距離タスク向けの配信レベルのネイティブ マルチモーダル エージェント ベース」と位置付けており、OpenAI の GPT-Image 2 に対するベンチマークを明らかにしています。現在は招待テストのみが公開されており、正式バージョン、API、価格は 2026 年 8 月まで公開されません。

  • SenseNova U1 Pro は、中国の上海に本社を置く SenseTime によって製造されています。同社は中国のビジュアル AI の大手メーカーであり、コンピューター ビジョンの分野で 10 年以上の経験を蓄積しています。 「RiRiXin SenseNova U」シリーズのフラッグシップモデルです。発射場では、センスタイムの会長兼最高経営責任者(CEO)の徐李氏が講義を行い、共同創設者兼主席科学者のダーファ・リン氏が技術デモンストレーションを行った。 SenseTime は、「評判を築くオープンソース + 収益を築くクローズドソース」という階層的なルートをたどっています。今年4月には基本モデルSenseNova U1(Lite版、Apache 2.0プロトコル)を初めてオープンソース化した。 7 月中旬までに、U1 と GitHub 上でサポートされている SenseNova-Skills コード ライブラリのスターの合計数が 8,500 を超えました。今年 6 月には、U1 ユーザーあたり 1 日に生成される画像の平均数が 107 に急増し、5 月のほぼ 3 倍となり、このモデルが実際のワークフローに入ったことを示しています。今回の U1 Pro はクローズドソースのトップレベル バージョンで、U1 Standard (オープンソースで軽量) と U1 Fast (高同時実行性と低コスト) の 2 つの製品ラインで補完されています。

  • U1 Proは「複雑な目標、継続的な理解、計画、実行、検査、修正」を中心に設計されており、公式は4つの核となる機能を要約している。 1 つ目は、プロレベルのデザインの美しさです。画像生成は「リアルなディテール」から「デザイン性のある構図・色・レイアウト」へと進化しました。目標は、「AI 風味」を弱め、成果物レベルに直接到達することです。 2 つ目はネイティブ 8K 出力で、最大 7680×4320 解像度の直接出力をサポートします。画素数は4Kの4倍。拡大しても文字、線、アイコンは鮮明です。印刷や展示会レベルの検査にも耐えられるという。 3 つ目は、高密度のグラフィックスとテキストのコントロールです。これにより、大量の情報を含むレイアウトでも全体のレイアウトを維持でき、テキストのレンダリング エラー率が非常に低くなります。 4 つ目は、長期的なエージェントのクローズドループ思考です。複雑な目標に向けて何十ラウンドもの「生成ループ」を実行できます。描画中にセルフチェックすることができます。アイコンの位置が間違っていたり、テキストのスペルが間違っている場合は、自分で修正できます。また、スタイル全体とローカル テキストを同時に正確に編集することもできます。 実際のデモンストレーションでは、U1 Pro は 3 つのハードコア ケースを提供しました。1 つは、WAIC 9 周年を記念して描かれた 4:1 ウルトラワイド フォーマットのインク スクロール「知的世界地図」で、2018 年から 2026 年までの 9 つの会議の主要なノードを東洋の美的地図に結び付けました。 「シャドウ ブレード」の完全な世界観設定を一度に出力したものに、論理的に一貫した 22 の映画絵コンテを加えたもの。また、事務アシスタントの「リトル アライグマ」と協力して、ダークホースのカーボベルデが開幕 1 か月前にワールドカップ出場権を獲得すると予測し、予測に参加した 12 の大型モデルの中で 2 位にランクされ、最終的なデータ視覚化レポートを自動的に生成しました。これらの機能は、SenseTime社のオフィスツール「Little Raccoon」とビデオ作成プラットフォーム「Seko」に実装されています。

  • 2026 年 7 月の時点で、U1 Pro の価格は発表されていません。 SenseTimeは、正式版が2026年8月に公開され、APIサービスと商用価格が同時に開始されることを明らかにした。現時点では、連絡を取る唯一の方法は、SenseNova プラットフォームを通じてテストへの招待を申請することです。パブリック API やダウンロード可能な重みはありません。 ビジネス ロジックの観点から見ると、SenseTime のアプローチは階層的に収益化することです。U1 Pro はクローズド ソースであり、収益を得るためにトップレベルの 8K 配信レベルの機能を提供します。 U1 Standard と Lite はオープンソースであり、評判を築くためにコミュニティの共同構築に依存しています。 U1 Fast は同時実行性が高く、コストが低いため、大規模な呼び出しに適しています。基本的な SenseNova プラットフォームは以前にトークン プランを開始しており、最初の 1 か月間試用期間中、モデルごとに 5 時間ごとに 1,500 回の無料通話が更新されます。対象となる顧客は、オフィス、電子商取引、教育出版、映画やテレビのアニメーション、都市計画、およびプロフェッショナルなビジュアル配信を必要とするその他のシナリオをカバーしています。

  • U1 Proはまだベータテストの段階なので、実際に使っているユーザーは多くありません。公的評価は主にメディアと少数の経験者による実際のテストから得られます。全体的な評判は良好です。繰り返し賞賛されているのは、超長尺画像と高い情報密度のレイアウトでの安定性です。同じ「二十四節気」の中国絵画の長いスクロール プロンプトについて、U1 Pro は 24 節気を完全に表示し、日付のシリアル番号を 1 つずつマークできますが、比較用の GPT 画像 2 にはコンテンツがありません。学術ポスターを作成する場合、U1 Pro がワンクリックで出力するレイアウト情報は非常に緻密で、認識可能な QR コードも付いており、商業的な完成度が認められます。 一部のテスターは、このモデルの利点は 8K 解像度だけでなく、情報、レイアウト、文字、マテリアル、スタイルを同じタスクに組み込むことができる、「完全な目標に基づいて画像を編成する」機能にもあると述べました。ただし、一般の人はまだ使用していないため、これらの評価のサンプルサイズは限られており、実際のワークフローでの安定性をより大規模に検証する必要があります。

  • メディアは一般に、U1 Pro を「デザイン」分野への主要な参入者とみなしています。 SenseTime 独自の判断では、トップのマルチモーダル モデルにとって、プログラミング機能の次はデザインが次の主戦場となり、製品開発、グラフィック デザイン、工業デザイン、ビデオ制作、都市計画などのシナリオがカバーされます。 技術レベルでは、業界の焦点は NEO-Unify アーキテクチャです。このアーキテクチャは、SenseTime と南洋理工大学によって開発されました。その最大の特徴は「減算」です。これにより、従来のマルチモーダル モデルのビジュアル エンコーダーと VAE (変動オートエンコーダー) が削除され、ピクセルとテキストが同じ Mixture-of-Transformer (MoT) バックボーン ネットワークに入力できるようになります。理解と生成は一連の表現を共有するため、「翻訳の継ぎ目」はなくなります。従来モデルで密な小さな文字がにじみやすいのはまさにこの2つの継ぎ目によるものだったが、NEO-Unifyではそれを削除。林ダーファはこの統合を「脚本家と監督が一つに統合されたように、思考、理解、創造が一つの脳に統合される」と表現しました。

  • 主な疑問は、現在、ほぼすべての比較データが SenseTime 独自のデモンストレーションから取得されており、サードパーティによる独立したベンチマーク テストが存在しないということです。 GPT-Image 2 に対する U1 Pro の主張、4K に対する 8K の解像度の利点、および「非常に低い」テキスト レンダリング エラー率はすべて、依然としてメーカーによって述べられており、まだ外部で検証されていません。モデルのパラメーター、トレーニングの詳細、レート制限、本番環境の遅延は発表されていません。 U1 Pro 専用の技術レポートすらありません。基礎となる NEO-Unify アーキテクチャに関する論文のみが公開されています。 2 番目は可用性のしきい値です。招待テスト段階の参加枠は限られており、一般ユーザーは短期間では入手できません。正式な価格設定は8月まで待たなければならず、価格性能比はまだ不明だ。機能の面では、U1 Pro は現在 3D モデル ファイルを直接生成できず、超高解像度の 2D アセットに重点を置いています。 3D が必要なシーンでも、Blender または特殊な 3D 生成モデルが必要です。なお、SenseTimeではモデルを「理解・生成・アクション」と位置付けているが、今回のデモは基本的に静的な画像の生成に焦点が当てられており、いわゆる「アクション」機能(ツール呼び出し、エージェントティックワークフロー)については本格的に実証されていない。この物語が実現するかどうか注目される。

  • U1 Pro は、グラフィック配信の品質に高い要求を持つプロフェッショナル ユーザー、つまりインフォグラフィック、ビジネス PPT、プロモーション ポスター、学術ポスター、ポピュラー サイエンスのイラストを作成する必要がある専門家やデザイナーに適しています。映画やテレビの絵コンテやキャラクターのコンセプトデザインをしたいクリエイティブな実務家。高品質のビジュアル出力のバッチを必要とする電子商取引、教育出版などのチーム。その核となる価値は「カードのドローが少なくなる」ことです。8K の 1 回目または 2 回目でテキスト、レイアウト、構成を実際に正しく行うことができれば、画像を繰り返し調整する時間とコストを節約できます。 不向きなシナリオも明らかです。3D モデルを出力する必要がある人、インスタントで低コストで高速な描画を追求する人 (これは U1 Fast に適しています)、または今すぐ本番環境への安定した API アクセスが必要な人です。評価する前に、8 月の正式バージョンと価格がリリースされるまで待つのが最善です。代替案としては、海外ではGPT-Image 2、Seedream、Nano Banana Proなどが挙げられます。済蒙などの国産品も同じ軌道に乗っている。

  • SenseNova U1 Pro の目標は、「より見栄えの良い描画」ではなく、AI 描画を「補助玩具」から「設計生産性エージェント」に押し上げることです。ネイティブの統合アーキテクチャ、8K の超鮮明な長期セルフレビュー、および高密度のグラフィックスとテキスト コントロールを使用して、「納品グレード」という難しい問題を解決します。技術的なルートは想像力豊かで、デモンストレーションの効果は目を引くものですが、品質は最終的には8月の価格設定、APIのパフォーマンス、およびサードパーティの独立した評価でそれらのメーカーの利点が確認できるかどうかに依存します。それまでは、すぐに生産ラインに投入できる完成品というよりは、説得力のある「予告編」のようなものです。

ユーザーレビュー

  • 头像
    BryanPhillips_X
    拿到邀测资格试了一轮,最直观的感受就是不用抽卡了。以前用别的模型出海报,一张能用的图前面废十几张,放大一看文字全糊。U1 Pro跑了五组品牌海报,四组构图配色直接能交付,只有一组排版偏保守,但也不用大改。做设计半年来第一次没在Photoshop里修AI出图的排版。

  • 头像
    Carolyn.Coleman_77
    8K原生直出这点是真能打,不是后期超分放大那种。我做过一张4比1的超宽信息长图,里面塞了两百多个汉字加几十个图标模块,放大到局部文字线条依然清晰稳定,一点都不发虚。做展板、户外大屏、印刷物料的终于不用在清晰度和信息密度之间二选一了。

  • 头像
    马欣洁
    说到底还是邀测,普通人现在根本摸不到,等8月吧。

  • 头像
    MoonWalkerAllen
    定价还没出,说是8月连API一起放,就看性价比了。

  • 头像
    bigelephant720
    那张WAIC九周年的水墨长卷刷屏了,第一眼真以为是清明上河图那种手绘。4比1的超宽画幅里满城人物山水楼阁,放大看骑马的官员、弹琵琶的乐师、卖香料的胡商,每个人物神态动作服饰都不一样,完全没有AI那种复制粘贴的敷衍感,而且时间线从2018铺到2026还串得很顺,确实惊艳。

  • 头像
    KHughes52037
    最戳我的是图文混排终于靠谱了。以前AI一碰中文字就翻车,做信息图标题logo全是乱码。U1 Pro的文字渲染准确率高很多,做汇报PPT配图基本不用逐字检查,但保险起见我还是会扫一遍。

  • 头像
    PAriv
    二十四节气那张长图确实完整,24个节气顺序日期都对,同样提示词GPT-Image-2就有缺失,信息图这块商汤是真占优。

  • 头像
    NAmil
    实测下来它的长处其实不只是8K,而是能围绕一个完整目标把信息、版式、人物、材质、风格塞进同一次任务里,这种整体组织能力比单纯堆像素难多了。

  • 头像
    AaronWrightQ
    客观说也不是没短板。特别复杂的跨模态推理偶尔会局部逻辑断裂,超长文本的字间距还有优化空间,Agentic循环在极端长程任务下的稳定性也得再看。但这算新范式初期的正常边界,不是架构性毛病。

  • 头像
    冬雪_8
    问一下现在3D能出吗?我看边界写的还是专注2D超高清,游戏原画分镜可以,但3D模型还得配Blender是吧?

  • 头像
    John_Ortiz_Max
    对标GPT-Image 2这个姿态摆得很足,但目前五组对比全是商汤自己的演示,第三方独立评测一个都还没出,参数量也没公布,先观望。

  • 头像
    JaimeSantana
    会自己打草稿、审一遍再精修,这个「长程自审」比一次性出图靠谱太多了。

  • 头像
    Julie.Butler01
    NEO-unify这套架构思路挺狠的,直接把视觉编码器和VAE都砍了,让像素和文字进同一个MoT主干原生建模。以前的多模态模型理解和生成是两套体系,中间靠对齐模块勉强连,密集小字就是卡在这两道翻译接缝上才容易糊。现在共享一套表征,原生统一确实从根上解决了不少老毛病,文字渲染稳很多,这一步走得比堆参数有意思。

  • 头像
    Mason.Chavez369
    开源打口碑闭源打营收这套打法挺聪明的,U1 Lite先铺开GitHub都8000多star了,Pro闭源顶格收钱,节奏拿捏得不错。

  • 头像
    GRamirezQ
    学术海报那张信息密度是真高,架构图基准表格还带能扫的二维码,GPT那版留白太多密度上不去。搞科研做poster的可以蹲一波。

  • 头像
    STurnerIII
    做电商美工的表示很期待,海报主图和活动banner一直是痛点,旺季一天要出几十张,用别的AI出图光调文字排版就得反复折腾。要真能像宣传的那样一版直出商用成品,文字不乱码版式不翻车,能省下大把改图时间。就怕正式版排队和限流,还有8月的定价别太离谱。

  • 头像
    purpleduck186
    告别AI味这句我一开始以为是营销话术,直到看到那组咖啡品牌海报,低饱和暖棕配一抹橙红,留白够、字体克制统一,是有品味那种,不是单纯逼真。

  • 头像
    MrCameronZhang_2024
    国产生图这波是真起来了。

  • 头像
    STmit
    小浣熊和Seko里已经能用上了,办公和短剧分镜这两条线打通了,落地场景比纯发模型实在。

  • 头像
    BrittanyKellyII
    16000×24000的导演级分镜,40到60格还带景别机位标注,这个规格听着就离谱,独立创作者不用逐镜头抽卡拼了。

  • 头像
    JeffreyButler
    WAIC现场看的,徐立那幅铺满整面迎宾墙的长卷太震撼了,说是直出的当场有点不敢信。

  • 头像
    Cheryl_AdamsK
    能交互不等于能交付,这句话说得确实精准,戳中了这两年生图模型最大的幻觉。就是希望别光发布会好看,正式版稳定性和价格能跟得上才算数。

  • 头像
    Alice_SanchezIII
    林达华把它叫「创作模型」,说交付的是一个活在数字里的设计师,这个类比挺到位,跟coding模型交付一个会敲代码的程序员是一个逻辑。