Google Gemini 4 Ultra
Google DeepMind 于 2026 年 5 月发布的第四代旗舰多模态大模型,支持千万级 Token 上下文、原生多模态生成与 Agentic 自主工作流,搭载第七代 Ironwood TPU
深度报告
-
Google Gemini 4 Ultra 是 Google DeepMind 于 2026 年 5 月 19 日在 Google I/O 大会上发布的第四代旗舰级多模态大模型。作为 Gemini 系列的巅峰之作,Gemini 4 Ultra 以「Agentic-first」为设计理念,在上下文长度、多模态生成能力、自主推理与跨应用任务执行等方面实现了全面飞跃,被视为 Google 从「AI 助手」迈向「AI 操作系统」的核心引擎。
-
Gemini 4 Ultra 最大的突破来自其上下文窗口——最高支持 1000 万 Token(实际订阅版本提供 200 万 Token),是前代 Gemini 2.5 Pro 的 10 倍,也是当时业界最大的上下文窗口之一。这意味着它可以在单次推理中处理整部小说的全文、数小时的视频/音频转录、或者整个代码仓库的架构分析。 对于研究人员而言,可以直接将数百篇论文一次性喂入模型做综合分析与交叉引用;对于开发者而言,可以在一个会话中理解整个项目的业务逻辑与调用链路。
-
在基准测试方面,Gemini 4 Ultra 在 ARC-AGI2(抽象推理挑战)上取得了约 84.6% 的成绩,显著超越 GPT-5.5(约 7x%)和 Gemini 2.5 Pro(约 52%),展现出在全新约束条件下推理能力的质的提升。MMLU 得分 92.5,长文本检索精度(Needle In A Haystack)高达 95.2%,均处于当时第一梯队。
-
Gemini 4 Ultra 采用了稀疏 MoE(Mixture of Experts)架构,并引入了 Google 称为「知识激活门」的创新——模型会先判断用户的问题是否需要调用外部或本地知识库,再决定激活多少个 MoE 专家。据 Google 官方数据,相比 2.0 Ultra,相同算力下调用外部知识时的响应速度提升了 47%,准确率提升了 12%。
-
该模型是原生多模态设计,不仅支持文本、图像、音频的输入和输出,还首次在高保真度上支持视频生成(基于 Veo 3 模型)、音乐生成和空间感知输出(适配 AR/机器人)。Gemini 4 Ultra 的视频生成能力可在 30 秒内生成高清连贯短片,内置故事板功能,允许用户逐帧控制创作过程。
-
Gemini 4 Ultra 搭载在 Google 第七代 TPU——Ironwood(TPU v7)上运行。Ironwood 的峰值性能约为 TPU v5p 的 10 倍,单芯片推理/训练性能相比 Trillium(TPU v6)提升 4 倍。这种硬件层面的深度协同,使得 Gemini 4 Ultra 即使在处理千万级 Token 上下文的极端场景下仍能保持可控的推理延迟。
-
从产品矩阵来看,Gemini 4 系列分为四个层次:Gemini 4 Nano(端侧核心,INT4 量化后内存占用低于 600MB,延迟低至 35ms,适配 Android 17 设备离线运行);Gemini 4 Flash(边缘服务器设计,低延迟优化);Gemini 4 Pro(均衡型,支持 128K Token 上下文,面向通用场景);以及 Gemini 4 Ultra(旗舰级,面向极致性能需求)。
-
Gemini 4 Ultra 所驱动的应用场景覆盖了 Google 的整个产品生态。在 Gemini 应用中,它作为默认模型提供服务;在 Google 搜索的 AI Mode 中,它提供多步推理和引用了来源的会话式答案;在 Android 17 的 Gemini Intelligence 系统级 AI 层中,它驱动跨应用的自主工作流(如「从 Gmail 中找到我的课程大纲,识别教材,加入购物车」这样的单一指令即可完成多步操作);在 Android XR 智能眼镜上,它提供实时翻译、视觉理解和导航能力。 Gemini 4 Ultra 还引入了「Gemini Spark」智能体平台。Spark 是一个跨应用全自动任务智能体,能够从 Gmail 获取信息、操作购物车、完成下单等操作,无需用户手动指令。这是 Google 将 AI 从「被动应答」转向「主动执行」的关键一步。
-
订阅方案方面,Google 提供了分层定价:免费版受限于标准额度,上下文 32K Token;Google One AI Premium($19.99/月)提供 1M 上下文、4x 额度、Gmail/Drive/Docs 等 Workspace 整合,附赠 2TB 存储;Google AI Ultra($99.99/月)提供 5x 额度、Deep Think 推理模式、Gemini Spark 智能体、YouTube Premium 等权益。此外,针对专业用户还有更高级的 Gemini Ultra 订阅($249/月,2M 上下文、Veo 3 无限视频生成、30TB 存储)。 Gemini 4 Ultra 带来了 AI 能力在多个维度上的显著提升,但也存在值得关注的局限。首先是定价——最高档订阅 $249/月对于个人用户来说门槛较高,主要面向企业、研究机构和重度创作者。其次,在纯代码开发场景中,部分评测指出 Claude Max 和 GPT-5.5 在特定编码基准(SWE-Bench)上仍有优势。此外,千万级 Token 上下文的实际应用场景仍相对有限,对大多数用户而言 1M-2M Token 已绰绰有余。Gemini 4 Ultra 的发布也引发了关于 AI 能力边界与安全治理的新一轮讨论,Google 同步公布了 Safety Core 框架以应对模型能力跃升带来的潜在风险。
用户评论
-
逍遥_10—刚升级了 Gemini 4 Ultra,200万上下文真的太夸张了,直接把整个项目代码库扔进去,它居然能跨文件分析依赖关系。 -
SatoshiSnakeJones—Deep Think 模式确实强,但一次对话直接烧掉我 40% 的配额,肉疼。日常用 Pro 就够了,Ultra 适合真要啃硬骨头的时候。 -
Cynthia.Morgan_7—用了 Ultra 两周,最深的感觉就是:Google 生态整合是真香。在 Gmail 里直接让它总结邮件、在 Docs 里改文档、在 Sheets 里写公式,完全不用切窗口。如果你本来就生活在 Google 全家桶里,这个订阅性价比确实高。 -
IRodriguez_20244—我专门试了一下它处理超大文档的能力,把一本 400 页的电子书扔进去让它做章节摘要,12 秒出结果,每个章节的关键论点都抓得很准。以前用其他模型分章节处理至少得来回切十几次上下文,现在一次搞定,效率提升不是一点点。 -
DennisMartin_Plus—吐个槽:Gemini Ultra 的 Deep Research 跑出来的报告有时会漏引用来源,核查起来反而更费时间。功能是好功能,但「可验证性」还得加强。 -
Kathryn.Wilson_2022—Gemini 4 Ultra 的视频生成比想象中好,30 秒生成了一个产品宣传短片,连贯性不错,但细节经不起放大看。商用还得再迭代几版。 -
Cynthia_RichardsonSr—把 Gemini 4 Ultra 接入了我司的客服系统,上下文理解能力比之前用的模型强很多,能记住用户前面提过的需求,不用每次都重新说。 -
TOrtizK—Ironwood TPU 加持下的推理速度确实快,处理 100 页 PDF 基本是秒级响应。但说实话,大部分场景我用 32K 上下文的免费版也够了。 -
CRuizSr—我是做科研的,经常需要同时读十几篇论文做交叉分析。Ultra 的 200 万上下文对我来说是刚需,以前要花一整天的事现在一小时搞定。 -
BeverlyThompson_Plus—Gemini Spark 智能体试了一下,让它「从 Gmail 找到上周的报价单,提取价格,做成表格发给我」,居然真的跑通了。虽然中间卡了一次,但方向是对的,期待后续优化。 -
Douglas_Coleman_2020—纯代码场景我觉得 Claude 还是强一点,Ultra 写 Python 还行,但写 TypeScript 的时候偶尔会脑补不存在的 API。不过如果是做 Google Cloud 相关的开发,Ultra 对 GCP 生态的理解明显更深,算是有舍有得吧。 -
Christina_Simmons168—SEA 地区用户表示,最近 Ultra 的响应延迟明显变高了,不知道是海底电缆问题还是服务器负载问题。凌晨用倒挺快。 -
SLewis—知识激活门这个设计挺聪明的,简单问题不调大模型,省算力又快。DeepMind 在工程优化上确实有一套。 -
RClarkQ1—把一份 200 页的招股书扔进去,让它找出所有风险披露条款并对比往年变化,五分钟出结果。这要是人工做至少一整天。$20 月费光这一单就回本了。 -
Jerry_BellIII—Android 17 上的 Gemini Intelligence 确实好用,长按电源键直接说「帮我订下周五去上海的火车票」,它自己打开 12306、选车次、填信息,就差最后一步付款了。这种跨应用的 Agent 能力,确实让手机从一个被动工具变成了主动助手。 -
IRISnetProHall007—今天用 Gemini 4 Ultra 做了一个竞品分析报告,从网上抓了 5 家竞品的公开信息,加上我自己的产品文档,它自动生成了一个带对比表格的完整报告。最惊艳的是它还能自己配图,Imagen Ultra 4 生成的对比图直接可以用在 PPT 里。虽然有些数据需要人工核实,但整体质量已经能省掉 80% 的案头工作了。 -
onnxcu—Gemini Code Executor 2.0 支持跨语言协作编辑挺惊艳的,我一个 Python 脚本写到一半让它在里面跑 SQL 查询,结果直接出表。 -
5vjig78g1—Imagen Ultra 4 生成的图片真的比 Midjourney 还真实,尤其是人像,皮肤质感和光影处理太自然了。商用素材可以直接用。 -
LawrenceVasquez_66—个人感觉 Ultra 的中文能力比 GPT-5.5 好,写中文文案的时候用词自然很多,不会那种翻译腔。 -
MsEeviTuomala_x—试了一下 Gemini 4 Ultra 的音频理解能力,把一段 2 小时的会议录音扔进去,它自动生成了会议纪要和待办事项,发言人都能区分,牛。 -
Zachary_Allen—ARC-AGI2 84.6% 确实厉害,但日常使用中感知不强。绝大多数用户的问题根本到不了需要这种抽象推理的级别。 -
珊瑚611—升级到 Ultra 之后最大的变化其实是配额焦虑减轻了,不用再精打细算每次对话用了多少额度。5x 额度够我随便造。