深度报告
-
xAI Grok 5 是埃隆·马斯克旗下 xAI 公司正在开发的下一代旗舰大语言模型,采用约 6 万亿参数的混合专家(MoE)架构,原生支持文本/图像/音频/视频多模态输入,并深度整合 X 平台实时数据流。截至 2026 年 7 月,Grok 5 仍在 Colossus 2 超算集群上训练中,尚未正式发布;xAI 于 7 月 9 日先行推出了基于 V9 基础模型的 Grok 4.5(1.5 万亿参数)作为过渡旗舰。Grok 5 被马斯克称为「有 10% 概率实现 AGI」,但实际发布时间已从 2025 年底多次推迟至预期 2026 年 Q3。
-
xAI 由埃隆·马斯克于 2023 年 7 月创立,核心使命是「理解宇宙的真实本质」,打造「最大程度追求真相」的 AI 系统。公司团队来自 OpenAI、Google DeepMind、Tesla 等机构。2026 年 2 月,SpaceX 以 1.25 万亿美元全股票交易收购 xAI,为后者提供了稳定的财务支持和 SpaceX 基础设施资源。xAI 在田纳西州孟菲斯运营着全球最大的 AI 训练设施 Colossus 超算集群,Colossus 2 于 2026 年 1 月突破 1 吉瓦功率门槛,部署约 55 万块 NVIDIA H100/GB200 GPU,总投资估计达 180 亿美元。Grok 系列始于 2023 年 11 月的 Grok-1,经历了 Grok-1.5、Grok-2、Grok-3 到 2025 年 7 月的 Grok 4 旗舰,再到 2026 年的 Grok 4.3(4 月 30 日,长上下文平价版)和 Grok 4.5(7 月 9 日,V9 基础临时旗舰),以及仍在训练的 Grok 5。
-
Grok 5 的架构设计有几个关键特征。第一,约 6 万亿参数的 MoE 架构,每次查询只激活最相关的子网络,在实现超大规模的同时控制推理成本。第二,1.5 百万 token 的超长上下文窗口,可一次性处理近乎完整的代码库或长时间视频时间线。第三,原生多模态能力,无需外挂 OCR 或转写模块即可理解文本、图像、音频和视频,支持对长视频的事件级理解和对话式交互。第四,X 平台实时数据集成——Grok 5 可以实时读取 X 平台超过 1 亿条最新帖子,在回答中融入最新动态,这一能力目前尚无竞品能完全复现。 在推理能力方面,Grok 5 据称支持自适应推理(不通过 UI 开关由用户手动控制,而是模型自主判断何时需要深度思考)、原生多智能体协作(类似 Grok 4.20 的 4 智能体架构但规模升级)、以及 Grok Build 编程智能体(面向 SuperGrok Heavy 用户的 CLI 工具,兼容 Claude Code 配置格式)。 不过需要指出的是,Grok 5 的公开基准测试成绩尚未发布。市面上流传的「Project Valis」候选模型在 Zeitgeist 推理测试中得分 45.1%(对比 Gemini 3 Pro 的 32.4%)的数据未经验证。当前可用的旗舰模型是 Grok 4.5,其 SWE-Bench Pro 得分 64.7%,xAI 自称达到「Opus 级别」但独立第三方验证尚未公布。 与竞品的对比来看,Grok 的核心差异化优势是 X 实时数据,这在新闻追踪、市场情报、OSINT 等领域构成结构性壁垒。但在编程能力方面,Grok 系列(Grok 4 系列 SWE-bench Verified 约 72%-75%)落后于 GPT-5.5(88.7%)和 Claude Opus 4.6(80.8%)。企业采纳率上,OpenAI 占 55%、Anthropic 47%、Google 39%,而 Grok 仅约 6%。
-
Grok 5 的正式定价尚未公布。从 xAI 当前定价体系可以推测其大致位置。消费者端,现有层级为:免费版(grok.com 速率限制)、X Premium 约 8 美元/月(捆绑 Grok)、SuperGrok Lite 10 美元/月、SuperGrok 30 美元/月(标准全功能)、SuperGrok Heavy 300 美元/月(Grok 5 优先访问和最高计算强度功能)。Grok 5 大概率会纳入 SuperGrok Heavy 层级,可能不会下放到低价位计划。 API 方面,当前 Grok 4.5 定价为输入 2 美元/百万 token、输出 6 美元/百万 token,上下文 50 万 token;平价版 Grok 4.3 为 1.25/2.50 美元,上下文 100 万 token。分析师估计 Grok 5 的 API 价格可能在输入 5-8 美元、输出 20-30 美元每百万 token 的水平,但最终价格尚未官宣。xAI 在开发者定价上一直采取激进策略,Grok 4.1 Fast 曾是市场上最便宜的前沿模型。
-
Grok 系列的真实用户评价呈现两极化。正面来看,实时信息能力被新闻工作者和市场分析师高度认可——「Grok 对巴黎奥运会奖牌榜的更新延迟仅 37 秒,远优于同时期 ChatGPT 的 12 分钟」。在 Omniscience 事实准确性测试中以 78% 的得分领先其他主流模型。200 万 token 上下文窗口(Grok 4.20)在同价位没有对手。2026 年 4.20 版本的幻觉率从 12.09% 降至约 4.2%,进步明显。 负面反馈集中在几个方面。创意写作能力明显落后于 Claude。高级编程辅助与 Claude Code 或 Cursor 存在显著差距。没有持久记忆功能(Persistent Memory),用户频繁抱怨这一点。企业合规性和数据安全顾虑阻碍了 Grok 在敏感行业中的采用。SuperGrok 月费 30 美元高于 ChatGPT Plus 和 Claude Pro 的 20 美元,如果不使用 X 的话性价比不高。此外,2026 年的深度伪造图像争议导致 Aurora 图像生成功能被地理封锁。
-
媒体和分析界对 Grok 5 的看法总体上是「架构储备最激进,交付节奏最不确定」。6 万亿参数的 MoE 架构和 Gigawatt 级训练集群,从基础设施角度看确实走在了最前沿。但连续三次错失发布窗口(从 2025 年底到 2026 年 Q1、Q2 再到预期 Q3),让业界对 xAI 的执行力产生了疑虑。一个值得注意的问题是跨多万亿参数 MoE 模型在吉瓦级集群上的互联瓶颈,以及使用 X 实时数据训练可能引入的 AI 生成内容污染问题。 行业格局方面,2026 年 6 月被认为是近年来最激烈的 AI 对决月——GPT-5.6、Claude Opus 4.8、Gemini 3.5 Pro 和 Grok 5 原本被认为将在同一窗口发布。但 Grok 5 的再次跳票意味着 xAI 在这一轮竞争中暂处守势。不过,36氪英文版的分析指出:「马斯克押注的是节奏。V9-Medium 不需要一夜封王,只需要证明 xAI 还在牌桌上,并且手里不止一张牌。」 Grok 4.5 作为过渡旗舰虽然参数规模只有 1.5 万亿,但定价仅为 GPT-5.6 Sol 的约 1/5(输入 2 美元 vs 5 美元,输出 6 美元 vs 30 美元),实用主义定位清晰。美国国防部已授予 Grok 分类网络访问权限用于有界情报应用,这在信任层面是一个重要信号。
-
Grok 5 面临多重争议。最核心的是马斯克反复声称「10% 概率实现 AGI」——这被批评者认为是营销话术,也招致了 AI 安全领域的担忧。SpaceX 对 xAI 的收购引发了权力集中担忧:一个人同时控制 X、SpaceX、xAI 乃至 DOGE,数据隐私和算法透明度方面缺乏监管制衡。Grok 的图像生成功能曾因深度伪造丑闻被地理封锁,声誉受损。此外,Grok 在 EU/EEA 地区由于监管原因不可用,限制了其欧洲市场拓展。 企业侧,6% 的企业采纳率反映了信任鸿沟——相比于 OpenAI 的 55% 和 Anthropic 的 47%,Grok 在企业级市场还有很长的路要走。
-
Grok 5(及当前可用 Grok 4.5)最适合以下人群:X 平台活跃用户,希望 AI 助手融入信息流;需要实时新闻监控、趋势追踪或市场情报的分析师和记者;需要分析超长文档(50 万-200 万 token)且预算有限的开发者;通过 API 构建需要 X 实时数据的应用的工程师。 不太适合:追求最佳创意写作体验的用户(Claude 明显更优);需要高级代码辅助的开发者(Claude Code 或 Cursor 现阶段更强);管理敏感企业数据且需要严格合规认证的机构。不使用 X 平台的用户,因为 Grok 核心价值很大程度上依赖于 X 数据生态。 替代方案:ChatGPT(GPT-5.6 系列,通用能力最强)、Claude(Opus 4.x,创意写作和编程最优)、Gemini(Google 生态整合最佳)。
-
Grok 5 代表了 xAI 对下一代 AI 的全面押注——6 万亿参数规模、原生多模态、X 实时数据和 Gigawatt 级训练基础设施的组合,在路线上确实独树一帜。但连续跳票和尚未经过第三方验证的性能声明让市场仍持观望态度。对于开发者而言,当前可用的 Grok 4.5 以极具竞争力的定价提供了 Opus 级别的能力,是性价比最高的 API 选择之一。Grok 5 的最终发布将在 2026 年 Q3 成为检验 xAI「架构储备」能否兑现的关键节点。
用户评论
-
JackFlores520—你们天天吹 Grok 5 多强,问题是它到现在影子都没有。Grok 4.5 倒是发了,但感觉也就那样,编程还是被 Claude Code 压着打。 -
JThompsonIII251—SuperGrok Heavy 一个月要 300 美元,抢钱啊?别家旗舰版才 20 刀。除非 Grok 5 真能 AGI,不然谁充谁冤大头。 -
mwnhgqeiew—刚试了 Grok 4.5 的 API,定价输入 2 刀输出 6 刀每百万 token,比 GPT-5.6 Sol 便宜太多了。实测写一个 FastAPI CRUD 确实快,2 秒就生成好了,但修 bug 拉了七八轮才过,每次小改完另一处又崩了。相比之下 Claude 虽然慢一点,但基本一次搞定。速度和质量之间怎么取舍,看场景吧。 -
JustinOrtiz—我是搞新闻监测的,Grok 的 X 实时数据流是不可替代的优势。别的模型搜索新闻要等网页索引更新,Grok 直接在 X 上看一手消息,延迟只有几十秒,这个是真香。 -
LiamBergmann—马斯克说 Grok 5 有 10% 的概率实现 AGI,这数字是怎么算出来的?拍脑袋定的吧。不过话说回来,Colossus 2 那个 1.5 吉瓦的集群确实吓人,全行业独一份。 -
SophiaBarnes520—Grok 4.5 上线了,定价良心,但名字真的乱。一会 V9-Medium 一会 Grok 4.5,媒体还天天叫着 Grok 5,搞那么复杂干嘛。 -
DanicaTadić—xAI 被 SpaceX 收购之后团队稳定性好很多了,以前每个月烧 10 亿刀,谁能撑得住。不过联创走了 10 个剩 2 个,这事也没人提。人才流失这么严重,Grok 5 能不能按时交付真不好说。 -
Philip_Robinson_X—我觉得大家低估了一件事:Grok 是唯一一个被五角大楼授予机密网络访问权限的消费级 AI 模型。DoD 都信得过,起码说明在特定场景下可靠性是验证过的。虽然创意和编程不如 Claude 和 GPT,但要是论实时情报分析,Grok 可能是最好的选择。 -
AMorris007—Grok Build 上线了,对标 Claude Code。试了一下写个小脚本还不错,但处理复杂项目重构的时候还是不如 Claude Code 稳,经常改完一段把另一段搞崩了。不过考虑到定价只是 Claude 的零头,用在小项目上还是划算的。 -
tinykoala238—xAI 那个 Cursor 训练数据的事很有意思,把真实开发者的编程过程喂给模型学,确实比只喂 GitHub 公开代码库要高明。马斯克投了 600 亿买 Cursor,这盘棋下得大。不过效果到底如何,等 Grok 5 真发布了才知道。 -
DianeFischer—Grok 的幻觉率从 12% 降到 4%,进步是肉眼可见的。但对比 Claude 那种几乎不胡说的风格,还是差一截。做严肃报告我不敢只用 Grok,至少要拿另一个模型交叉验证一下才放心。 -
PaolaHidalgo—等 Grok 5 等了大半年了,从去年说到现在,每次都说「几周后发」。现在又说 Q3,再跳票就 2027 了。OpenAI 和 Anthropic 都迭代好几轮了,xAI 再拖市场就没耐心了。