xAI Grok 5

xAI 正在开发的约 6 万亿参数 MoE 架构旗舰大模型,原生多模态并深度整合 X 平台实时数据流

詳細レポート

  • xAI Grok 5 是埃隆·马斯克旗下 xAI 公司正在开发的下一代旗舰大语言模型,采用约 6 万亿参数的混合专家(MoE)架构,原生支持文本/图像/音频/视频多模态输入,并深度整合 X 平台实时数据流。截至 2026 年 7 月,Grok 5 仍在 Colossus 2 超算集群上训练中,尚未正式发布;xAI 于 7 月 9 日先行推出了基于 V9 基础模型的 Grok 4.5(1.5 万亿参数)作为过渡旗舰。Grok 5 被马斯克称为「有 10% 概率实现 AGI」,但实际发布时间已从 2025 年底多次推迟至预期 2026 年 Q3。

  • xAI 由埃隆·马斯克于 2023 年 7 月创立,核心使命是「理解宇宙的真实本质」,打造「最大程度追求真相」的 AI 系统。公司团队来自 OpenAI、Google DeepMind、Tesla 等机构。2026 年 2 月,SpaceX 以 1.25 万亿美元全股票交易收购 xAI,为后者提供了稳定的财务支持和 SpaceX 基础设施资源。xAI 在田纳西州孟菲斯运营着全球最大的 AI 训练设施 Colossus 超算集群,Colossus 2 于 2026 年 1 月突破 1 吉瓦功率门槛,部署约 55 万块 NVIDIA H100/GB200 GPU,总投资估计达 180 亿美元。Grok 系列始于 2023 年 11 月的 Grok-1,经历了 Grok-1.5、Grok-2、Grok-3 到 2025 年 7 月的 Grok 4 旗舰,再到 2026 年的 Grok 4.3(4 月 30 日,长上下文平价版)和 Grok 4.5(7 月 9 日,V9 基础临时旗舰),以及仍在训练的 Grok 5。

  • Grok 5 的架构设计有几个关键特征。第一,约 6 万亿参数的 MoE 架构,每次查询只激活最相关的子网络,在实现超大规模的同时控制推理成本。第二,1.5 百万 token 的超长上下文窗口,可一次性处理近乎完整的代码库或长时间视频时间线。第三,原生多模态能力,无需外挂 OCR 或转写模块即可理解文本、图像、音频和视频,支持对长视频的事件级理解和对话式交互。第四,X 平台实时数据集成——Grok 5 可以实时读取 X 平台超过 1 亿条最新帖子,在回答中融入最新动态,这一能力目前尚无竞品能完全复现。 在推理能力方面,Grok 5 据称支持自适应推理(不通过 UI 开关由用户手动控制,而是模型自主判断何时需要深度思考)、原生多智能体协作(类似 Grok 4.20 的 4 智能体架构但规模升级)、以及 Grok Build 编程智能体(面向 SuperGrok Heavy 用户的 CLI 工具,兼容 Claude Code 配置格式)。 不过需要指出的是,Grok 5 的公开基准测试成绩尚未发布。市面上流传的「Project Valis」候选模型在 Zeitgeist 推理测试中得分 45.1%(对比 Gemini 3 Pro 的 32.4%)的数据未经验证。当前可用的旗舰模型是 Grok 4.5,其 SWE-Bench Pro 得分 64.7%,xAI 自称达到「Opus 级别」但独立第三方验证尚未公布。 与竞品的对比来看,Grok 的核心差异化优势是 X 实时数据,这在新闻追踪、市场情报、OSINT 等领域构成结构性壁垒。但在编程能力方面,Grok 系列(Grok 4 系列 SWE-bench Verified 约 72%-75%)落后于 GPT-5.5(88.7%)和 Claude Opus 4.6(80.8%)。企业采纳率上,OpenAI 占 55%、Anthropic 47%、Google 39%,而 Grok 仅约 6%。

  • Grok 5 的正式定价尚未公布。从 xAI 当前定价体系可以推测其大致位置。消费者端,现有层级为:免费版(grok.com 速率限制)、X Premium 约 8 美元/月(捆绑 Grok)、SuperGrok Lite 10 美元/月、SuperGrok 30 美元/月(标准全功能)、SuperGrok Heavy 300 美元/月(Grok 5 优先访问和最高计算强度功能)。Grok 5 大概率会纳入 SuperGrok Heavy 层级,可能不会下放到低价位计划。 API 方面,当前 Grok 4.5 定价为输入 2 美元/百万 token、输出 6 美元/百万 token,上下文 50 万 token;平价版 Grok 4.3 为 1.25/2.50 美元,上下文 100 万 token。分析师估计 Grok 5 的 API 价格可能在输入 5-8 美元、输出 20-30 美元每百万 token 的水平,但最终价格尚未官宣。xAI 在开发者定价上一直采取激进策略,Grok 4.1 Fast 曾是市场上最便宜的前沿模型。

  • Grok 系列的真实用户评价呈现两极化。正面来看,实时信息能力被新闻工作者和市场分析师高度认可——「Grok 对巴黎奥运会奖牌榜的更新延迟仅 37 秒,远优于同时期 ChatGPT 的 12 分钟」。在 Omniscience 事实准确性测试中以 78% 的得分领先其他主流模型。200 万 token 上下文窗口(Grok 4.20)在同价位没有对手。2026 年 4.20 版本的幻觉率从 12.09% 降至约 4.2%,进步明显。 负面反馈集中在几个方面。创意写作能力明显落后于 Claude。高级编程辅助与 Claude Code 或 Cursor 存在显著差距。没有持久记忆功能(Persistent Memory),用户频繁抱怨这一点。企业合规性和数据安全顾虑阻碍了 Grok 在敏感行业中的采用。SuperGrok 月费 30 美元高于 ChatGPT Plus 和 Claude Pro 的 20 美元,如果不使用 X 的话性价比不高。此外,2026 年的深度伪造图像争议导致 Aurora 图像生成功能被地理封锁。

  • 媒体和分析界对 Grok 5 的看法总体上是「架构储备最激进,交付节奏最不确定」。6 万亿参数的 MoE 架构和 Gigawatt 级训练集群,从基础设施角度看确实走在了最前沿。但连续三次错失发布窗口(从 2025 年底到 2026 年 Q1、Q2 再到预期 Q3),让业界对 xAI 的执行力产生了疑虑。一个值得注意的问题是跨多万亿参数 MoE 模型在吉瓦级集群上的互联瓶颈,以及使用 X 实时数据训练可能引入的 AI 生成内容污染问题。 行业格局方面,2026 年 6 月被认为是近年来最激烈的 AI 对决月——GPT-5.6、Claude Opus 4.8、Gemini 3.5 Pro 和 Grok 5 原本被认为将在同一窗口发布。但 Grok 5 的再次跳票意味着 xAI 在这一轮竞争中暂处守势。不过,36氪英文版的分析指出:「马斯克押注的是节奏。V9-Medium 不需要一夜封王,只需要证明 xAI 还在牌桌上,并且手里不止一张牌。」 Grok 4.5 作为过渡旗舰虽然参数规模只有 1.5 万亿,但定价仅为 GPT-5.6 Sol 的约 1/5(输入 2 美元 vs 5 美元,输出 6 美元 vs 30 美元),实用主义定位清晰。美国国防部已授予 Grok 分类网络访问权限用于有界情报应用,这在信任层面是一个重要信号。

  • Grok 5 面临多重争议。最核心的是马斯克反复声称「10% 概率实现 AGI」——这被批评者认为是营销话术,也招致了 AI 安全领域的担忧。SpaceX 对 xAI 的收购引发了权力集中担忧:一个人同时控制 X、SpaceX、xAI 乃至 DOGE,数据隐私和算法透明度方面缺乏监管制衡。Grok 的图像生成功能曾因深度伪造丑闻被地理封锁,声誉受损。此外,Grok 在 EU/EEA 地区由于监管原因不可用,限制了其欧洲市场拓展。 企业侧,6% 的企业采纳率反映了信任鸿沟——相比于 OpenAI 的 55% 和 Anthropic 的 47%,Grok 在企业级市场还有很长的路要走。

  • Grok 5(及当前可用 Grok 4.5)最适合以下人群:X 平台活跃用户,希望 AI 助手融入信息流;需要实时新闻监控、趋势追踪或市场情报的分析师和记者;需要分析超长文档(50 万-200 万 token)且预算有限的开发者;通过 API 构建需要 X 实时数据的应用的工程师。 不太适合:追求最佳创意写作体验的用户(Claude 明显更优);需要高级代码辅助的开发者(Claude Code 或 Cursor 现阶段更强);管理敏感企业数据且需要严格合规认证的机构。不使用 X 平台的用户,因为 Grok 核心价值很大程度上依赖于 X 数据生态。 替代方案:ChatGPT(GPT-5.6 系列,通用能力最强)、Claude(Opus 4.x,创意写作和编程最优)、Gemini(Google 生态整合最佳)。

  • Grok 5 代表了 xAI 对下一代 AI 的全面押注——6 万亿参数规模、原生多模态、X 实时数据和 Gigawatt 级训练基础设施的组合,在路线上确实独树一帜。但连续跳票和尚未经过第三方验证的性能声明让市场仍持观望态度。对于开发者而言,当前可用的 Grok 4.5 以极具竞争力的定价提供了 Opus 级别的能力,是性价比最高的 API 选择之一。Grok 5 的最终发布将在 2026 年 Q3 成为检验 xAI「架构储备」能否兑现的关键节点。

ユーザーレビュー

  • 头像
    CAlar
    看到Prediction market说Grok 5 Q2前发布的概率只有7%,看来又得等到Q3了。xAI一直在发布周边产品维持热度,但大头还是Grok 5,希望这次别再跳了,等的耐心都要被磨没了。

  • 头像
    MsHannesSterkenburg_2024
    Grok 5又在跳票,从Q1推到Q2又推到Q3,看来6万亿参数训练确实不容易。但愿别变成一个昂贵的工程烟火,最后雷声大雨点小什么都没做出来,这种体量的模型光推理成本就够普通用户喝一壶的了。

  • 头像
    uvavhqxmt
    我用Grok 4.2跑了几个开源项目的代码审查,多文件重构确实比4.1进步明显。虽然准确率上跟Claude Opus还有点差距,但胜在响应速度快,日常开发我反而更愿意用Grok而不是等Claude慢慢出结果。不过SuperGrok Heavy $300一个月确实离谱,除非公司报销否则个人用不起。

  • 头像
    RSanders520
    HN讨论说Grok 5架构最激进,实时X数据整合这个优势其他对手确实没法复制,这是Grok最核心的差异化竞争力。但品牌争议和监管风险也让商用有很多顾虑,企业采购没那么简单,尤其是对合规要求严的行业得小心。

  • 头像
    Joan820
    Grok 5要打T1战队,我觉得这不只是营销噱头,而是在实战中测试多模态视觉能力。能用摄像头看懂复杂的游戏画面并实时做出决策,基本就能迁移到现实世界的自动驾驶和机器人操作场景,这才是xAI的真实意图所在。

  • 头像
    Daniel.Bennett_202221
    Grok 5又在打LOL了,52胜4负95%胜率太离谱了。虽然限制在人类操作水平,但这个持续决策能力和学习速度确实恐怖,说明Grok 5的视觉理解和实时推理能力已经是另一个层次了,不只是做做样子装门面而已。

  • 头像
    7ksh0mewj
    Grok 5的6T参数MoE架构、1.5M token上下文加原生多模态,规格华丽。但很多review说GA还在跳票,等得有点久了。

  • 头像
    DDiaz_77
    Reddit有人说Grok 4.2的Voice Mode跟ChatGPT Advanced Voice差不多,这评价挺高的,毕竟OpenAI语音已经很强了。

  • 头像
    SaraPedersen
    Grok在实时信息整合方面独一无二,做新闻追踪和舆情分析比其他AI强太多。X firehose独家优势确实明显,这是Claude和ChatGPT不具备的能力。

  • 头像
    Adam.PowellSr
    Grok 4.6官宣2万亿参数,这军备竞赛真是疯了。Kimi K3刚开源,Grok就跟上来了,月底还不知道要出什么新模型。感觉现在这个赛道比的不是谁更好用,而是谁先把参数堆上去吸引眼球,有点本末倒置了。

  • 头像
    CRrey
    评测说Grok客户支持差,账号恢复和账单处理慢。这对企业用户来说挺致命的,商用最看重售后响应速度。

  • 头像
    JBrownQ
    Donny AI说Grok 4.5编码领先,试了写Python脚本确实比之前顺手。但复杂逻辑还得靠Claude,Grok还不够深。

  • 头像
    Billy_Mitchell_66
    36kr讲得清楚,Grok 5护城河不是6万亿参数,是X平台实时数据。每天6800万条推文,OpenAI拿不到这种实时社交信号。

  • 头像
    RonaldJensen
    Grok 4.5编码进步不是吹的,昨天让它帮我重构Express后端,从回调改成async/await,居然把路由分层和错误处理都考虑进去了,比我预期好很多。但到了数据库查询优化这种需要理解业务逻辑的任务,还是会给出不太合理的建议。整体性价比确实能打,个人开发者值得试。

  • 头像
    Edward.ThomasZ2
    Product Hunt上Grok 5关注度高但争议大。免费版够用但限流,$300重度版太贵,中间层定位有点尴尬。

  • 头像
    EmiliaGarcia
    深度用了两周Grok 4.5,真实感受:写脚本和简单CRUD效率翻倍,但需要理解整个项目架构的任务就力不从心了。它擅长小修小补和快速迭代,这点比Claude强。我的工作流是:先Grok快速prototype,再用Claude做精调和架构审查。搭配下来效率最高,成本也控制得住。

  • 头像
    月光_19
    SuperGrok $30不算贵,但Heavy $300就离谱了。除了beta优先权看不出值这个价,除非Grok 5真能做出来。

  • 头像
    MOper
    if18说Grok 5有6万亿参数,10%的AGI概率。但推理成本多高是个大问题,个人用户根本用不起这么大的模型。

  • 头像
    TigerTrale74
    Reddit上r/grok社区觉得Grok 4.2编程提升实打实,多步重构和代码审查有改进。跟Claude比还是有差距的。

  • 头像
    Dorothy_MoralesIII
    Grok 4.5升级编程明显变强,用Cursor数据训练这招绝了,比之前用的编程辅助都好用,速度也快。

  • 头像
    EvelynNie_lsen
    极简刘少那篇说Grok 4.5虽然没拿第一,但编程性价比最好。API价格比Claude Opus便宜十几倍,速度还快,个人开发够用了。

  • 头像
    5wxfm
    Grok 4.5性价比没得说,2/6定价太能打了。side project用完全够,大项目才上Claude,这样搭配最省钱。

  • 头像
    xPredislavKostirko_dev
    Grok Build原生支持Claude Code配置格式,这波很务实。降低迁移成本才是聪明做法,不搞生态封闭那一套。

  • 头像
    范怡勇
    11位联合创始人都离职了,xAI内部什么情况?虽然马斯克说重构了,但核心团队动荡确实让人担心发展方向。

  • 头像
    RalphWilliams_88
    5分钟AI速览说Grok Build被曝上传代码库,CLI工具连密钥都能泄露谁还敢用,安全问题必须重视。

  • 头像
    JessicaThompson_Max
    DoD给Grok授权接机密网络,这算第三方认可了。不是什么AI都能拿到国防级的信任背书,这点确实厉害。

  • 头像
    Brenda_FosterZ
    用了Grok Build,先做5件事保护代码安全。第一件事就是把API key轮换了,之前一直裸奔,现在想想都后怕。

  • 头像
    Samuel_Morales_99
    Grok Build上线对标Claude Code,npm报错秒级修复好用。简单重构还行,大型项目就力不从心了。

  • 头像
    BCollins
    把Grok 4.5和Claude Opus 4.7做了对比测试,30个编程题。Grok平均2.3秒但需反复改,Claude一次到位但等了14秒。Grok token消耗是Claude的5-6倍,小项目用Grok更香,关键任务还是选Claude省心,各有适用场景。

  • 头像
    Anthony_BarnesII6
    Grok 4.2多模态落后Gemini和GPT-5.5,Grok 5能不能补上短板还不知道。等了这么久,希望别让大家失望。