Grok 6
xAI 在 2026 下半年以 Grok 4.5(1.5 万亿参数、主打编程与 Agent)掀起价格战,Grok 4.6(2 万亿参数)预计 8 月接棒
深度报告
-
产品速递以「Grok 6」代称 xAI 在 2026 年下半年的旗舰攻势,但截至 2026 年 7 月 21 日,xAI 实际发布的最新模型是 Grok 4.5(2026 年 7 月 16 日),Grok 4.6(2 万亿参数)仍在训练收尾、预计 8 月落地。本报告以 Grok 4.5 的真实能力为基座,覆盖其多模态与实时检索特性,并补充 4.6 与后续路线,供人工在后台审核时校正命名口径。
-
Grok 由埃隆·马斯克创立的 xAI 打造,名字取自《异乡异客》中「深刻理解」之意。2026 年 2 月,SpaceX 宣布收购 xAI,Grok 成为 SpaceXAI 体系的一部分;同年 1 月 xAI 完成 200 亿美元 E 轮融资,6 月 SpaceX 以约 1.77 万亿美元估值登陆纳斯达克。Grok 4.5 是重组后首个旗舰模型,训练依托代号 Colossus 的孟菲斯超算集群,规模超 20 万块 GPU。它与刚被 xAI 以 600 亿美元收购的编程工具 Cursor 联合训练,把真实开发者会话数据注入模型,而非仅用静态公开代码库。
-
Grok 4.5 基于 1.5 万亿参数 V9 基座(约为前代三倍),定位从「通用智能」转向「编程与 Agent」。它在真实工程任务上表现突出:SWE Marathon 得分 29.0%,略高于 Claude Opus 4.8 的 26.0%;DeepSWE 1.0 与 Terminal-Bench 2.1 上分别以 62.0% 与 83.3% 领先同代对手。多模态方面,Grok 支持文本与图像输入,并在统一架构下整合了 Grok Imagine 视频、语音与实时 X 数据流;马斯克称原生多模态(文/图/视频/音频)是后续代际的核心方向。实时检索是 Grok 的老长板,默认接入 X 实时流,在突发新闻的时效与延迟上领先对手。使用上,Grok 4.5 提供低/中/高三档推理强度,上下文窗口 50 万 token,推理速度约 80–90 TPS,适合交互式与高吞吐工作流。官方还预告了百万上下文版本,并把「多模态与实时检索能力增强」作为这一代的核心卖点。
-
Grok 4.5 的 API 定价为输入每百万 token 2 美元、输出 6 美元,超过 20 万 token 的长上下文切换为输入 4 美元、输出 12 美元;缓存命中价低至 0.50 美元。Cursor 专用快速变体为输入 4 美元、输出 18 美元。消费端通过 SuperGrok 与 X Premium+ 订阅提供(约 30 美元/月的数字为社区流传,xAI 未在主页正式确认)。真正杀手锏是「单任务成本」:在 Coding Agent Index 上,Grok 4.5 完成一个标准任务平均花费约 2.49 美元,而 Claude Fable 5 约 11.80 美元,差距近 5 倍;同一道 SWE-Bench Pro,它平均只用约 1.6 万输出 token,Opus 4.8 要 6.7 万,效率差 4 倍多。xAI 的变现路径清晰指向开发者与企业:Grok Build 编码智能体(已开源)、Office 插件、Connectors、Skills、语音智能体,以及 Bedrock、Databricks 等渠道分发。
-
正面反馈集中在「快、准、便宜、能干活」。不少开发者在 X 上表示已把主力模型从 Opus 4.8 切到 Grok 4.5;一位连续用 Grok 4.5 写了 7 个小项目的创作者认为,它在基础到中等编程任务上接近 Opus 水平,且「便宜是它最重要的功能」。腾讯云工程师实测后认为它在不确定场景愿意承认信息不全、把待确认项挑出来,对接口设计与排错特别顺手,但也会因过度解释「为什么出错」而把人带进长排查支线。负面声音主要有两类:一是创意写作与一次性成稿体验一般,3D 网页生成被评「粗糙半成品」;二是信任问题——社区对 Grok 的政治倾向分歧很大,有人嫌它被「政治正确」绑架,有人实测认为它比 GPT、Gemini 更温顺,争议未决。
-
独立评测把 Grok 4.5 放在「高性价比近前沿」的位置。Artificial Analysis 智能指数给 54 分,排第四,仅次于 Claude Fable 5、GPT-5.5、Opus 4.8,但领先所有开源与 Gemini 模型。马斯克自己的定位很诚实:Grok 4.5 约等于 Opus 4.7,但快得多、便宜得多。行业普遍认为 xAI 把竞争从「谁最强」拉向「谁在真实场景最划算地完成单任务」,价格战叙事由 DeepSeek 等开源模型点燃、被 Grok 4.5 推向高潮。也有分析指出,Grok 4.5 反复在自家占优的测试上放分、回避 GPQA 等纯推理评测,建议以独立评分为准;其 AutomationBench-AA 以 51.4% 居首(唯一破 50% 的模型),说明 Agent 工具调用确实是它的强项。
-
最突出的是幻觉率翻倍:AA-Omniscience 上 Grok 4.5 准确率从 35% 升到 52%,但幻觉率从 25% 涨到 54%,即答错时更可能自信编造,对无人校验的高风险任务不友好。其二是安全合规缺口:Grok 4.5 发布时未附带模型卡/系统卡,而 Opus 4.8、GPT-5.6 都发了能力阈值评估;在欧盟 AI 法案透明度要求下,这是待补项。发布后还出现安全质疑——模型越狱与 Grok Build CLI 静默上传用户本地文件的 Bug(抓包显示一次性上传约 5.1 GiB 完整仓库,远超模型所需的约 192 KB),后续开源 Grok Build 并删除默认留存数据以平息。此外,Cursor 训练数据重叠可能抬高 CursorBench 分数;马斯克的「AGI / ASI」叙事(如「Grok 6 = ASI」的民间时间线)长期伴随跳票与未经验证的宣称,落地前需打折扣。
-
Grok 4.5 适合开发者、测试、技术产品,以及常在「需求不全、日志不足、接口不统一」环境里工作的人,尤其适合高吞吐编程 Agent 与需要实时新闻的工作流。它不适合追求一次性精修长文、或把答案直接发给终端客户的场景——幻觉率高意味着必须配校验层(跑测试、引来源、低置信度转人工)。替代方案:要顶级推理选 Claude Fable 5 / Opus 4.8,要均衡选 GPT-5.5,要便宜开源选 DeepSeek-V4、Qwen3、Kimi K2.6。
-
把「Grok 6」放回现实:xAI 当前的前沿是 Grok 4.5,靠 1.5 万亿参数、Cursor 实战数据与碾压级单任务成本,在编程 Agent 赛道撕开一道口子;4.6(2 万亿参数)预计 8 月接棒,更大的 Grok 5(6 万亿)在路上。它赢在效率与价格,而非绝对智能——若你的工作流能自我验证,它是近前沿里最划算的选择;若不能,请等人工在后台校正命名并谨慎评估后再用。
用户评论
-
ECox_88—模型卡到现在都没发,合规团队要打问号了。 -
bq4383k—拿它连写了 7 个小项目,最大的优势真不是代码本身,而是便宜。基础到中等编程任务接近 Opus 水平,但审美和 UI 打磨的创意场景差距还在。600 亿收 Cursor 的逻辑就在这:让模型理解「怎么写代码」而不是「代码长什么样」。这条路走不走得通现在下结论太早,但价格锚点已经被它撬动了。 -
AnthonyMiller—Cursor 那些训练数据确实值钱,普通代码语料只告诉模型代码长啥样,Cursor 的真实会话能让它学会一个 bug 怎么定位、哪里该改、用户为什么接受某个 diff。这也是 Grok 4.5 在编程上不像单纯堆大模型的底气,组合很重要。 -
sadlion744—幻觉率翻倍这事得警惕,AA-Omniscience 上它答错时更可能自信编造,拿来跑测试、引来源的工作流没事,直接丢给客户当客服回答就悬了。 -
Jennifer_Lewis168—我们团队把高吞吐的编程 Agent 全切到 Grok 4.5 了。同样的 SWE-Bench Pro 任务它平均只用 1.6 万输出 token,Opus 4.8 要 6.7 万,单任务成本差了快 5 倍。对每天跑大量 API 调用的场景,一个月能省好几千刀,这点真的没法忽视。 -
菊花_6—社区对它的政治倾向吵翻了,有人说被政治正确绑架,有人实测觉得比 GPT 还温顺,两边都在同一评论区,说明这事根本没定论。 -
RegenRovtRoberts—我看很多人吹「Grok 打败 Opus」,其实马斯克自己定位也就 Opus 4.7 水平。真相是它不强在绝对智能,强在效率和价格:同样活儿 token 花得少、跑得快、还便宜。我的用法是日常编码用它,遇到复杂逻辑临时切 Opus,混合下来比纯 Opus 省一半,这才是正确打开方式。 -
SAgre—Grok 4.5 真香,已经回不去 Opus 了。 -
Margaret_Moore838—但有时候它太想解释为什么出错了,会扯一堆编码、换行符、浮点的猜测,新手容易被带进长排查支线,得自己约束一下。 -
Sophia.Gray369—用了两周,最大感受是它愿意承认「这块信息不全」,然后把待确认项列出来,做接口排错特别顺手,比那种强行给结论的模型舒服。 -
Donald_Collins_Pro—价格打到 6 刀每百万输出,比 Opus 便宜太多了,日常写码直接换它。 -
PSullivan_77—Grok Build 开源是真敢,但也是被静默上传代码那事逼出来的。现在能本地跑、能审计,信任算是捡回来一点。 -
DonaldVasquez_Pro—说实话创意写作和一次性成稿体验一般,让它做的 3D 网页生成更像个粗糙半成品,有些地方做好了但也有明显 bug。要精致长文还是得 Claude 或 GPT,它更适合当工程化第二助手而不是唯一主力。 -
LUjon2024—欧盟又没同步上线,老剧本了。 -
彭兰—卡成 PPT?我这跑起来 80 多 token 一秒,根本不卡。 -
d3s0h—实时联网检索是真强,凌晨三点发的显卡参数它都能扒出来。 -
易建珍—上下文从 1M 砍到 500K 有点难受,喂几万字技术文档后细节 recall 偶尔跳戏,长文本吞吐还是 Claude 稳。