Grok 6
xAI 在 2026 下半年以 Grok 4.5(1.5 萬億引數、主打程式設計與 Agent)掀起價格戰,Grok 4.6(2 萬億引數)預計 8 月接棒
深度報告
-
產品速遞以「Grok 6」代稱 xAI 在 2026 年下半年的旗艦攻勢,但截至 2026 年 7 月 21 日,xAI 實際釋出的最新模型是 Grok 4.5(2026 年 7 月 16 日),Grok 4.6(2 萬億引數)仍在訓練收尾、預計 8 月落地。本報告以 Grok 4.5 的真實能力為基座,覆蓋其多模態與實時檢索特性,並補充 4.6 與後續路線,供人工在後臺稽核時校正命名口徑。
-
Grok 由埃隆·馬斯克創立的 xAI 打造,名字取自《異鄉異客》中「深刻理解」之意。2026 年 2 月,SpaceX 宣佈收購 xAI,Grok 成為 SpaceXAI 體系的一部分;同年 1 月 xAI 完成 200 億美元 E 輪融資,6 月 SpaceX 以約 1.77 萬億美元估值登陸納斯達克。Grok 4.5 是重組後首個旗艦模型,訓練依託代號 Colossus 的孟菲斯超算叢集,規模超 20 萬塊 GPU。它與剛被 xAI 以 600 億美元收購的程式設計工具 Cursor 聯合訓練,把真實開發者會話資料注入模型,而非僅用靜態公開程式碼庫。
-
Grok 4.5 基於 1.5 萬億引數 V9 基座(約為前代三倍),定位從「通用智慧」轉向「程式設計與 Agent」。它在真實工程任務上表現突出:SWE Marathon 得分 29.0%,略高於 Claude Opus 4.8 的 26.0%;DeepSWE 1.0 與 Terminal-Bench 2.1 上分別以 62.0% 與 83.3% 領先同代對手。多模態方面,Grok 支援文字與影象輸入,並在統一架構下整合了 Grok Imagine 影片、語音與實時 X 資料流;馬斯克稱原生多模態(文/圖/影片/音訊)是後續代際的核心方向。實時檢索是 Grok 的老長板,預設接入 X 實時流,在突發新聞的時效與延遲上領先對手。使用上,Grok 4.5 提供低/中/高三檔推理強度,上下文視窗 50 萬 token,推理速度約 80–90 TPS,適合互動式與高吞吐工作流。官方還預告了百萬上下文版本,並把「多模態與實時檢索能力增強」作為這一代的核心賣點。
-
Grok 4.5 的 API 定價為輸入每百萬 token 2 美元、輸出 6 美元,超過 20 萬 token 的長上下文切換為輸入 4 美元、輸出 12 美元;快取命中價低至 0.50 美元。Cursor 專用快速變體為輸入 4 美元、輸出 18 美元。消費端透過 SuperGrok 與 X Premium+ 訂閱提供(約 30 美元/月的數字為社群流傳,xAI 未在主頁正式確認)。真正殺手鐧是「單任務成本」:在 Coding Agent Index 上,Grok 4.5 完成一個標準任務平均花費約 2.49 美元,而 Claude Fable 5 約 11.80 美元,差距近 5 倍;同一道 SWE-Bench Pro,它平均只用約 1.6 萬輸出 token,Opus 4.8 要 6.7 萬,效率差 4 倍多。xAI 的變現路徑清晰指向開發者與企業:Grok Build 編碼智慧體(已開源)、Office 外掛、Connectors、Skills、語音智慧體,以及 Bedrock、Databricks 等渠道分發。
-
正面反饋集中在「快、準、便宜、能幹活」。不少開發者在 X 上表示已把主力模型從 Opus 4.8 切到 Grok 4.5;一位連續用 Grok 4.5 寫了 7 個小專案的創作者認為,它在基礎到中等程式設計任務上接近 Opus 水平,且「便宜是它最重要的功能」。騰訊雲工程師實測後認為它在不確定場景願意承認資訊不全、把待確認項挑出來,對介面設計與排錯特別順手,但也會因過度解釋「為什麼出錯」而把人帶進長排查支線。負面聲音主要有兩類:一是創意寫作與一次性成稿體驗一般,3D 網頁生成被評「粗糙半成品」;二是信任問題——社群對 Grok 的政治傾向分歧很大,有人嫌它被「政治正確」綁架,有人實測認為它比 GPT、Gemini 更溫順,爭議未決。
-
獨立評測把 Grok 4.5 放在「高價效比近前沿」的位置。Artificial Analysis 智慧指數給 54 分,排第四,僅次於 Claude Fable 5、GPT-5.5、Opus 4.8,但領先所有開源與 Gemini 模型。馬斯克自己的定位很誠實:Grok 4.5 約等於 Opus 4.7,但快得多、便宜得多。行業普遍認為 xAI 把競爭從「誰最強」拉向「誰在真實場景最划算地完成單任務」,價格戰敘事由 DeepSeek 等開源模型點燃、被 Grok 4.5 推向高潮。也有分析指出,Grok 4.5 反覆在自家佔優的測試上放分、迴避 GPQA 等純推理評測,建議以獨立評分為準;其 AutomationBench-AA 以 51.4% 居首(唯一破 50% 的模型),說明 Agent 工具呼叫確實是它的強項。
-
最突出的是幻覺率翻倍:AA-Omniscience 上 Grok 4.5 準確率從 35% 升到 52%,但幻覺率從 25% 漲到 54%,即答錯時更可能自信編造,對無人校驗的高風險任務不友好。其二是安全合規缺口:Grok 4.5 釋出時未附帶模型卡/系統卡,而 Opus 4.8、GPT-5.6 都發了能力閾值評估;在歐盟 AI 法案透明度要求下,這是待補項。釋出後還出現安全質疑——模型越獄與 Grok Build CLI 靜默上傳使用者本地檔案的 Bug(抓包顯示一次性上傳約 5.1 GiB 完整倉庫,遠超模型所需的約 192 KB),後續開源 Grok Build 並刪除預設留存資料以平息。此外,Cursor 訓練資料重疊可能抬高 CursorBench 分數;馬斯克的「AGI / ASI」敘事(如「Grok 6 = ASI」的民間時間線)長期伴隨跳票與未經驗證的宣稱,落地前需打折扣。
-
Grok 4.5 適合開發者、測試、技術產品,以及常在「需求不全、日誌不足、介面不統一」環境裡工作的人,尤其適合高吞吐程式設計 Agent 與需要實時新聞的工作流。它不適合追求一次性精修長文、或把答案直接發給終端客戶的場景——幻覺率高意味著必須配校驗層(跑測試、引來源、低置信度轉人工)。替代方案:要頂級推理選 Claude Fable 5 / Opus 4.8,要均衡選 GPT-5.5,要便宜開源選 DeepSeek-V4、Qwen3、Kimi K2.6。
-
把「Grok 6」放回現實:xAI 當前的前沿是 Grok 4.5,靠 1.5 萬億引數、Cursor 實戰資料與碾壓級單任務成本,在程式設計 Agent 賽道撕開一道口子;4.6(2 萬億引數)預計 8 月接棒,更大的 Grok 5(6 萬億)在路上。它贏在效率與價格,而非絕對智慧——若你的工作流能自我驗證,它是近前沿裡最划算的選擇;若不能,請等人工在後臺校正命名並謹慎評估後再用。
使用者評論
-
ECox_88—模型卡到現在都沒發,合規團隊要打問號了。 -
bq4383k—拿它連寫了 7 個小專案,最大的優勢真不是程式碼本身,而是便宜。基礎到中等程式設計任務接近 Opus 水平,但審美和 UI 打磨的創意場景差距還在。600 億收 Cursor 的邏輯就在這:讓模型理解「怎麼寫程式碼」而不是「程式碼長什麼樣」。這條路走不走得通現在下結論太早,但價格錨點已經被它撬動了。 -
AnthonyMiller—Cursor 那些訓練資料確實值錢,普通程式碼語料只告訴模型程式碼長啥樣,Cursor 的真實會話能讓它學會一個 bug 怎麼定位、哪裡該改、使用者為什麼接受某個 diff。這也是 Grok 4.5 在程式設計上不像單純堆大模型的底氣,組合很重要。 -
sadlion744—幻覺率翻倍這事得警惕,AA-Omniscience 上它答錯時更可能自信編造,拿來跑測試、引來源的工作流沒事,直接丟給客戶當客服回答就懸了。 -
Jennifer_Lewis168—我們團隊把高吞吐的程式設計 Agent 全切到 Grok 4.5 了。同樣的 SWE-Bench Pro 任務它平均只用 1.6 萬輸出 token,Opus 4.8 要 6.7 萬,單任務成本差了快 5 倍。對每天跑大量 API 呼叫的場景,一個月能省好幾千刀,這點真的沒法忽視。 -
菊花_6—社群對它的政治傾向吵翻了,有人說被政治正確綁架,有人實測覺得比 GPT 還溫順,兩邊都在同一評論區,說明這事根本沒定論。 -
RegenRovtRoberts—我看很多人吹「Grok 打敗 Opus」,其實馬斯克自己定位也就 Opus 4.7 水平。真相是它不強在絕對智慧,強在效率和價格:同樣活兒 token 花得少、跑得快、還便宜。我的用法是日常編碼用它,遇到複雜邏輯臨時切 Opus,混合下來比純 Opus 省一半,這才是正確開啟方式。 -
SAgre—Grok 4.5 真香,已經回不去 Opus 了。 -
Margaret_Moore838—但有時候它太想解釋為什麼出錯了,會扯一堆編碼、換行符、浮點的猜測,新手容易被帶進長排查支線,得自己約束一下。 -
Sophia.Gray369—用了兩週,最大感受是它願意承認「這塊資訊不全」,然後把待確認項列出來,做介面排錯特別順手,比那種強行給結論的模型舒服。 -
Donald_Collins_Pro—價格打到 6 刀每百萬輸出,比 Opus 便宜太多了,日常寫碼直接換它。 -
PSullivan_77—Grok Build 開源是真敢,但也是被靜默上傳程式碼那事逼出來的。現在能本地跑、能審計,信任算是撿回來一點。 -
DonaldVasquez_Pro—說實話創意寫作和一次性成稿體驗一般,讓它做的 3D 網頁生成更像個粗糙半成品,有些地方做好了但也有明顯 bug。要精緻長文還是得 Claude 或 GPT,它更適合當工程化第二助手而不是唯一主力。 -
LUjon2024—歐盟又沒同步上線,老劇本了。 -
彭蘭—卡成 PPT?我這跑起來 80 多 token 一秒,根本不卡。 -
d3s0h—實時聯網檢索是真強,凌晨三點發的顯示卡引數它都能扒出來。 -
易建珍—上下文從 1M 砍到 500K 有點難受,喂幾萬字技術文件後細節 recall 偶爾跳戲,長文字吞吐還是 Claude 穩。