深度報告
-
xAI Grok 5 是埃隆·馬斯克旗下 xAI 公司正在開發的下一代旗艦大語言模型,採用約 6 萬億引數的混合專家(MoE)架構,原生支援文字/影象/音訊/影片多模態輸入,並深度整合 X 平臺實時資料流。截至 2026 年 7 月,Grok 5 仍在 Colossus 2 超算叢集上訓練中,尚未正式釋出;xAI 於 7 月 9 日先行推出了基於 V9 基礎模型的 Grok 4.5(1.5 萬億引數)作為過渡旗艦。Grok 5 被馬斯克稱為「有 10% 機率實現 AGI」,但實際釋出時間已從 2025 年底多次推遲至預期 2026 年 Q3。
-
xAI 由埃隆·馬斯克於 2023 年 7 月創立,核心使命是「理解宇宙的真實本質」,打造「最大程度追求真相」的 AI 系統。公司團隊來自 OpenAI、Google DeepMind、Tesla 等機構。2026 年 2 月,SpaceX 以 1.25 萬億美元全股票交易收購 xAI,為後者提供了穩定的財務支援和 SpaceX 基礎設施資源。xAI 在田納西州孟菲斯運營著全球最大的 AI 訓練設施 Colossus 超算叢集,Colossus 2 於 2026 年 1 月突破 1 吉瓦功率門檻,部署約 55 萬塊 NVIDIA H100/GB200 GPU,總投資估計達 180 億美元。Grok 系列始於 2023 年 11 月的 Grok-1,經歷了 Grok-1.5、Grok-2、Grok-3 到 2025 年 7 月的 Grok 4 旗艦,再到 2026 年的 Grok 4.3(4 月 30 日,長上下文平價版)和 Grok 4.5(7 月 9 日,V9 基礎臨時旗艦),以及仍在訓練的 Grok 5。
-
Grok 5 的架構設計有幾個關鍵特徵。第一,約 6 萬億引數的 MoE 架構,每次查詢只啟用最相關的子網路,在實現超大規模的同時控制推理成本。第二,1.5 百萬 token 的超長上下文視窗,可一次性處理近乎完整的程式碼庫或長時間影片時間線。第三,原生多模態能力,無需外掛 OCR 或轉寫模組即可理解文字、影象、音訊和影片,支援對長影片的事件級理解和對話式互動。第四,X 平臺實時資料整合——Grok 5 可以實時讀取 X 平臺超過 1 億條最新帖子,在回答中融入最新動態,這一能力目前尚無競品能完全復現。 在推理能力方面,Grok 5 據稱支援自適應推理(不透過 UI 開關由使用者手動控制,而是模型自主判斷何時需要深度思考)、原生多智慧體協作(類似 Grok 4.20 的 4 智慧體架構但規模升級)、以及 Grok Build 程式設計智慧體(面向 SuperGrok Heavy 使用者的 CLI 工具,相容 Claude Code 配置格式)。 不過需要指出的是,Grok 5 的公開基準測試成績尚未釋出。市面上流傳的「Project Valis」候選模型在 Zeitgeist 推理測試中得分 45.1%(對比 Gemini 3 Pro 的 32.4%)的資料未經驗證。當前可用的旗艦模型是 Grok 4.5,其 SWE-Bench Pro 得分 64.7%,xAI 自稱達到「Opus 級別」但獨立第三方驗證尚未公佈。 與競品的對比來看,Grok 的核心差異化優勢是 X 實時資料,這在新聞追蹤、市場情報、OSINT 等領域構成結構性壁壘。但在程式設計能力方面,Grok 系列(Grok 4 系列 SWE-bench Verified 約 72%-75%)落後於 GPT-5.5(88.7%)和 Claude Opus 4.6(80.8%)。企業採納率上,OpenAI 佔 55%、Anthropic 47%、Google 39%,而 Grok 僅約 6%。
-
Grok 5 的正式定價尚未公佈。從 xAI 當前定價體系可以推測其大致位置。消費者端,現有層級為:免費版(grok.com 速率限制)、X Premium 約 8 美元/月(捆綁 Grok)、SuperGrok Lite 10 美元/月、SuperGrok 30 美元/月(標準全功能)、SuperGrok Heavy 300 美元/月(Grok 5 優先訪問和最高計算強度功能)。Grok 5 大機率會納入 SuperGrok Heavy 層級,可能不會下放到低價位計劃。 API 方面,當前 Grok 4.5 定價為輸入 2 美元/百萬 token、輸出 6 美元/百萬 token,上下文 50 萬 token;平價版 Grok 4.3 為 1.25/2.50 美元,上下文 100 萬 token。分析師估計 Grok 5 的 API 價格可能在輸入 5-8 美元、輸出 20-30 美元每百萬 token 的水平,但最終價格尚未官宣。xAI 在開發者定價上一直採取激進策略,Grok 4.1 Fast 曾是市場上最便宜的前沿模型。
-
Grok 系列的真實使用者評價呈現兩極化。正面來看,實時資訊能力被新聞工作者和市場分析師高度認可——「Grok 對巴黎奧運會獎牌榜的更新延遲僅 37 秒,遠優於同時期 ChatGPT 的 12 分鐘」。在 Omniscience 事實準確性測試中以 78% 的得分領先其他主流模型。200 萬 token 上下文視窗(Grok 4.20)在同價位沒有對手。2026 年 4.20 版本的幻覺率從 12.09% 降至約 4.2%,進步明顯。 負面反饋集中在幾個方面。創意寫作能力明顯落後於 Claude。高階程式設計輔助與 Claude Code 或 Cursor 存在顯著差距。沒有持久記憶功能(Persistent Memory),使用者頻繁抱怨這一點。企業合規性和資料安全顧慮阻礙了 Grok 在敏感行業中的採用。SuperGrok 月費 30 美元高於 ChatGPT Plus 和 Claude Pro 的 20 美元,如果不使用 X 的話價效比不高。此外,2026 年的深度偽造影象爭議導致 Aurora 影象生成功能被地理封鎖。
-
媒體和分析界對 Grok 5 的看法總體上是「架構儲備最激進,交付節奏最不確定」。6 萬億引數的 MoE 架構和 Gigawatt 級訓練叢集,從基礎設施角度看確實走在了最前沿。但連續三次錯失釋出視窗(從 2025 年底到 2026 年 Q1、Q2 再到預期 Q3),讓業界對 xAI 的執行力產生了疑慮。一個值得注意的問題是跨多萬億引數 MoE 模型在吉瓦級叢集上的互聯瓶頸,以及使用 X 實時資料訓練可能引入的 AI 生成內容汙染問題。 行業格局方面,2026 年 6 月被認為是近年來最激烈的 AI 對決月——GPT-5.6、Claude Opus 4.8、Gemini 3.5 Pro 和 Grok 5 原本被認為將在同一視窗釋出。但 Grok 5 的再次跳票意味著 xAI 在這一輪競爭中暫處守勢。不過,36氪英文版的分析指出:「馬斯克押注的是節奏。V9-Medium 不需要一夜封王,只需要證明 xAI 還在牌桌上,並且手裡不止一張牌。」 Grok 4.5 作為過渡旗艦雖然引數規模只有 1.5 萬億,但定價僅為 GPT-5.6 Sol 的約 1/5(輸入 2 美元 vs 5 美元,輸出 6 美元 vs 30 美元),實用主義定位清晰。美國國防部已授予 Grok 分類網路訪問許可權用於有界情報應用,這在信任層面是一個重要訊號。
-
Grok 5 面臨多重爭議。最核心的是馬斯克反覆聲稱「10% 機率實現 AGI」——這被批評者認為是營銷話術,也招致了 AI 安全領域的擔憂。SpaceX 對 xAI 的收購引發了權力集中擔憂:一個人同時控制 X、SpaceX、xAI 乃至 DOGE,資料隱私和演算法透明度方面缺乏監管制衡。Grok 的影象生成功能曾因深度偽造醜聞被地理封鎖,聲譽受損。此外,Grok 在 EU/EEA 地區由於監管原因不可用,限制了其歐洲市場拓展。 企業側,6% 的企業採納率反映了信任鴻溝——相比於 OpenAI 的 55% 和 Anthropic 的 47%,Grok 在企業級市場還有很長的路要走。
-
Grok 5(及當前可用 Grok 4.5)最適合以下人群:X 平臺活躍使用者,希望 AI 助手融入資訊流;需要實時新聞監控、趨勢追蹤或市場情報的分析師和記者;需要分析超長文件(50 萬-200 萬 token)且預算有限的開發者;透過 API 構建需要 X 實時資料的應用的工程師。 不太適合:追求最佳創意寫作體驗的使用者(Claude 明顯更優);需要高階程式碼輔助的開發者(Claude Code 或 Cursor 現階段更強);管理敏感企業資料且需要嚴格合規認證的機構。不使用 X 平臺的使用者,因為 Grok 核心價值很大程度上依賴於 X 資料生態。 替代方案:ChatGPT(GPT-5.6 系列,通用能力最強)、Claude(Opus 4.x,創意寫作和程式設計最優)、Gemini(Google 生態整合最佳)。
-
Grok 5 代表了 xAI 對下一代 AI 的全面押注——6 萬億引數規模、原生多模態、X 實時資料和 Gigawatt 級訓練基礎設施的組合,在路線上確實獨樹一幟。但連續跳票和尚未經過第三方驗證的效能宣告讓市場仍持觀望態度。對於開發者而言,當前可用的 Grok 4.5 以極具競爭力的定價提供了 Opus 級別的能力,是價效比最高的 API 選擇之一。Grok 5 的最終釋出將在 2026 年 Q3 成為檢驗 xAI「架構儲備」能否兌現的關鍵節點。
使用者評論
-
CAlar—看到Prediction market說Grok 5 Q2前釋出的機率只有7%,看來又得等到Q3了。xAI一直在釋出周邊產品維持熱度,但大頭還是Grok 5,希望這次別再跳了,等的耐心都要被磨沒了。 -
MsHannesSterkenburg_2024—Grok 5又在跳票,從Q1推到Q2又推到Q3,看來6萬億引數訓練確實不容易。但願別變成一個昂貴的工程煙火,最後雷聲大雨點小什麼都沒做出來,這種體量的模型光推理成本就夠普通使用者喝一壺的了。 -
uvavhqxmt—我用Grok 4.2跑了幾個開源專案的程式碼審查,多檔案重構確實比4.1進步明顯。雖然準確率上跟Claude Opus還有點差距,但勝在響應速度快,日常開發我反而更願意用Grok而不是等Claude慢慢出結果。不過SuperGrok Heavy $300一個月確實離譜,除非公司報銷否則個人用不起。 -
RSanders520—HN討論說Grok 5架構最激進,實時X資料整合這個優勢其他對手確實沒法複製,這是Grok最核心的差異化競爭力。但品牌爭議和監管風險也讓商用有很多顧慮,企業採購沒那麼簡單,尤其是對合規要求嚴的行業得小心。 -
Joan820—Grok 5要打T1戰隊,我覺得這不只是營銷噱頭,而是在實戰中測試多模態視覺能力。能用攝像頭看懂複雜的遊戲畫面並實時做出決策,基本就能遷移到現實世界的自動駕駛和機器人操作場景,這才是xAI的真實意圖所在。 -
Daniel.Bennett_202221—Grok 5又在打LOL了,52勝4負95%勝率太離譜了。雖然限制在人類操作水平,但這個持續決策能力和學習速度確實恐怖,說明Grok 5的視覺理解和實時推理能力已經是另一個層次了,不只是做做樣子裝門面而已。 -
7ksh0mewj—Grok 5的6T引數MoE架構、1.5M token上下文加原生多模態,規格華麗。但很多review說GA還在跳票,等得有點久了。 -
DDiaz_77—Reddit有人說Grok 4.2的Voice Mode跟ChatGPT Advanced Voice差不多,這評價挺高的,畢竟OpenAI語音已經很強了。 -
SaraPedersen—Grok在實時資訊整合方面獨一無二,做新聞追蹤和輿情分析比其他AI強太多。X firehose獨家優勢確實明顯,這是Claude和ChatGPT不具備的能力。 -
Adam.PowellSr—Grok 4.6官宣2萬億引數,這軍備競賽真是瘋了。Kimi K3剛開源,Grok就跟上來了,月底還不知道要出什麼新模型。感覺現在這個賽道比的不是誰更好用,而是誰先把引數堆上去吸引眼球,有點本末倒置了。 -
CRrey—評測說Grok客戶支援差,賬號恢復和賬單處理慢。這對企業使用者來說挺致命的,商用最看重售後響應速度。 -
JBrownQ—Donny AI說Grok 4.5編碼領先,試了寫Python指令碼確實比之前順手。但複雜邏輯還得靠Claude,Grok還不夠深。 -
Billy_Mitchell_66—36kr講得清楚,Grok 5護城河不是6萬億引數,是X平臺實時資料。每天6800萬條推文,OpenAI拿不到這種實時社交訊號。 -
RonaldJensen—Grok 4.5編碼進步不是吹的,昨天讓它幫我重構Express後端,從回撥改成async/await,居然把路由分層和錯誤處理都考慮進去了,比我預期好很多。但到了資料庫查詢最佳化這種需要理解業務邏輯的任務,還是會給出不太合理的建議。整體價效比確實能打,個人開發者值得試。 -
Edward.ThomasZ2—Product Hunt上Grok 5關注度高但爭議大。免費版夠用但限流,$300重度版太貴,中間層定位有點尷尬。 -
EmiliaGarcia—深度用了兩週Grok 4.5,真實感受:寫指令碼和簡單CRUD效率翻倍,但需要理解整個專案架構的任務就力不從心了。它擅長小修小補和快速迭代,這點比Claude強。我的工作流是:先Grok快速prototype,再用Claude做精調和架構審查。搭配下來效率最高,成本也控制得住。 -
月光_19—SuperGrok $30不算貴,但Heavy $300就離譜了。除了beta優先權看不出值這個價,除非Grok 5真能做出來。 -
MOper—if18說Grok 5有6萬億引數,10%的AGI機率。但推理成本多高是個大問題,個人使用者根本用不起這麼大的模型。 -
TigerTrale74—Reddit上r/grok社群覺得Grok 4.2程式設計提升實打實,多步重構和程式碼審查有改進。跟Claude比還是有差距的。 -
Dorothy_MoralesIII—Grok 4.5升級程式設計明顯變強,用Cursor資料訓練這招絕了,比之前用的程式設計輔助都好用,速度也快。 -
EvelynNie_lsen—極簡劉少那篇說Grok 4.5雖然沒拿第一,但程式設計價效比最好。API價格比Claude Opus便宜十幾倍,速度還快,個人開發夠用了。 -
5wxfm—Grok 4.5價效比沒得說,2/6定價太能打了。side project用完全夠,大專案才上Claude,這樣搭配最省錢。 -
xPredislavKostirko_dev—Grok Build原生支援Claude Code配置格式,這波很務實。降低遷移成本才是聰明做法,不搞生態封閉那一套。 -
範怡勇—11位聯合創始人都離職了,xAI內部什麼情況?雖然馬斯克說重構了,但核心團隊動盪確實讓人擔心發展方向。 -
RalphWilliams_88—5分鐘AI速覽說Grok Build被曝上傳程式碼庫,CLI工具連金鑰都能洩露誰還敢用,安全問題必須重視。 -
JessicaThompson_Max—DoD給Grok授權接機密網路,這算第三方認可了。不是什麼AI都能拿到國防級的信任背書,這點確實厲害。 -
Brenda_FosterZ—用了Grok Build,先做5件事保護程式碼安全。第一件事就是把API key輪換了,之前一直裸奔,現在想想都後怕。 -
Samuel_Morales_99—Grok Build上線對標Claude Code,npm報錯秒級修復好用。簡單重構還行,大型專案就力不從心了。 -
BCollins—把Grok 4.5和Claude Opus 4.7做了對比測試,30個程式設計題。Grok平均2.3秒但需反覆改,Claude一次到位但等了14秒。Grok token消耗是Claude的5-6倍,小專案用Grok更香,關鍵任務還是選Claude省心,各有適用場景。 -
Anthony_BarnesII6—Grok 4.2多模態落後Gemini和GPT-5.5,Grok 5能不能補上短板還不知道。等了這麼久,希望別讓大家失望。