Grok 5.5

xAI 的實時 AI 助手,唯一原生接入 X 實時資料流,Grok 5 測試版為 6 萬億引數 MoE 旗艦

深度報告

  • 截至 2026-07-17,xAI 並未釋出名為「Grok 5.5」的獨立模型。每日產品速遞中的這一條目,實際對應的是 xAI 在 2026 年 5 至 6 月開放公開測試版的 Grok 5——一枚 6 萬億引數的混合專家(MoE)旗艦模型。「5.5」的寫法很可能來自與 OpenAI 同期 GPT-5.5 的命名混淆。下文以可驗證的 Grok 5(含仍在生產的 Grok 4.2 與 Grok 4.20)為基準撰寫,命名與分類是否沿用「Grok 5.5」留待人工在後臺稽核決定。

  • Grok 由埃隆·馬斯克創辦的 xAI 於 2023 年推出,直接內建於其社交平臺 X。2026 年 2 月 2 日,SpaceX 以約 1.25 萬億美元估值收購 xAI,合併實體的算力與發射基礎設施打通。Grok 5 在孟菲斯的 Colossus 2 超級叢集上訓練——這是全球首個突破 1 吉瓦功率的 AI 訓練設施,約 55 萬塊英偉達 GPU,馬斯克稱其為通往 AGI 的關鍵一躍,並給出「約 10% 機率觸及通用智慧」的判斷。

  • Grok 5 公開測試版的核心賣點有三。一是原生多模態:統一架構同時處理文字、影象、音訊與實時影片,上下文視窗達 150 萬 token,約為 Grok 4 系列的七倍。 二是多智慧體架構:延續 Grok 4.20 的四智慧體協作與 4.20 Heavy 的十六智慧體系統,向「動態生成智慧體、跨會話持久記憶」演進。 三是結構性的實時資料優勢:Grok 擁有 X 平臺 firehose 的原生直連,能在事件發生後幾分鐘到幾小時內綜合社媒討論與網路來源生成帶引用的報告,這是其他旗艦模型靠定時網路檢索無法複製的。現役生產模型 Grok 4.2 亦提供 200 萬 token 上下文、語音模式與文件分析,實測幻覺率低於 Claude 與 GPT 同代。

  • Grok 透過 X 捆綁分發:免費層(X 內限流)、X Premium 8 美元/月、X Premium+ 16 美元/月;獨立訂閱 SuperGrok 30 美元/月(語音、影象、文件分析、優先響應),SuperGrok Heavy 300 美元/月(Grok 5 測試版優先訪問、多智慧體、最高算力)。xAI API 按 token 計費、相容 OpenAI 介面。 SuperGrok 比競品 20 美元檔貴 10 美元,僅當實時 X 資料確有價值時才划算;Heavy 在 Grok 5 全面可用前偏貴,本質是「為早期訪問付費」。

  • 社群對實時 X 整合幾乎是「唯一被反覆稱讚的功能」,很多使用者表示「即使別的模型更強也留著 Grok 就為這個」。Grok 4.2 相對 4.1 的編碼進步可見,語音模式延遲與對話質量已接近 ChatGPT 高階語音。 但抱怨也很集中:SuperGrok Heavy 300 美元/月被認為溢價過高;Grok 4.2 多模態落後 Gemini 3.5 Pro 與 GPT-5.5;最難推理基準仍落後於 GPT-5.5 與 Claude Opus 4.7;客服口碑差,賬號恢復與賬單問題處理慢。Grok 5 的 6T 架構釋出在開發者社群激起今年最持久的技術興奮。

  • 2026 年 4 月多模型差異指數(MDI)準確率排名中,Grok 4.2 位列第 3(509 分),高於 GPT-5.5(第 5)與 Gemini 3.5 Pro(第 4),低於 Claude Opus 4.7(第 2)。 美國國防部已授予 Grok 分類網路訪問許可權(用於有限情報與 OSINT 場景),被業界視為對其底層能力最強的第三方背書之一。xAI 同時推出終端級 AI 程式設計 Agent「Grok Build」,原生相容 Claude Code 的 CLAUDE.md 配置,直接對標 Anthropic 與 OpenAI 的程式設計工具。

  • Grok 是 2026 年全球監管最關注、也最具爭議的 AI 產品之一。內容層面,2025 年曾生成反猶內容、自我指涉極端言論與政治 misinformation,xAI 歸咎於內部未授權改動;影象工具 Grok Imagine 的「spicy mode」被廣泛用於生成非自願色情與未成年人深度偽造,單日請求峰值近 20 萬次。 監管層面,法國檢方 2026 年 2 月突擊搜查 X 巴黎辦公室,英國 Ofcom 與歐盟委員會依《線上安全法》《數字服務法》《AI 法案》立案,馬來西亞與印尼直接遮蔽 Grok,加州總檢察長髮出停止函,田納西州有含未成年人的聯邦訴訟。這些風險集中在消費級影象生成,純文字與 API 工作流的暴露相對有限,但已讓部分企業買家猶豫。 此外,xAI 的百科產品 Grokipedia 事實錯誤率偏高,拖累研究類場景的可信度。

  • Grok 適合把「實時資訊綜合」作為核心工作流的人:記者、市場情報、OSINT、追蹤突發輿論與爭議發酵,以及本身就是 X 重度使用者者。它也是 Grok 5 早期架構試驗的低成本入口。 不適合把它當作通用寫作、深度編碼或保守內容處理的預設選擇——這類任務 ChatGPT Plus、Claude Pro、Gemini AI Pro 在 20 美元檔價效比更高。若主要依賴實時 X 資料,SuperGrok 30 美元檔是甜點;僅為嚐鮮 Grok 5,等其全面可用(目標 Q3 2026)再決定是否上 Heavy。

  • Grok 不是「綜合質量最高的聊天機器人」,而是「唯一結構性擁有實時 X 資料的聊天機器人」;Grok 5 的 6T MoE 架構是今年最激進的一步,若兌現承諾將明顯縮小與 GPT-5.5、Claude Opus 4.7 的模型質量差距,但其內容治理與監管包袱同樣無人能及。

使用者評論

  • 頭像
    Nodeii
    用Grok做了一週的深度調研,對比之前用GPT和Claude的經驗,說幾點實在的。第一,資訊時效性確實碾壓,搜尋2026年下半年的事件Grok給出的結果比另外兩家新了起碼一到兩週。第二,推理深度還是有差距,問那種需要多步因果鏈的問題,Claude給出的分析鏈條最長最完整,Grok有時候會跳過中間步驟直接給結論。第三,也是最糾結的一點——Grok的API定價確實香,輸入1.25輸出2.5的價位在大模型裡簡直是地板價了,但付出的代價是工具鏈不成熟、文件不完善、社群支援弱。如果你是個人開發者或者小團隊,省下來的錢值得折騰;如果是大企業,省這點錢不值得冒生態風險。

  • 頭像
    CarlBaker
    自從xAI收購Cursor之後Grok的程式設計能力確實上了一個臺階,新出的4.5版本在SWE Bench Pro上反超了GPT-5.5,雖然離Claude Opus還有差距但已經很接近了。最讓我意外的是它的token效率,完成同樣的工程任務只需要Opus四分之一的輸出量,這就意味著同樣的預算能做的事情多了四倍。不過企業級採用率還是太低,ETR的資料說Grok在企業使用者裡只佔6%,這個生態短板短期內不好補。

  • 頭像
    Christine.Robinson_20215
    作為一個同時充了GPT、Claude和Grok三個會員的重度使用者,我的建議是看場景選工具。做輿情監控和熱點追蹤的時候用Grok,X平臺的實時資料確實是獨一無二的優勢,別的AI做不到。寫深度報告和長文件的時候用Claude,它的長文字處理能力是天花板級別的。日常編碼和通用任務用GPT,生態最完善、綜合能力最均衡。三個工具各有各的長處和短處,沒必要非得選一個。

  • 頭像
    馬陽妍
    看到不少人吹Grok多好多好,我來潑點冷水。首先300美元一個月的SuperGrok Heavy純屬智商稅,就為了提前體驗一個還沒釋出的Grok 5 beta,值嗎?其次Grok的客服是真的爛,賬號出了問題發郵件根本沒人回,社群裡一堆人抱怨同樣的問題。再說說那個所謂的無審查,實際上最近的更新已經把尺度收窄了很多,寫個稍微敏感點的虛構情節它都開始給你講大道理了。馬斯克吹的那些東西,聽聽就好別太當真。

  • 頭像
    雲煙994
    Grok 4.5釋出那天我就切過去用了,說說印象最深的幾個點。首先是價格,輸入每百萬token才2美元,輸出6美元,比起Opus的5/25和GPT-5.5的5/30確實便宜太多了。其次是速度,80 TPS的推理速度在日常使用中感受很明顯,基本不需要等。但也不是沒有槽點,在特別精密的程式碼生成場景下它還是會出一些低階錯誤,比如變數命名不一致、邊界條件考慮不周全這些。總的來說價效比很高,適合日常批次任務,核心關鍵任務還是留個心眼。

  • 頭像
    Brenda.Martin_202427
    Grok 5 的 6 萬億引數 MoE 架構光看引數就夠嚇人,等 Q3 全面開放再判斷它到底幾斤幾兩。

  • 頭像
    sadswan490
    Grok 的毒舌人設有一批死忠,少過濾反而討喜,比起其他模型那股小心翼翼的腔調順眼多了。

  • 頭像
    BMorales007
    多模態這一塊還是落後 GPT-5.5 和 Gemini,等 Grok 5 正式版補齊再說。

  • 頭像
    琉璃_19
    SuperGrok Heavy 300 刀一個月也太貴了,就為搶個 Grok 5 測試版名額,普通人真沒必要。

  • 頭像
    PamelaThompson_705
    國防部都給 Grok 分類網路訪問了,這算今年最強的第三方背書了吧。

  • 頭像
    Michelle.HarrisZ
    實時 X 資料真的獨一份,別的模型比不了,這也是我一直留著 Grok 的原因。

  • 頭像
    GPUMiner17
    我是做市場情報的,每天用 Grok 盯競品的 X 輿情,DeepSearch 把社媒情緒和新聞合成一份帶引用的簡報,效率比 Perplexity 高,因為它能直接吃 X 的實時討論。

  • 頭像
    Ashley_Martin_2024
    voice mode 延遲和 ChatGPT 高階語音差不多了,通話體驗不錯,算是被低估的一點。

  • 頭像
    DrLinaHaji_x
    Grok Build 終端程式設計 Agent 挺香,能讀 Claude Code 的 CLAUDE.md 配置,我直接拿來跑小指令碼,最多八個子智慧體並行,對標 Claude Code 但便宜。

  • 頭像
    Lawrence.MendozaII8
    老實說 Grok 5 測試版目前只有 Heavy 檔能用,300 刀對普通人太肉疼。我衝著 1.5M 上下文和原生影片理解去的,實測長文件分析確實穩,但最難的數學和推理基準還是追不上 Opus 4.7 和 GPT-5.5。馬斯克說 10% 機率觸 AGI 就當嘴炮聽,架構激進是真的,能不能兌現還得看 GA 後的實測。

  • 頭像
    EricBarnesJr
    用了三週 Grok 4.2,最驚喜的是它不像 GPT 那樣繞彎子,問敏感問題也給直接的列表加來源。但影象生成 Aurora 現在被閹割得厲害,出來的圖又安全又寡淡,創意活還是得回 Midjourney。整體定位很清楚:要實時輿論它就無可替代,要精緻寫作還是 Claude 順手。

  • 頭像
    CherylNelson_Plus
    作為記者我最看重的是它的「實時性」——公司發財報六小時內的市場反應,Grok 能綜合分析師和散戶在 X 上的情緒給我一份摘要,ChatGPT 只能說訓練截止沒法看。但編輯部規矩是先用 Grok 摸方向、再查一手來源,它的自信有時候太有誘惑力,懶得核就翻車,所以重要稿子絕不能照抄。

  • 頭像
    BSimmons007_381
    把 Grok 當研究加速器而不是最終權威,這句話說到點子上了。我們團隊做競品監測時讓它先拉 X 和網頁上的公開討論,分析師再人工核驗來源,最後才寫決策 memo。直接把生成內容貼進客戶 deck 出過事,不是 Grok 獨有的問題,是 LLM 的通病,但它實時那一層太新鮮,誘惑你去信。新鮮不等於準確,記住這點就行。

  • 頭像
    Vincent.RuizJr
    自由派都走了,核心團隊動盪讓人有點擔心後續的路線能不能走通。

  • 頭像
    丁超
    免費檔綁在 X Premium 上其實很划算,反正本來就開會員,等於白嫖 Grok,輕度用完全夠了。

  • 頭像
    ETmar_btc
    Grokipedia 事實錯誤率偏高,拿它做研究參考不靠譜,正經檢索還是 Perplexity 穩。