深度報告
-
Muse Spark 是 Meta 於2026年4月8日釋出的新一代AI模型,由新成立的 Meta Superintelligence Labs(MSL)開發。該模型是Meta閉源路線的首個產品,在醫療問答、圖表理解等領域表現突出,HealthBench Hard 得分遠超競品,Contemplating 深度推理模式在 HLE 基準測試中排名全球第三。但同時在抽象推理和編碼智慧體任務上存在明顯短板,與 GPT-5.4、Gemini 3.1 Pro 等頭部模型仍有差距。目前產品透過 meta.ai 網頁版免費開放使用,API 處於私有預覽階段。
-
2025年6月,Meta 斥資143億美元收購了資料標註公司 Scale AI 的近半數股權,並挖來其聯合創始人、年僅29歲的 Alexandr Wang,出任公司史上第一位首席 AI 官。2025年7月,Meta 組建了全新的精英部門——Meta 超級智慧實驗室(Meta Superintelligence Labs,MSL),由 Alexandr Wang 全權負責,目標是打造面向個人超智慧的 AI 系統。 在此之前,Meta 的 AI 之路並不平坦。2024年釋出的 Llama 4 Maverick 在行業測評中表現不佳,Artificial Analysis 智慧指數僅獲18分,排名墊底。2026年4月8日釋出的 Muse Spark(內部代號“牛油果”)是 MSL 潛心九個月打造的全新大模型,也是 Meta 首次放棄開源路線,轉向閉源策略的產品。該模型的釋出標誌著 Meta 在 AI 領域的一次重大戰略轉向。 Meta Platforms Inc.(NASDAQ: META)是全球最大的社交網路公司之一,旗下擁有 Facebook、Instagram、WhatsApp 等核心產品。公司在 AI 領域的投入持續加大,2025年財報顯示 AI 相關研發投入已超過500億美元。Muse Spark 的釋出被視為 Meta 重新爭奪 AI 市場主導權的關鍵一步。
-
Muse Spark 提供三大核心功能:首先是262K 超長上下文視窗,支援262,144個 token 的上下文長度,可完整分析大型程式碼庫、長篇法律文件或學術論文。其次是多模態統一輸入能力,原生支援文字、影象和語音的融合輸入,具備“視覺思維鏈”能力,可在動態環境中進行物體識別和影片分析。第三是沉思模式(Contemplating Mode),這是 Muse Spark 的核心差異化功能,支援多智慧體並行深度推理,可同時協調多個 AI 智慧體解決複雜科學和數學問題。 Muse Spark 提供三級推理模式:快速模式(Fast Mode)適合日常任務,響應速度快但推理深度有限;標準模式提供平衡的推理能力和響應速度;沉思模式消耗最多計算資源但提供最深度的推理能力,適合需要深度思考的科學和數學問題。 目前 Muse Spark 已接入 Meta AI 網頁版和應用,在未來幾周內將逐步擴充套件至 WhatsApp、Instagram、Facebook、Messenger 等 Meta 旗下產品。更值得注意的方向是,Muse Spark 將被嵌入 Meta 的智慧眼鏡產品中,實現類似 Google Gemini 深度融入 Google 產品生態的體驗。
-
meta.ai 網頁版 免費 已上線,無使用限制 API 介面 未公佈 私有預覽階段 Meta 表示 API 訪問目前僅向部分合作伙伴開放私人預覽,尚未公佈正式定價和公開發布日期。這一策略與 OpenAI 的 GPT 系列和 Google 的 Gemini 系列類似初期採用邀請制,後續逐步開放。 從產品定位來看,Muse Spark 主要面向三類使用者:首先是研究者群體,特別是醫療和科學領域的研究者,模型在 HealthBench 和 FrontierScience 基準測試中的表現優異;其次是企業使用者,DeepSearchQA 和 GDPval-AA 等辦公綜合任務表現突出;第三是普通使用者,可透過免費的 meta.ai 網頁版體驗基礎功能。
-
從行業反饋來看,Muse Spark 獲得了一定程度的認可。醫療領域從業者對模型在醫學問答上的表現給予高度評價,HealthBench Hard 得分42.8分,是 Claude Opus 4.6 的近三倍。多模態圖表理解能力獲得積極反饋,CharXiv Reasoning 86.4分顯著領先競品。Contemplating 深度推理模式被評價為“最具創新性的推理架構”,在 HLE 基準測試中排名全球第三,展現了計算資源堆疊後的巨大潛力。 然而,批評聲音同樣明顯。抽象推理能力存在代差,ARC-AGI-2 得分42.5分,與頭部模型的77.1分差距超過20分,被評價為“存在明顯的能力缺口”。編碼智慧體任務全面落後,Terminal-Bench 2.0 排名五家最後。部分多模態任務表現不佳,ZeroBench 得分33.0分,是五家模型中最低的。
-
TechCrunch 評價稱這是 Meta 自 Alexandr Wang 加入以來發布的首款模型,代表了“從根本上重建 AI 技術棧”的努力。騰訊新聞報道指出 Meta 股價在訊息公佈後應聲上漲6%,市場對這款產品寄予厚望。知乎專欄文章分析認為 Muse Spark 標誌著 Meta 從 Llama 開源時代向閉源時代的戰略轉型。 行業分析指出 Muse Spark 的核心優勢在於醫療和圖表理解兩個垂直領域,但整體競爭力尚未達到挑戰頭部模型的水平。DataLearnerAI 的評測分析認為該模型是一個“特定領域領先、整體跟隨”的產品,Contemplating 模式是最值得關注的差異化亮點,但要想在綜合能力上與 GPT-5.4 和 Gemini 3.1 Pro 競爭,仍需在抽象推理和編碼智慧體兩個短板上持續投入。
-
Meta 曾是開源大模型的旗手,Llama 系列模型以開放權重著稱,推動了全球 AI 開源社群的發展。Muse Spark 轉向閉源引發了關於 Meta 是否“背棄”開源社群的討論。部分開發者社群成員表達了不滿,認為 Meta 現在“既要閉源賺錢,又要開源社群貢獻程式碼”。 Muse Spark 在部分關鍵基準測試中的表現與頭部模型存在兩位數的差距,特別是在 ARC-AGI-2 抽象推理和編碼智慧體任務上。這不僅影響產品在開發者心中的地位,也可能在企業採購決策中成為阻礙。Meta 需要在下一代產品中快速彌補這些短板。 目前 API 處於私有預覽階段,尚未公佈正式定價。市場擔憂其定價可能對標 OpenAI GPT-5 和 Google Gemini Pro 級別,對於個人開發者和小型團隊而言可能門檻較高。
-
Muse Spark 最適合三類使用者:醫療領域從業者(如醫生、醫學研究者、醫療 AI 開發者)將獲得最佳體驗,這部分使用者在 HealthBench 和 MedXpertQA 上的表現遠超競品;需要圖表理解能力的資料分析師和科研人員也將受益,CharXiv Reasoning 86.4分是當前最高水平;深度推理需求的學術研究者可以使用 Contemplating 模式處理複雜科學和數學問題。 對於需要強編碼能力的軟體工程師,Muse Spark 在 Terminal-Bench 和 SWE-bench 上的表現落後於競品,建議選擇 GPT-5.4 或 Claude Opus 4.6。對於需要強抽象推理能力的使用者,ARC-AGI-2 得分與頭部存在代差,不建議作為首選。對於需要完整 API 支援的企業使用者,建議等待 API 正式釋出並進行成本評估後再做決定。 競品選擇包括:GPT-5.4(綜合能力強,適合開發者)、Gemini 3.1 Pro(Google 生態整合深入、Claude Opus 4.6(編碼能力突出)。
-
Muse Spark 是 Meta 在 AI 領域的一次重要嘗試,憑藉醫療問答和圖表理解兩個垂直領域的突出表現,展示了差異化競爭的潛力。但綜合能力上與 GPT-5.4、Gemini 3.1 Pro 仍有差距,特別是在抽象推理和編碼智慧體兩個維度。對於醫療和科研使用者這是一款值得關注的產品,對於追求全面能力的使用者建議繼續觀望。
使用者評論
-
譚君靜—試了一下meta.ai上的Muse Spark,影象分析功能太強了,能準確識別圖片中物體的位置和數量,這對科研黨來說太香了! -
姜萱—免費版還要什麼腳踏車,meta.ai直接能用,還要啥GPT-5 -
MsNeeaKalas_x—對比了Claude Opus 4.6和GPT-5.4,Muse Spark在醫療問答上確實領先,但編碼能力還是有差距,Terminal-Bench 2.0表現拉胯。 -
Cynthia_Hicks_20227—Arc AGI-2得分42.5,和頭部77分差距20+,這波屬於是還沒完全體的狀態。 -
COpet—閉源了,開發者社群一片哀嚎,之前用Llama系列用得好好的,突然就不開源了。 -
O0YMFWFO—262K上下文太香了,塞一整本小說進去做分析完全沒問題。 -
MiaMiller—沉模式(Contemplating Mode)確實牛,HLE排名第三,推理能力比標準模式強不是一點半點,就是推理時間太長了,等得花兒都謝了。 -
oxalvddc5—用了兩天,感覺CharXiv圖表理解86.4分不是白給的,看論文pdf特別準。 -
koFIS—測了影象生成,能準確檢測影象中的物體和位置,visual_grounding工具很好用! -
Amy304—Python執行環境帶pandas和numpy,做資料分析很方便。 -
joGUT—Meta這波轉型閉源,不知道葫蘆裡賣的什麼藥。 -
Amanda_Jones722—HealthBench Hard 42.8分吊打Claude Opus 4.6的14.8,醫療領域yyds! -
月光_24—API還處於私人預覽階段,開發者還需要再等等。 -
GRcox—從18分到52分,Meta算是把Llama 4的債還上了。 -
Eagl_eEdgeHolm—Meta股價漲6%,資本市場的反應比開發者社群真實多了。 -
KPerez_88—和GPT-5.4、Gemini 3.1 Pro對比了一下,各有勝負吧,醫療和圖表理解是強項。 -
324slm—多模態統一輸入架構確實有點東西,不是後期拼接的。 -
CMoore—Meta從開源到閉源,這次是真的變天了。 -
JacobButler—Alexandr Wang加入後首個作品,143億美元沒白花!