Muse Spark 1.1

Meta 超級智慧實驗室推出的旗艦多模態推理模型,專為 Agent 任務與程式設計打造,百萬 token 上下文,價格僅為同級競品四分之一

深度報告

  • Muse Spark 1.1 是 Meta 超級智慧實驗室於 2026 年 7 月 9 日釋出的新旗艦多模態推理模型,專為 Agent 任務打造,主打工具呼叫、電腦操作、程式設計和多模態理解,上下文視窗達 100 萬 token。它同時帶來了 Meta 首個付費開發者介面 Meta Model API,定價每百萬輸入 token 1.25 美元、輸出 4.25 美元,約為同級競品的四分之一,被普遍解讀為一場針對 OpenAI 和 Anthropic 的價格戰。扎克伯格時隔三年多重返 X 平臺親自站臺,標誌著 Meta 從開源 Llama 路線向閉源收費模式的重大轉向。模型在工具呼叫和職業場景測試中拿下多項第一,但也伴隨 Terminal-Bench 刷榜爭議和客戶端穩定性吐槽。

  • Muse Spark 1.1 出自 Meta 超級智慧實驗室(Meta Superintelligence Labs),是 Meta 重組 AI 團隊、豪擲重金挖角後的首個標誌性成果。釋出當天,扎克伯格在 X 上發出三年多來的第一條帖子,稱其為「一個價格極低的強力 Agent 與程式設計模型」,馬斯克隨即隔空回應,兩人互動本身就成了新聞。分析人士認為,選擇在競爭對手的平臺上官宣,是刻意為之的傳播策略。 這次釋出的戰略意義大於單純的模型迭代。Meta 過去以開放權重的 Llama 系列著稱,而 Muse Spark 1.1 是閉源模型,且首次透過付費 API 對外商用,意味著 Meta 正式加入 OpenAI、Anthropic 所在的企業級模型收費市場。據新浪財經等媒體報道,Meta 同期還啟動了自研 AI 晶片「Iris」計劃,聯合博通設計、臺積電製造,試圖降低對英偉達和 AMD 的依賴,支撐明年算力翻倍的目標。模型將逐步替換 WhatsApp、Instagram、Facebook 和智慧眼鏡裡由 Llama 驅動的聊天機器人,覆蓋 Meta 數十億使用者的產品矩陣。

  • Muse Spark 1.1 是一個多模態推理系統,支援文字、影象、影片、音訊和檔案輸入,上下文視窗 1,048,576 token,是上一代的四倍。它能圍繞使用者目標規劃任務、呼叫外部工具、編寫和除錯程式碼,並在多步驟長流程任務中保持上下文連貫。Meta 稱模型「知道什麼時候該寫指令碼自動化、什麼時候直接點介面」,可以在多個應用之間穿梭執行任務,面對陌生介面也只需極少的人工干預。 針對多智慧體自動化工作流,模型引入了上下文壓縮機制:主 Agent 負責生成專案計劃,子 Agent 分頭執行,執行過程中產生的海量資料會被壓縮保留最關鍵的細節,需要時可回溯此前的工作成果,在不同子任務之間傳遞資訊。這一設計直擊 Agent 工作流中「上下文爆炸」的痛點。在 Meta 的內部演示中,工程師讓它根據一句提示生成聊天應用,模型能自動截圖程式介面、識別技術問題並定位到出錯的程式碼片段進行修復。多模態方面,它可以根據使用者拍攝的影片提取商品資訊,在 Facebook 二手市場代替使用者完成商品釋出,也能一邊生成程式碼一邊完成訂餐這類現實任務。 社群實測反饋總體積極。開源開發者 Simon Willison 拿到幾天預覽許可權後做了經典的「鵜鶘騎腳踏車」SVG 測試,並對模型評估報告中兩個 Muse Spark 互相對話、談論自身存在的片段印象深刻。Julius AI 創始人在程式碼工作臺裡直接讓它寫出並執行整套《我的世界》遊戲工程。還有使用者測試影象識別,讓模型判斷圖中食物能否食用,Muse Spark 1.1 透過了測試,而對照的 Claude Fable 5 沒有透過。

  • 定價是這次釋出最鋒利的武器。Meta Model API 公開預覽版面向美國開發者開放,每百萬輸入 token 收費 1.25 美元、輸出 4.25 美元,大約只有 GPT-5.5、Claude Opus 4.8 同級產品的四分之一,新使用者還送 20 美元免費額度。據新浪財經報道,其輸入輸出成本比 Anthropic 和 OpenAI 產品低 50% 以上,底氣來自廣告業務的利潤支撐——Meta 2025 年運營收入增長 20%,2026 年加速至 30%。 社群討論普遍認為這首先是一場價格戰而非純粹的能力突破。Hacker News 上的開發者反覆強調 cached input 價格的重要性,因為多輪程式設計和 Agent 工作流會大量複用上下文,快取價直接決定實際成本。對於每天跑幾十萬次 Agent 呼叫的團隊來說,4.25 美元的輸出單價讓大規模 Agent 批處理在經濟上變得可行。商業路徑上,Meta 一手用低價 API 搶開發者,一手把模型鋪進自家消費級產品(Meta AI 應用新增「Thinking」模式),形成 B 端 C 端雙線變現。

  • 正面評價集中在工具呼叫和長上下文。多位開發者反饋它的 tool calling 成功率高於 GPT-5.5 的首輪 Agent 鏈路,最被看好的場景是除錯、診斷和事故響應:先 grep 日誌、跑效能分析、整理報告,再把結果交給更強的模型修復。百萬 token 視窗在實測中經受住了壓力測試,跨大型程式碼庫和多檔案檢索的表現穩定,不需要切塊或摘要。 負面反饋也不少。有使用者吐槽搭載新模型的 Meta AI iPad 客戶端穩定性極差,頻繁閃退、輸出文字亂碼斷裂;還有人抱怨 Meta AI 連一個普通的 Excel 表格都做不好。部分開發者直言它的整體質量不如 Claude Sonnet 系列,「工具呼叫強不等於整體更好」。也有人認為對一個尚無口碑積累的新模型來說,這個定價其實不算便宜,除非質量真能穩定接近頭部水平。

  • 第三方基準測試勾勒出它的能力輪廓:強在 Agent,不弱於程式設計,但不是全面第一。Meta 公佈的內部測試中,它在 MCP Atlas 工具呼叫測試拿到 88.1 分排名第一,高於 Claude Opus 4.8 的 82.2 和 GPT-5.5 的 75.3;JobBench 職業場景工具使用測試 54.7 分同樣第一。計算機操作方面,OSWorld-Verified 得分 80.8,僅次於 Opus 4.8 的 83.4;Terminal-Bench 2.1 得 80 分,SWE-Bench Pro 得 61.5 分。Vals AI 榜單顯示它在綜合指數排第 4(準確率 68.41%),多模態指數排第 6;在金融 Agent、企業金融分析測試中排第 2,醫療記錄處理排第 1,法律、稅務、醫療文書三大垂直行業測試全部拿下第一,且法律 Agent 任務拉開明顯差距。Artificial Analysis 智慧指數三個月內漲了 8 分,躋身得分超過 50 的四個前沿模型之列(另外三個是 GPT-5.5、Opus 4.8 和 Kimi K3)。 媒體解讀的焦點在戰略層面。智東西、TechCrunch 等媒體把它視為 Meta 從「開源換生態」轉向「閉源收費」的分水嶺,也是 AI 程式設計工具市場的新變數。行業分析普遍認為,Meta 用激進的 token 定價換使用者和曝光,短期內會給 Anthropic 和 OpenAI 的企業客戶報價帶來實際壓力。

  • 最大的技術爭議是 Terminal-Bench 刷榜風波。有社群成員發現 Meta 在跑該基準時調整了資源配置,引發「換了資源配置後分數還能不能代表同一個 benchmark」的爭論,部分開發者據此對官方分數打了折扣。其次是可靠性質疑:Meta 計劃到 2026 年底用 AI 替換 90% 的內容稽核人員,而上月有報道披露 Meta 的 AI 客服 Agent 曾錯誤地把約兩萬個 Instagram 賬號的訪問許可權交給駭客。當公司力推能代表使用者行動的 Agent 時,這段歷史讓外界對其安全把控能力保持警惕。 路線轉向本身也有代價。放棄開放權重讓依賴 Llama 自部署的社群感到被拋棄,需要私有化部署或開源權重的團隊只能退回 Llama 系列或轉投 Kimi K3 等開源替代。此外,投資圈對 Meta「多線出擊、缺乏聚焦」的質疑仍在——自研晶片、超級智慧實驗室、元宇宙多頭並進,短期內會推高資本支出,而元宇宙的前車之鑑猶在。

  • 這款模型最適合構建 Agent 工作流的開發團隊:MCP 多工具編排、跨應用自動化、長上下文程式碼庫問答、大批次 Agent 呼叫等場景,它的成功率和單價組合在當前市場幾乎沒有對手。預算敏感、呼叫量大的初創公司和獨立開發者也值得一試,20 美元免費額度足夠跑完一輪完整評估。反過來,追求極限程式碼能力的團隊可能仍會留在 Claude Opus 4.8;需要開源權重、本地部署或資料不出域的企業則不適合,它是純 API 閉源產品,沒有私有化路徑。普通使用者可以在 Meta AI 應用的「Thinking」模式中免費體驗,但目前客戶端穩定性問題尚未完全解決,重要工作不建議依賴。

  • Muse Spark 1.1 是 Meta 用「四分之一價格 + Agent 長板」對企業級 AI 市場發起的正面強攻,能否守住口碑取決於刷榜爭議的澄清和實際生產環境中的可靠性表現。短期看,它至少把前沿模型的價格錨點狠狠拉低了一檔;長期看,Meta 自研晶片和廣告現金流的組合,讓這場價格戰有可能打得比對手預想的更久。

使用者評論

  • 頭像
    Janet_Green007
    Meta 打算年底前用 AI 換掉九成內容稽核員,上個月還爆出 AI 客服把兩萬個 Instagram 賬號許可權錯發給駭客,現在又推能替使用者操作的 agent,我對它的安全把控是存疑的。

  • 頭像
    Benjamin_RamirezSr
    壓力測試下 1M 上下文在多檔案程式碼庫裡的檢索表現挺穩,主動上下文壓縮把長會話質量撐住了,跑了一個小時的 agent loop 指令遵循也沒崩。它還能接音訊和影片輸入,同價位的 GPT-5.5 和 Opus 4.8 都沒完全跟上這個輸入範圍,多模態這塊算是個安靜的差異化優勢,整體比我預期好不少。

  • 頭像
    kc7fg
    需要開源權重或者本地部署的可以散了,這是純 API 閉源產品,沒有私有化路徑,要自託管只能回頭用 Llama 或者 Kimi K3。做這個模型的超級智慧實驗室和 Llama 開源團隊是分開運作的,一個專攻付費前沿效能,一個繼續開源,Meta 這是兩條腿走路,但對資料不能出域的企業來說等於沒得選。

  • 頭像
    TokenTiger152_eth
    算了筆賬,一個每天處理 500 通客服對話的生產 agent,平均每通 4 萬輸入 3 千輸出 token,跑 Muse Spark 1.1 一天 31 美元出頭,一個月九百多刀;同樣的活兒放 GPT-5.6 Sol 上一天要 145 刀。對工具呼叫密集型的業務來說,這個差價不是省錢,是直接改商業模式。

  • 頭像
    MMorales_9990
    注意官方對比的是 GPT-5.5 和 Opus 4.8,釋出同一周人家新一代就出了,拿上一代當對照組是慣常操作,但看分數的時候心裡要有數。

  • 頭像
    MetcPro
    1.0 到 1.1 才隔三個月,內部測試 pass@1 從 48.1% 跳到 67%,這個迭代速度有點嚇人。

  • 頭像
    ERuiz_7744
    1M 視窗是真的,但 MRCR 長上下文檢索分只有 54.1,視窗長不等於找得準,塞滿百萬 token 之後關鍵資訊召回不是前沿水平,重要場景還是得自己做檢索。

  • 頭像
    AnthonyRamirez
    美國以外暫時用不了 API,歐盟連時間表都沒有,海外團隊先別把架構押在它身上。新使用者送 20 刀額度,大概能跑 470 萬輸出 token,做一輪完整評估足夠了。

  • 頭像
    RBaileyJr
    幻覺率是硬傷,Artificial Analysis 測出來 38%,這一代模型裡幾乎最高。我自己用也碰到它一本正經編事實。agent 榜單它是領先,但純程式設計 SWE-Bench Pro 61.5 輸給 Opus 4.8 的 69.2,而且它話多,得出答案要消耗比平均更多的 token,實際成本和響應時間都被拉長了,重要答案必須自己核一遍。

  • 頭像
    MarilynMyersX
    工具呼叫是真的強,跑 MCP 幾乎不掉鏈子!

  • 頭像
    PinjaWalli
    又快又便宜,用起來很順手,但它不是王者,快但不是最快,聰明但不是最聰明。

  • 頭像
    Amy_Hill369
    截圖驅動除錯的演示挺驚豔,它自己搭了個聊天應用,自動截圖檢查介面,發現 bug 追溯到具體程式碼行,修完再截圖驗證,這個看改驗閉環對前端開發太實用了。還有個沙箱演示,只給它 run 和 write_file 兩個工具外加一個一次性 Docker 容器,它自己選了全部 48 條 shell 命令修好一個 SWE-bench 的 bug,還會翻 git 歷史找引入問題的那次提交,你只用給容器和目標,不用給指令碼。

  • 頭像
    DianeHern_andez
    從 Llama 開放權重到閉源收費 API,Meta 這個轉身夠徹底的,靠 Llama 自部署的社群這回算是被拋棄了。而且新模型會逐步替換掉 WhatsApp、Instagram、Facebook 和智慧眼鏡裡那些由 Llama 驅動的聊天機器人,等於自家幾十億使用者的產品矩陣全部換血,開源路線看來真的翻篇了。

  • 頭像
    crazypeacock280
    Meta 這次不是普通的模型更新,是直接衝著 AI 程式設計工具市場來的,修程式碼漏洞、做大型程式碼遷移、跨多個應用調工具全都能幹,做程式設計工具的這些傢伙要緊張了。

  • 頭像
    AdrijanaKapetanović
    API 完全相容 OpenAI 格式,把 base_url 換成 api.meta.ai/v1、model 名一改就能跑,現有程式碼基本不用動,遷移成本幾乎為零,想做 A/B 測試的團隊直接衝。

  • 頭像
    xMiljaPeura_dev
    Terminal-Bench 那個分數有爭議,跑分時改了資源配置,換了配置之後的分數還能不能代表同一個 benchmark?我持保留意見。

  • 頭像
    JaniceBrown
    最看好的用法是 debugging 和事故響應:先讓它 grep 日誌、跑 profiler、整理報告,再把結論丟給更強的模型去修。tool call 動輒成百上千次,單次失敗率哪怕只有幾個百分點,累計起來的 token 成本和超時都很可觀,好在 bash、HTTP 這類常見工具靠校驗加重試基本能兜住。

  • 頭像
    Web3Kine
    影象識別測試裡判斷圖中食物能不能吃,它答對了,同一道題 Claude Fable 5 沒過,多模態這塊是真有東西。

  • 頭像
    Megan_Brooks_X1
    實際用下來整體質量不如 Sonnet,工具呼叫強不等於整體更好,別被榜單帶節奏。

  • 頭像
    冬雪_4
    cached input 的價格才是關鍵,多輪 coding 和 agent 工作流會大量複用上下文,快取價低才是真省錢,光看標價沒意義。

  • 頭像
    LawrenceMorales_2021
    模型和 API 放在同一個釋出框架裡推,價格戰訊號太明確了,Meta 拿廣告現金流補貼模型,輸入輸出成本比 Anthropic 和 OpenAI 低五成以上,廣告業務 2025 年運營收入還在漲 20%,彈藥充足。同期還官宣了自研晶片 Iris,博通設計臺積電代工,擺明了要降低對英偉達的依賴,這仗 OpenAI 和 Anthropic 真不好接。

  • 頭像
    heavydog556
    看完定價我把手裡幾個 agent 專案的賬單重新算了一遍,輸入 1.25 輸出 4.25 美元一百萬 token,大概只有同級競品的四分之一,超級個體的成本結構真的要變了。

  • 頭像
    SGarcia_88944
    有人在 Julius 的程式碼工作臺裡直接讓它寫出並跑起來整套《我的世界》遊戲工程,看得我目瞪口呆。

  • 頭像
    史琪
    小扎時隔三年重返 X 發的第一條帖子就是官宣這個模型,還是在馬斯克的地盤上,傳播這塊拿捏得死死的。

  • 頭像
    EGutierrez_88
    iPad 版 Meta AI 穩定性太差了,頻繁閃退,輸出文字還亂碼斷裂,模型再強客戶端這麼拉胯也白搭。

  • 頭像
    Diana.Sanchez_770
    Simon Willison 拿到幾天預覽許可權做了經典的鵜鶘騎腳踏車 SVG 測試,他說評估報告裡兩個 Muse Spark 互相聊自身存在的那段特別有意思,看完我也去翻了原文,確實好玩。

  • 頭像
    Christian.Perry9
    讓它做個普通的 Excel 表格都能翻車,說好的 agent 呢。