Meta 甩出 Muse Spark 1.1,程式設計智慧體榜單一夜易主
扎克伯格三年來首條推文為它站臺
7月21日前後,Meta 扔下一顆炸彈:全新程式設計與智慧體模型 Muse Spark 1.1 正式亮相,連沉寂三年的扎克伯格都專門發推文站臺。這款模型直接瞄著 OpenAI 的 GPT-5.6 和 Anthropic 的 Claude Opus 4.8,擺明了要在企業開發者錢包裡搶地盤。
亮眼的是一組基準成績。Muse Spark 1.1 在 MCP Atlas、JobBench、Humanity 的 Last Exam 和 Finance Agent V2 四個衡量智慧體能力的榜單上都拿到第一。更誇張的是法律智慧體基準 Vals AI Harvey,它拿到 20% 的分數,而 Claude Fable 5 只有 11%,幾乎翻倍。對一個新模型來說,這種開局相當兇猛。
長上下文和跨端操作是它的另一張名片。模型配備 100 萬詞元(token)的上下文視窗,並且能在桌面、瀏覽器和手機上直接「用電腦」——也就是自己開啟陌生介面、在多個應用之間串起工作流,不需要人一步步指揮。早期合作伙伴名單也很豪華:Replit、Cline、Box 都在列。
價格上 Meta 打得夠狠。每百萬輸入詞元 1.25 美元、輸出 4.25 美元,比 OpenAI 和 Anthropic 的同檔產品都低。值得注意的是,它目前仍然是閉源,沒有開放權重。這標誌著 Meta 從「開源 AI 旗手」轉向了雙線策略:一邊保留開源遺產,一邊用閉源模型正面競爭。
執掌 Meta 超級智慧實驗室的 Alexandr Wang(Scale AI 創始人)給它的評價是「智慧體任務和程式設計最強模型」。話裡話外,Meta 已經不滿足於當那個開源的好好先生。靠著更低的價格和更強的基準,它想從 OpenAI、Anthropic 手裡分走企業開發者的預算。
話說回來,基準第一不等於落地第一。程式設計智慧體的戰場,最終要看開發者願不願意把核心工作流遷過來。Meta 這次把價格和夥伴牌都亮了出來,但真正考驗在於:當企業真的用 Muse Spark 1.1 跑生產任務時,它能不能穩住那份漂亮的成績單。