Muse Spark 1.1
Meta 超级智能实验室推出的旗舰多模态推理模型,专为 Agent 任务与编程打造,百万 token 上下文,价格仅为同级竞品四分之一
深度报告
-
Muse Spark 1.1 是 Meta 超级智能实验室于 2026 年 7 月 9 日发布的新旗舰多模态推理模型,专为 Agent 任务打造,主打工具调用、电脑操作、编程和多模态理解,上下文窗口达 100 万 token。它同时带来了 Meta 首个付费开发者接口 Meta Model API,定价每百万输入 token 1.25 美元、输出 4.25 美元,约为同级竞品的四分之一,被普遍解读为一场针对 OpenAI 和 Anthropic 的价格战。扎克伯格时隔三年多重返 X 平台亲自站台,标志着 Meta 从开源 Llama 路线向闭源收费模式的重大转向。模型在工具调用和职业场景测试中拿下多项第一,但也伴随 Terminal-Bench 刷榜争议和客户端稳定性吐槽。
-
Muse Spark 1.1 出自 Meta 超级智能实验室(Meta Superintelligence Labs),是 Meta 重组 AI 团队、豪掷重金挖角后的首个标志性成果。发布当天,扎克伯格在 X 上发出三年多来的第一条帖子,称其为「一个价格极低的强力 Agent 与编程模型」,马斯克随即隔空回应,两人互动本身就成了新闻。分析人士认为,选择在竞争对手的平台上官宣,是刻意为之的传播策略。 这次发布的战略意义大于单纯的模型迭代。Meta 过去以开放权重的 Llama 系列著称,而 Muse Spark 1.1 是闭源模型,且首次通过付费 API 对外商用,意味着 Meta 正式加入 OpenAI、Anthropic 所在的企业级模型收费市场。据新浪财经等媒体报道,Meta 同期还启动了自研 AI 芯片「Iris」计划,联合博通设计、台积电制造,试图降低对英伟达和 AMD 的依赖,支撑明年算力翻倍的目标。模型将逐步替换 WhatsApp、Instagram、Facebook 和智能眼镜里由 Llama 驱动的聊天机器人,覆盖 Meta 数十亿用户的产品矩阵。
-
Muse Spark 1.1 是一个多模态推理系统,支持文本、图像、视频、音频和文件输入,上下文窗口 1,048,576 token,是上一代的四倍。它能围绕用户目标规划任务、调用外部工具、编写和调试代码,并在多步骤长流程任务中保持上下文连贯。Meta 称模型「知道什么时候该写脚本自动化、什么时候直接点界面」,可以在多个应用之间穿梭执行任务,面对陌生界面也只需极少的人工干预。 针对多智能体自动化工作流,模型引入了上下文压缩机制:主 Agent 负责生成项目计划,子 Agent 分头执行,执行过程中产生的海量数据会被压缩保留最关键的细节,需要时可回溯此前的工作成果,在不同子任务之间传递信息。这一设计直击 Agent 工作流中「上下文爆炸」的痛点。在 Meta 的内部演示中,工程师让它根据一句提示生成聊天应用,模型能自动截图程序界面、识别技术问题并定位到出错的代码片段进行修复。多模态方面,它可以根据用户拍摄的视频提取商品信息,在 Facebook 二手市场代替用户完成商品发布,也能一边生成代码一边完成订餐这类现实任务。 社区实测反馈总体积极。开源开发者 Simon Willison 拿到几天预览权限后做了经典的「鹈鹕骑自行车」SVG 测试,并对模型评估报告中两个 Muse Spark 互相对话、谈论自身存在的片段印象深刻。Julius AI 创始人在代码工作台里直接让它写出并运行整套《我的世界》游戏工程。还有用户测试图像识别,让模型判断图中食物能否食用,Muse Spark 1.1 通过了测试,而对照的 Claude Fable 5 没有通过。
-
定价是这次发布最锋利的武器。Meta Model API 公开预览版面向美国开发者开放,每百万输入 token 收费 1.25 美元、输出 4.25 美元,大约只有 GPT-5.5、Claude Opus 4.8 同级产品的四分之一,新用户还送 20 美元免费额度。据新浪财经报道,其输入输出成本比 Anthropic 和 OpenAI 产品低 50% 以上,底气来自广告业务的利润支撑——Meta 2025 年运营收入增长 20%,2026 年加速至 30%。 社区讨论普遍认为这首先是一场价格战而非纯粹的能力突破。Hacker News 上的开发者反复强调 cached input 价格的重要性,因为多轮编程和 Agent 工作流会大量复用上下文,缓存价直接决定实际成本。对于每天跑几十万次 Agent 调用的团队来说,4.25 美元的输出单价让大规模 Agent 批处理在经济上变得可行。商业路径上,Meta 一手用低价 API 抢开发者,一手把模型铺进自家消费级产品(Meta AI 应用新增「Thinking」模式),形成 B 端 C 端双线变现。
-
正面评价集中在工具调用和长上下文。多位开发者反馈它的 tool calling 成功率高于 GPT-5.5 的首轮 Agent 链路,最被看好的场景是调试、诊断和事故响应:先 grep 日志、跑性能分析、整理报告,再把结果交给更强的模型修复。百万 token 窗口在实测中经受住了压力测试,跨大型代码库和多文件检索的表现稳定,不需要切块或摘要。 负面反馈也不少。有用户吐槽搭载新模型的 Meta AI iPad 客户端稳定性极差,频繁闪退、输出文本乱码断裂;还有人抱怨 Meta AI 连一个普通的 Excel 表格都做不好。部分开发者直言它的整体质量不如 Claude Sonnet 系列,「工具调用强不等于整体更好」。也有人认为对一个尚无口碑积累的新模型来说,这个定价其实不算便宜,除非质量真能稳定接近头部水平。
-
第三方基准测试勾勒出它的能力轮廓:强在 Agent,不弱于编程,但不是全面第一。Meta 公布的内部测试中,它在 MCP Atlas 工具调用测试拿到 88.1 分排名第一,高于 Claude Opus 4.8 的 82.2 和 GPT-5.5 的 75.3;JobBench 职业场景工具使用测试 54.7 分同样第一。计算机操作方面,OSWorld-Verified 得分 80.8,仅次于 Opus 4.8 的 83.4;Terminal-Bench 2.1 得 80 分,SWE-Bench Pro 得 61.5 分。Vals AI 榜单显示它在综合指数排第 4(准确率 68.41%),多模态指数排第 6;在金融 Agent、企业金融分析测试中排第 2,医疗记录处理排第 1,法律、税务、医疗文书三大垂直行业测试全部拿下第一,且法律 Agent 任务拉开明显差距。Artificial Analysis 智能指数三个月内涨了 8 分,跻身得分超过 50 的四个前沿模型之列(另外三个是 GPT-5.5、Opus 4.8 和 Kimi K3)。 媒体解读的焦点在战略层面。智东西、TechCrunch 等媒体把它视为 Meta 从「开源换生态」转向「闭源收费」的分水岭,也是 AI 编程工具市场的新变量。行业分析普遍认为,Meta 用激进的 token 定价换用户和曝光,短期内会给 Anthropic 和 OpenAI 的企业客户报价带来实际压力。
-
最大的技术争议是 Terminal-Bench 刷榜风波。有社区成员发现 Meta 在跑该基准时调整了资源配置,引发「换了资源配置后分数还能不能代表同一个 benchmark」的争论,部分开发者据此对官方分数打了折扣。其次是可靠性质疑:Meta 计划到 2026 年底用 AI 替换 90% 的内容审核人员,而上月有报道披露 Meta 的 AI 客服 Agent 曾错误地把约两万个 Instagram 账号的访问权限交给黑客。当公司力推能代表用户行动的 Agent 时,这段历史让外界对其安全把控能力保持警惕。 路线转向本身也有代价。放弃开放权重让依赖 Llama 自部署的社区感到被抛弃,需要私有化部署或开源权重的团队只能退回 Llama 系列或转投 Kimi K3 等开源替代。此外,投资圈对 Meta「多线出击、缺乏聚焦」的质疑仍在——自研芯片、超级智能实验室、元宇宙多头并进,短期内会推高资本支出,而元宇宙的前车之鉴犹在。
-
这款模型最适合构建 Agent 工作流的开发团队:MCP 多工具编排、跨应用自动化、长上下文代码库问答、大批量 Agent 调用等场景,它的成功率和单价组合在当前市场几乎没有对手。预算敏感、调用量大的初创公司和独立开发者也值得一试,20 美元免费额度足够跑完一轮完整评估。反过来,追求极限代码能力的团队可能仍会留在 Claude Opus 4.8;需要开源权重、本地部署或数据不出域的企业则不适合,它是纯 API 闭源产品,没有私有化路径。普通用户可以在 Meta AI 应用的「Thinking」模式中免费体验,但目前客户端稳定性问题尚未完全解决,重要工作不建议依赖。
-
Muse Spark 1.1 是 Meta 用「四分之一价格 + Agent 长板」对企业级 AI 市场发起的正面强攻,能否守住口碑取决于刷榜争议的澄清和实际生产环境中的可靠性表现。短期看,它至少把前沿模型的价格锚点狠狠拉低了一档;长期看,Meta 自研芯片和广告现金流的组合,让这场价格战有可能打得比对手预想的更久。
用户评论
-
Janet_Green007—Meta 打算年底前用 AI 换掉九成内容审核员,上个月还爆出 AI 客服把两万个 Instagram 账号权限错发给黑客,现在又推能替用户操作的 agent,我对它的安全把控是存疑的。 -
Benjamin_RamirezSr—压力测试下 1M 上下文在多文件代码库里的检索表现挺稳,主动上下文压缩把长会话质量撑住了,跑了一个小时的 agent loop 指令遵循也没崩。它还能接音频和视频输入,同价位的 GPT-5.5 和 Opus 4.8 都没完全跟上这个输入范围,多模态这块算是个安静的差异化优势,整体比我预期好不少。 -
kc7fg—需要开源权重或者本地部署的可以散了,这是纯 API 闭源产品,没有私有化路径,要自托管只能回头用 Llama 或者 Kimi K3。做这个模型的超级智能实验室和 Llama 开源团队是分开运作的,一个专攻付费前沿性能,一个继续开源,Meta 这是两条腿走路,但对数据不能出域的企业来说等于没得选。 -
TokenTiger152_eth—算了笔账,一个每天处理 500 通客服对话的生产 agent,平均每通 4 万输入 3 千输出 token,跑 Muse Spark 1.1 一天 31 美元出头,一个月九百多刀;同样的活儿放 GPT-5.6 Sol 上一天要 145 刀。对工具调用密集型的业务来说,这个差价不是省钱,是直接改商业模式。 -
MMorales_9990—注意官方对比的是 GPT-5.5 和 Opus 4.8,发布同一周人家新一代就出了,拿上一代当对照组是惯常操作,但看分数的时候心里要有数。 -
MetcPro—1.0 到 1.1 才隔三个月,内部测试 pass@1 从 48.1% 跳到 67%,这个迭代速度有点吓人。 -
ERuiz_7744—1M 窗口是真的,但 MRCR 长上下文检索分只有 54.1,窗口长不等于找得准,塞满百万 token 之后关键信息召回不是前沿水平,重要场景还是得自己做检索。 -
AnthonyRamirez—美国以外暂时用不了 API,欧盟连时间表都没有,海外团队先别把架构押在它身上。新用户送 20 刀额度,大概能跑 470 万输出 token,做一轮完整评估足够了。 -
RBaileyJr—幻觉率是硬伤,Artificial Analysis 测出来 38%,这一代模型里几乎最高。我自己用也碰到它一本正经编事实。agent 榜单它是领先,但纯编程 SWE-Bench Pro 61.5 输给 Opus 4.8 的 69.2,而且它话多,得出答案要消耗比平均更多的 token,实际成本和响应时间都被拉长了,重要答案必须自己核一遍。 -
MarilynMyersX—工具调用是真的强,跑 MCP 几乎不掉链子! -
PinjaWalli—又快又便宜,用起来很顺手,但它不是王者,快但不是最快,聪明但不是最聪明。 -
Amy_Hill369—截图驱动调试的演示挺惊艳,它自己搭了个聊天应用,自动截图检查界面,发现 bug 追溯到具体代码行,修完再截图验证,这个看改验闭环对前端开发太实用了。还有个沙箱演示,只给它 run 和 write_file 两个工具外加一个一次性 Docker 容器,它自己选了全部 48 条 shell 命令修好一个 SWE-bench 的 bug,还会翻 git 历史找引入问题的那次提交,你只用给容器和目标,不用给脚本。 -
DianeHern_andez—从 Llama 开放权重到闭源收费 API,Meta 这个转身够彻底的,靠 Llama 自部署的社区这回算是被抛弃了。而且新模型会逐步替换掉 WhatsApp、Instagram、Facebook 和智能眼镜里那些由 Llama 驱动的聊天机器人,等于自家几十亿用户的产品矩阵全部换血,开源路线看来真的翻篇了。 -
crazypeacock280—Meta 这次不是普通的模型更新,是直接冲着 AI 编程工具市场来的,修代码漏洞、做大型代码迁移、跨多个应用调工具全都能干,做编程工具的这些家伙要紧张了。 -
AdrijanaKapetanović—API 完全兼容 OpenAI 格式,把 base_url 换成 api.meta.ai/v1、model 名一改就能跑,现有代码基本不用动,迁移成本几乎为零,想做 A/B 测试的团队直接冲。 -
xMiljaPeura_dev—Terminal-Bench 那个分数有争议,跑分时改了资源配置,换了配置之后的分数还能不能代表同一个 benchmark?我持保留意见。 -
JaniceBrown—最看好的用法是 debugging 和事故响应:先让它 grep 日志、跑 profiler、整理报告,再把结论丢给更强的模型去修。tool call 动辄成百上千次,单次失败率哪怕只有几个百分点,累计起来的 token 成本和超时都很可观,好在 bash、HTTP 这类常见工具靠校验加重试基本能兜住。 -
Web3Kine—图像识别测试里判断图中食物能不能吃,它答对了,同一道题 Claude Fable 5 没过,多模态这块是真有东西。 -
Megan_Brooks_X1—实际用下来整体质量不如 Sonnet,工具调用强不等于整体更好,别被榜单带节奏。 -
冬雪_4—cached input 的价格才是关键,多轮 coding 和 agent 工作流会大量复用上下文,缓存价低才是真省钱,光看标价没意义。 -
LawrenceMorales_2021—模型和 API 放在同一个发布框架里推,价格战信号太明确了,Meta 拿广告现金流补贴模型,输入输出成本比 Anthropic 和 OpenAI 低五成以上,广告业务 2025 年运营收入还在涨 20%,弹药充足。同期还官宣了自研芯片 Iris,博通设计台积电代工,摆明了要降低对英伟达的依赖,这仗 OpenAI 和 Anthropic 真不好接。 -
heavydog556—看完定价我把手里几个 agent 项目的账单重新算了一遍,输入 1.25 输出 4.25 美元一百万 token,大概只有同级竞品的四分之一,超级个体的成本结构真的要变了。 -
SGarcia_88944—有人在 Julius 的代码工作台里直接让它写出并跑起来整套《我的世界》游戏工程,看得我目瞪口呆。 -
史琪—小扎时隔三年重返 X 发的第一条帖子就是官宣这个模型,还是在马斯克的地盘上,传播这块拿捏得死死的。 -
EGutierrez_88—iPad 版 Meta AI 稳定性太差了,频繁闪退,输出文本还乱码断裂,模型再强客户端这么拉胯也白搭。 -
Diana.Sanchez_770—Simon Willison 拿到几天预览权限做了经典的鹈鹕骑自行车 SVG 测试,他说评估报告里两个 Muse Spark 互相聊自身存在的那段特别有意思,看完我也去翻了原文,确实好玩。 -
Christian.Perry9—让它做个普通的 Excel 表格都能翻车,说好的 agent 呢。