深度报告
-
Muse Spark 是 Meta 于2026年4月8日发布的新一代AI模型,由新成立的 Meta Superintelligence Labs(MSL)开发。该模型是Meta闭源路线的首个产品,在医疗问答、图表理解等领域表现突出,HealthBench Hard 得分远超竞品,Contemplating 深度推理模式在 HLE 基准测试中排名全球第三。但同时在抽象推理和编码智能体任务上存在明显短板,与 GPT-5.4、Gemini 3.1 Pro 等头部模型仍有差距。目前产品通过 meta.ai 网页版免费开放使用,API 处于私有预览阶段。
-
2025年6月,Meta 斥资143亿美元收购了数据标注公司 Scale AI 的近半数股权,并挖来其联合创始人、年仅29岁的 Alexandr Wang,出任公司史上第一位首席 AI 官。2025年7月,Meta 组建了全新的精英部门——Meta 超级智能实验室(Meta Superintelligence Labs,MSL),由 Alexandr Wang 全权负责,目标是打造面向个人超智能的 AI 系统。 在此之前,Meta 的 AI 之路并不平坦。2024年发布的 Llama 4 Maverick 在行业测评中表现不佳,Artificial Analysis 智能指数仅获18分,排名垫底。2026年4月8日发布的 Muse Spark(内部代号“牛油果”)是 MSL 潜心九个月打造的全新大模型,也是 Meta 首次放弃开源路线,转向闭源策略的产品。该模型的发布标志着 Meta 在 AI 领域的一次重大战略转向。 Meta Platforms Inc.(NASDAQ: META)是全球最大的社交网络公司之一,旗下拥有 Facebook、Instagram、WhatsApp 等核心产品。公司在 AI 领域的投入持续加大,2025年财报显示 AI 相关研发投入已超过500亿美元。Muse Spark 的发布被视为 Meta 重新争夺 AI 市场主导权的关键一步。
-
Muse Spark 提供三大核心功能:首先是262K 超长上下文窗口,支持262,144个 token 的上下文长度,可完整分析大型代码库、长篇法律文档或学术论文。其次是多模态统一输入能力,原生支持文本、图像和语音的融合输入,具备“视觉思维链”能力,可在动态环境中进行物体识别和视频分析。第三是沉思模式(Contemplating Mode),这是 Muse Spark 的核心差异化功能,支持多智能体并行深度推理,可同时协调多个 AI 智能体解决复杂科学和数学问题。 Muse Spark 提供三级推理模式:快速模式(Fast Mode)适合日常任务,响应速度快但推理深度有限;标准模式提供平衡的推理能力和响应速度;沉思模式消耗最多计算资源但提供最深度的推理能力,适合需要深度思考的科学和数学问题。 目前 Muse Spark 已接入 Meta AI 网页版和应用,在未来几周内将逐步扩展至 WhatsApp、Instagram、Facebook、Messenger 等 Meta 旗下产品。更值得注意的方向是,Muse Spark 将被嵌入 Meta 的智能眼镜产品中,实现类似 Google Gemini 深度融入 Google 产品生态的体验。
-
meta.ai 网页版 免费 已上线,无使用限制 API 接口 未公布 私有预览阶段 Meta 表示 API 访问目前仅向部分合作伙伴开放私人预览,尚未公布正式定价和公开发布日期。这一策略与 OpenAI 的 GPT 系列和 Google 的 Gemini 系列类似初期采用邀请制,后续逐步开放。 从产品定位来看,Muse Spark 主要面向三类用户:首先是研究者群体,特别是医疗和科学领域的研究者,模型在 HealthBench 和 FrontierScience 基准测试中的表现优异;其次是企业用户,DeepSearchQA 和 GDPval-AA 等办公综合任务表现突出;第三是普通用户,可通过免费的 meta.ai 网页版体验基础功能。
-
从行业反馈来看,Muse Spark 获得了一定程度的认可。医疗领域从业者对模型在医学问答上的表现给予高度评价,HealthBench Hard 得分42.8分,是 Claude Opus 4.6 的近三倍。多模态图表理解能力获得积极反馈,CharXiv Reasoning 86.4分显著领先竞品。Contemplating 深度推理模式被评价为“最具创新性的推理架构”,在 HLE 基准测试中排名全球第三,展现了计算资源堆叠后的巨大潜力。 然而,批评声音同样明显。抽象推理能力存在代差,ARC-AGI-2 得分42.5分,与头部模型的77.1分差距超过20分,被评价为“存在明显的能力缺口”。编码智能体任务全面落后,Terminal-Bench 2.0 排名五家最后。部分多模态任务表现不佳,ZeroBench 得分33.0分,是五家模型中最低的。
-
TechCrunch 评价称这是 Meta 自 Alexandr Wang 加入以来发布的首款模型,代表了“从根本上重建 AI 技术栈”的努力。腾讯新闻报道指出 Meta 股价在消息公布后应声上涨6%,市场对这款产品寄予厚望。知乎专栏文章分析认为 Muse Spark 标志着 Meta 从 Llama 开源时代向闭源时代的战略转型。 行业分析指出 Muse Spark 的核心优势在于医疗和图表理解两个垂直领域,但整体竞争力尚未达到挑战头部模型的水平。DataLearnerAI 的评测分析认为该模型是一个“特定领域领先、整体跟随”的产品,Contemplating 模式是最值得关注的差异化亮点,但要想在综合能力上与 GPT-5.4 和 Gemini 3.1 Pro 竞争,仍需在抽象推理和编码智能体两个短板上持续投入。
-
Meta 曾是开源大模型的旗手,Llama 系列模型以开放权重著称,推动了全球 AI 开源社区的发展。Muse Spark 转向闭源引发了关于 Meta 是否“背弃”开源社区的讨论。部分开发者社区成员表达了不满,认为 Meta 现在“既要闭源赚钱,又要开源社区贡献代码”。 Muse Spark 在部分关键基准测试中的表现与头部模型存在两位数的差距,特别是在 ARC-AGI-2 抽象推理和编码智能体任务上。这不仅影响产品在开发者心中的地位,也可能在企业采购决策中成为阻碍。Meta 需要在下一代产品中快速弥补这些短板。 目前 API 处于私有预览阶段,尚未公布正式定价。市场担忧其定价可能对标 OpenAI GPT-5 和 Google Gemini Pro 级别,对于个人开发者和小型团队而言可能门槛较高。
-
Muse Spark 最适合三类用户:医疗领域从业者(如医生、医学研究者、医疗 AI 开发者)将获得最佳体验,这部分用户在 HealthBench 和 MedXpertQA 上的表现远超竞品;需要图表理解能力的数据分析师和科研人员也将受益,CharXiv Reasoning 86.4分是当前最高水平;深度推理需求的学术研究者可以使用 Contemplating 模式处理复杂科学和数学问题。 对于需要强编码能力的软件工程师,Muse Spark 在 Terminal-Bench 和 SWE-bench 上的表现落后于竞品,建议选择 GPT-5.4 或 Claude Opus 4.6。对于需要强抽象推理能力的用户,ARC-AGI-2 得分与头部存在代差,不建议作为首选。对于需要完整 API 支持的企业用户,建议等待 API 正式发布并进行成本评估后再做决定。 竞品选择包括:GPT-5.4(综合能力强,适合开发者)、Gemini 3.1 Pro(Google 生态整合深入、Claude Opus 4.6(编码能力突出)。
-
Muse Spark 是 Meta 在 AI 领域的一次重要尝试,凭借医疗问答和图表理解两个垂直领域的突出表现,展示了差异化竞争的潜力。但综合能力上与 GPT-5.4、Gemini 3.1 Pro 仍有差距,特别是在抽象推理和编码智能体两个维度。对于医疗和科研用户这是一款值得关注的产品,对于追求全面能力的用户建议继续观望。
用户评论
-
谭君静—试了一下meta.ai上的Muse Spark,图像分析功能太强了,能准确识别图片中物体的位置和数量,这对科研党来说太香了! -
姜萱—免费版还要什么自行车,meta.ai直接能用,还要啥GPT-5 -
MsNeeaKalas_x—对比了Claude Opus 4.6和GPT-5.4,Muse Spark在医疗问答上确实领先,但编码能力还是有差距,Terminal-Bench 2.0表现拉胯。 -
Cynthia_Hicks_20227—Arc AGI-2得分42.5,和头部77分差距20+,这波属于是还没完全体的状态。 -
COpet—闭源了,开发者社区一片哀嚎,之前用Llama系列用得好好的,突然就不开源了。 -
O0YMFWFO—262K上下文太香了,塞一整本小说进去做分析完全没问题。 -
MiaMiller—沉模式(Contemplating Mode)确实牛,HLE排名第三,推理能力比标准模式强不是一点半点,就是推理时间太长了,等得花儿都谢了。 -
oxalvddc5—用了两天,感觉CharXiv图表理解86.4分不是白给的,看论文pdf特别准。 -
koFIS—测了图像生成,能准确检测图像中的物体和位置,visual_grounding工具很好用! -
Amy304—Python执行环境带pandas和numpy,做数据分析很方便。 -
joGUT—Meta这波转型闭源,不知道葫芦里卖的什么药。 -
Amanda_Jones722—HealthBench Hard 42.8分吊打Claude Opus 4.6的14.8,医疗领域yyds! -
月光_24—API还处于私人预览阶段,开发者还需要再等等。 -
GRcox—从18分到52分,Meta算是把Llama 4的债还上了。 -
Eagl_eEdgeHolm—Meta股价涨6%,资本市场的反应比开发者社区真实多了。 -
KPerez_88—和GPT-5.4、Gemini 3.1 Pro对比了一下,各有胜负吧,医疗和图表理解是强项。 -
324slm—多模态统一输入架构确实有点东西,不是后期拼接的。 -
CMoore—Meta从开源到闭源,这次是真的变天了。 -
JacobButler—Alexandr Wang加入后首个作品,143亿美元没白花!