四大模型一周内集体更新,比拼的标尺悄悄换了
从「跑分」转向 Agent、工具调用与更低成本
过去一周,AI 圈有点挤:Anthropic 的 Claude Fable 5 重新上线,OpenAI 推 GPT-5.6,xAI 出 Grok 4.5,Meta 发 MuseSpark 1.1。四家都自称全球最强,或者同等性能下更便宜。但真正值得注意的是,大家口中的关键词高度一致——编程、Agent、工具调用、低成本。
跑分和参数不再是主角。GPT-5.6 是跟着 ChatGPT Work 这类 Agent 工具一起发的,强调的是「执行」而不是「答题」;Grok 和 MuseSpark 也都压在编程和 Agent 工作流上。Artificial Analysis 有句话很准:AI 竞争正从「短题智商测试」进入「长程任务耐力赛」,比的是把一件事从头干完。
这背后是 Scaling Law 没失效,但「Scaling」的对象扩圈了——不再只是堆参数堆算力,而是把强化学习、推理时计算、上下文管理、多 Agent 协作都算进智能系统。模型正在从「工具」往「生产力」走,能接浏览器、终端、数据库,自己跑流程。
Anthropic 的 Mythos 和 Fable 最让人意外的是在编程、推理、网络安全上的突跃,甚至能发现电网、银行等关键基础设施的漏洞。这种能力跃迁,才是企业愿意买单的理由,而不是榜单第一;安全场景的刚需,比聊天机器人扎实得多。
我更倾向于认为,单纯争论「哪个模型第一」已经没多大意义。接下来比的是:你的模型能不能稳定跑完一个长任务、能不能接工具、成本能不能压下来。这恰恰是咱们选 AI 标的时该盯的硬指标,而不是刷分的数字游戏。
对投资而言,模型迭代加速意味着应用层的切换成本在下降——今天捧一家,明天可能就被开源或竞品追平。真正有护城河的,是握着分发入口、工作流和数据的平台,而不是单纯「模型更强」那一下。算力的钱,反而比模型本身更好算账。
对应用层创业者来说,模型更新加速其实是双刃剑:今天你基于某模型做的产品,明天可能就被原厂功能覆盖。真正的壁垒要落在工作流、数据和行业 know-how 上,而不是「调哪个模型」这一下。把模型当水电,才不会被迭代甩下车,也别把护城河寄托在别人的更新节奏上。