四大模型一週內集體更新,比拼的標尺悄悄換了

從「跑分」轉向 Agent、工具呼叫與更低成本

2026-07-15 08:43

過去一週,AI 圈有點擠:Anthropic 的 Claude Fable 5 重新上線,OpenAI 推 GPT-5.6,xAI 出 Grok 4.5,Meta 發 MuseSpark 1.1。四家都自稱全球最強,或者同等效能下更便宜。但真正值得注意的是,大家口中的關鍵詞高度一致——程式設計、Agent、工具呼叫、低成本

跑分和引數不再是主角。GPT-5.6 是跟著 ChatGPT Work 這類 Agent 工具一起發的,強調的是「執行」而不是「答題」;Grok 和 MuseSpark 也都壓在程式設計和 Agent 工作流上。Artificial Analysis 有句話很準:AI 競爭正從「短題智商測試」進入「長程任務耐力賽」,比的是把一件事從頭幹完。

這背後是 Scaling Law 沒失效,但「Scaling」的物件擴圈了——不再只是堆引數堆算力,而是把強化學習、推理時計算、上下文管理、多 Agent 協作都算進智慧系統。模型正在從「工具」往「生產力」走,能接瀏覽器、終端、資料庫,自己跑流程。

Anthropic 的 Mythos 和 Fable 最讓人意外的是在程式設計、推理、網路安全上的突躍,甚至能發現電網、銀行等關鍵基礎設施的漏洞。這種能力躍遷,才是企業願意買單的理由,而不是榜單第一;安全場景的剛需,比聊天機器人紮實得多。

我更傾向於認為,單純爭論「哪個模型第一」已經沒多大意義。接下來比的是:你的模型能不能穩定跑完一個長任務、能不能接工具、成本能不能壓下來。這恰恰是咱們選 AI 標的時該盯的硬指標,而不是刷分的數字遊戲。

對投資而言,模型迭代加速意味著應用層的切換成本在下降——今天捧一家,明天可能就被開源或競品追平。真正有護城河的,是握著分發入口、工作流和資料的平臺,而不是單純「模型更強」那一下。算力的錢,反而比模型本身更好算賬。

對應用層創業者來說,模型更新加速其實是雙刃劍:今天你基於某模型做的產品,明天可能就被原廠功能覆蓋。真正的壁壘要落在工作流、資料和行業 know-how 上,而不是「調哪個模型」這一下。把模型當水電,才不會被迭代甩下車,也別把護城河寄託在別人的更新節奏上。