Kimi學會了「自己幹活」:中國大模型坐到了全球AI牌局主桌

月之暗面K3大模型開啟Agent能力新正規化

2026-07-30 07:05
Kimi學會了「自己幹活」:中國大模型坐到了全球AI牌局主桌
Kimi學會了「自己幹活」:中國大模型坐到了全球AI牌局主桌

月之暗面(Kimi)兩週前扔出的K3大模型,正在改變全球AI行業對中國大模型的認知。瑞銀分析師將其稱為「第二個DeepSeek時刻」。但這一次,敘事邏輯完全不同——K3帶來的不再是「更便宜的模型」,而是「會自己幹活的模型」。

過去兩年,中國大模型的競賽主線很簡單:用更低成本訓練出逼近GPT-4效能的模型。DeepSeek的嶛起證明了這條路走得通,但它也將行業推入了一場「燒錢換引數、堆卡換效能」的消耗戰。一個無法迴避的事實是,純粹的模型效能比拼正在陷入邊際效益遞減——使用者不關心各家模型的分數和排名,只關心程式能不能跑通、結果是否可靠。

Agent能力的躍遷,恰好打破了這一僵局。Kimi K3的獨到之處在於,它不再是「一問一答」的聊天工具,而是像一名人類分析師那樣,規劃任務、檢索資訊、呼叫工具、並行協作、交付成果。據月之暗面官方披露,K3在生成一個AI ASIC行業研究網站時,經歷了120輪以上遞迴改進,完成2800次以上網頁搜尋與抓取1100次以上終端資料呼叫,處理超過1.1萬頁內容,覆蓋87份季度報告和99份原始PDF。

這些任務已不再是傳統意義上的一次問答,而是由檢索、執行、校驗、繪圖和修改組成的長鏈路流程。支撐這種長程執行能力的,是一套完整Agent基礎設施的重新設計。據技術報告披露,K3訓練和評估期間共建立了超過5100萬個沙箱,使長任務可以在等待模型推理時暫停釋放資源,在模型生成下一步動作後快速恢復。這相當於把一次幾分鐘的回答,拉長成一條可持續數小時的執行鏈。

模型能力的躍遷也反映在硬性評測中。K3在Program Bench中得分77.8,超過GPT-5.6 Sol的77.6;在FrontierSWE中得分81.2,較GPT-5.6 Sol和Claude Opus 4.8分別高出9.9和14.5。有工程師在社交平臺上稱,在智慧體工作流中,K3的表現接近Claude Fable 5,但成本顯著降低。

真正值得關注的是,Kimi走出了一條與國內同行截然不同的商業化路徑。與智譜AI、百度文心等以B端企業服務為主的廠商不同,Kimi自誕生起就選擇直面C端使用者。這條路曾備受質疑——C端使用者付費意願低、獲客成本高,此前並無成功案例。但Kimi的堅持在2025年下半年開始顯現回報。公司海外收入已超過國內收入,全球付費使用者在K2.5釋出後實現4倍增長。在第三方平臺OpenRouter上,K2.5排名已升至第三位,僅次於Claude Sonnet 4.5和Gemini 3 Flash。

K3的API定價也印證了這種自信:快取命中輸入0.30美元/百萬Token、未命中輸入3.00美元/百萬Token、輸出15.00美元/百萬Token,輸出價格已與GPT-5.6 Terra相當。瑞銀證券分析師指出,K3定價在國產模型的高階位置,恰恰說明真正好的模型能力有溢價權。

往後看,Kimi的路徑選擇正在影響整個行業對「中國大模型能做什麼」的認知邊界。2026年1月,英偉達CEO黃仁勳在CES主題演講中,用Kimi K2 Thinking取代DeepSeek-R1作為演示Rubin NVL72系統的案例,這一細節被市場解讀為中國大模型話語權的提升。據瑞銀調研,目前中國頭部模型訓練成本約為海外領先模型的十分之一,API價格通常只有海外同類模型的10%至20%,同時國內模型廠商API業務仍能保持20%至40%的毛利率。

不過競爭遠未到終局。月之暗面創始人楊植麟坦言,Agent叢集的規模化訓練在技術上仍有挑戰。如何在C端持續擴大付費使用者規模、在B端創造更穩固的企業收入、在全球化程序中應對地緣政治與合規風險,仍是未解之題。但至少,在這個由Agent重新定義應用正規化的時代,來自中國的創新者已經坐上了牌桌——不再只是旁觀者。