Cognition釋出SWE-1.7:基於Kimi K2.7、每秒1000 token逼近GPT-5.5

開源基座再RL

2026-07-12 14:50

做Devin程式設計智慧體的Cognition,又放出新模型SWE-1.7。官方給的定位很剋制:不喊「全面超越最強閉源」,而是把競爭點放在「差幾個點、便宜一個量級」的可部署區間。它現在的身份,是Cognition訓練過的最強模型。

技術路徑有點反直覺。SWE-1.7的基座是月之暗面的Kimi K2.7 Code——一個本身已經過多輪強化學習後訓練的模型。按圈內流行說法,在充分後訓練的基座上繼續RL,收益會迅速見頂。但Cognition說自己疊加的RL流程帶來了大幅增益,等於直接打了「後訓練天花板」的臉。

硬指標擺出來:在自建的FrontierCode 1.1 Main基準上,SWE-1.7透過率42.3%,高於Kimi K2.7 Code的30.1%,逼近GPT-5.5的43.0%,離Claude Opus 4.8的46.5%也不遠。Terminal-Bench 2.1上拿到81.5%,SWE-Bench Multilingual是77.8%。

速度上它借了Cerebras的推理晶片,在Devin的Web、桌面和CLI裡跑出每秒1000 token。單任務成本約1.97美元——對按任務消耗計費的程式設計agent產品,單位成本比榜首分數更決定規模化能力。模型還學會在上下文臨界點時自動總結狀態、從摘要續跑,單次任務能撐到6小時。

往後看,這件事的真正訊號不在分數,而在路線。開源基座疊加自有RL、再配專用推理硬體,正在成為一條「不追最強、只追價效比」的務實路徑。對開發者來說,能便宜一個量級用上接近前沿的程式設計能力,比多那零點幾個點更有意義。

這也會倒逼閉源廠商重新定價。當「夠用且便宜」的程式設計模型擺在面前,團隊沒必要為邊際能力多付十倍錢。模型層的競爭,正從「誰最強」滑向「誰最值」。對預算敏感的創業公司,這是實打實的紅利。