Cognition SWE-1.7

Cognition 基於 Kimi K2.7 Code 訓練的軟體工程智慧體模型,逼近前沿、成本大降

深度報告

  • Cognition(Devin 的母公司)於 2026 年 7 月 8-9 日釋出 SWE-1.7,這是其迄今訓練過的最強軟體工程智慧體模型。它基於月之暗面(Moonshot AI)的開源模型 Kimi K2.7 Code 作為基座,再疊加 Cognition 自研的大規模強化學習後訓練,直接在 Devin 環境中針對長週期非同步任務調優。官方沒有宣稱全面超越最強閉源模型,而是把賣點放在「差幾個點、便宜一個量級」的可部署區間,在自建 FrontierCode 基準上單任務成本約 1.97 美元。所有基準數字均來自 Cognition 自述,第三方獨立複測尚未出現。

  • Cognition 是應用 AI 實驗室,以打造自主軟體工程師 Devin 聞名。其 SWE 模型家族專為智慧體軟體工程(agentic software engineering)工作設計,透過 Devin 的 Web、桌面與 CLI 三端交付,針對長跨度、非同步的編碼任務做了最佳化。SWE-1.7 是家族當前首個被官方正式文件記錄的版本,前代是 2025 年 10 月釋出的 SWE-1.6(主打模型體驗與速度,曾免費三個月)。公司團隊規模小但密度高,創始成員擁有 10 枚 IOI 金牌,來自 Cursor、Scale AI、Modal、Google DeepMind 等機構。

  • SWE-1.7 只在 Devin 平臺內以託管形式提供,不釋出開源權重、也沒有獨立模型 API。它在 Devin 三端可用,由 AI 晶片公司 Cerebras 提供算力,推理速度高達每秒 1000 token。訓練配方有四個關鍵元件:第一是熵保持,用 top-p 取樣加取樣分佈重放(sampling distribution replay)解決訓練-推理的 KL 散度不匹配,配合 Muon 最佳化器消除訓練器非確定性;第二是多叢集訓練,跨三大洲四個資料中心,訓練器居中、推理引擎分散式,壓縮權重增量體積減少 99% 以上、1-2 分鐘跨洲同步,推理故障由 NVIDIA Dynamo 重路由;第三是高質量資料策劃,自動執行測試、過濾低學習訊號任務、防獎勵駭客;第四是長跨度自壓縮(self-compaction),上下文臨近極限時模型自行總結並續跑,單次 rollout 最長可達 6 小時,配合交替長度懲罰(alternating length penalty)在簡單任務上壓縮冗餘。行為上,相比 Kimi K2.7 基座,它會在改動前做更多探查式程式碼閱讀、給出更凝練的推理鏈、做根因級缺陷修復。

  • SWE-1.7 不單獨售賣,其能力隨 Devin 訂閱提供;部分價格線索來自 Windsurf Cascade 文件:SWE-1.7 Lightning 檔按每百萬 token 計價,輸入 2.50 美元、快取輸入 1.00 美元、輸出 12.50 美元。免費檔使用者僅能使用上一代 SWE-1.6。對 Devin 這類按任務消耗計費的產品,單位成本比榜首分數更決定規模化能力,Cognition 把 1.97 美元的單任務成本作為核心商業數字來強調。

  • 作為剛釋出、且只在 Devin 平臺內可用的模型,公開的一手使用者反饋尚少,社媒討論更多集中在速度與定位。開發者 dabit 評價 1000 tok/s「讓非同步代理工作有了實時感」,形容一種「技術上是非同步、但快到你願意盯著看」的中間態;他也指出更多推理換來更長的執行,但會放大改動的影響面。普遍認可的聲音是:它把競爭點從「榜首分數」移到了「成本-效能帕累託前沿」,對按任務計費、追求規模化吞吐的團隊有現實吸引力。

  • 行業媒體普遍接受其「接近前沿、但是便宜一個量級」的定位。多家評測指出,在 FrontierCode 1.1 Main 上 SWE-1.7 得 42.3%,略低於 GPT-5.5 的 43.0% 和 Claude Opus 4.8 的 46.5%,但遠高於基座 Kimi K2.7 Code 的 30.1% 與上代 SWE-1.6 的 9.4%;在 Terminal-Bench 2.1 上得 81.5%(Opus 4.8 為 86.9%);在 SWE-Bench Multilingual 多語言軟體工程上得 77.8%,超過了 GPT-5.5 的 76.8%。結論是它並未在所有維度領先閉源對手,卻在多語言泛化和單位成本上打出了差異。Cognition 還借這次釋出挑戰了一個流行判斷:開源基座在充分後訓練後繼續做 RL 的收益會迅速見頂——而 SWE-1.7 在已多輪 RL 的 Kimi K2.7 之上仍拿到大幅增益。

  • 最大的爭議來自基座的出身。Kimi K2.7 Code 是來自中國大陸實驗室的開源模型,Cognition 為此專門釋出《Measuring the Trustworthiness of Open-Source-Derived Models》一文,用一套多語言宣傳與審查評測(145 個政治敏感問題、每題 5 個樣本、覆蓋英文/簡體/繁體中文,按六個軸打分)檢驗模型可信度,並強調選 Kimi K2.7 是因其編碼能力與中立性兼具、再在後續訓練中進一步提升中立。這套做法被業界視為「把地緣風險擺上檯面」的誠實操作,但也提醒買家:模型僅透過 Devin 平臺提供,需要自託管、嚴格模型路由或接入自有技術棧的團隊,訪問方式本身就是一項限制。此外,所有基準均為 Cognition 自報,獨立第三方複測缺位,數字應謹慎看待。

  • 它適合已經或準備採用 Devin、按任務消耗計費、追求規模化軟體工程吞吐的團隊,尤其是被前沿模型單位成本壓制的場景。不適合需要本地自託管、模型權重可控或要接入自有應用棧的團隊——這部分使用者應考慮 GLM、Kimi 等開源權重路線。替代方案包括 Anthropic 的 Claude 系列、OpenAI 的 GPT-5.5/Codex、以及 Cursor、Windsurf 等整合了多模型的編碼代理。

  • SWE-1.7 是 Cognition 把「開源基座 + 自研 RL + 推理協同設計」跑通的一次示範:分數沒拿榜首,但把成本曲線往左下推了一大步。對按任務付費的程式設計代理產品而言,這可能比幾個基準百分點更有分量;只是自報數字與平臺繫結,仍需獨立複測與時間檢驗。

使用者評論

  • 頭像
    CGonzalez_2024
    坦白說我只關心一件事:它修的 bug 是不是根因級的。報告裡說它比基座更會做根因修復、改動前先探查式閱讀,這點比單純分數更影響日常體驗。我們之前用別的 agent 經常是改了表面、測試過了,結果隔壁模組因為同一個根因又炸,這種才是真浪費。

  • 頭像
    6coch1
    基座選 Kimi K2.7 Code 這件事本身就值得聊,開源模型被頂級 RL 團隊二次後訓練還能漲十幾個點,說明 RL 上限沒到頭。

  • 頭像
    Emma.Martin_X
    多叢集 RL 那套跨洲權重增量同步看著很爽,但我們更關心它防獎勵駭客的沙箱設計,報告提了網路隔離和作弊零獎勵,方向是對的。

  • 頭像
    StarkNetStarReyes
    終端裡能 1000 tok/s 實時看著 agent 幹活,這種非同步但夠快的「中間態」比純後臺跑體驗好太多,等待焦慮明顯降低。以前丟一個長任務就切去幹別的,回來發現跑偏了還得重來;現在半分鐘就能看到它在讀程式碼、在下探針,不對勁當場就能喊停。

  • 頭像
    KimberlyKristensen
    自壓縮能撐到 6 小時 rollout 是個真需求,我們之前用別的 agent 跑長任務經常上下文爆掉中途丟狀態,這個設計對症。

  • 頭像
    Michael.ChavezSr474
    這個分數擺位很聰明:不搶榜首,搶成本曲線。對我們這種按任務計費、一個月要消化幾百個 PR 的團隊,單價比那幾個百分點重要得多。1.97 美元一個 FrontierCode 任務如果屬實,相比 Opus 4.8 那種每次 rollout 的成本,規模化之後差距會被放大到很誇張。

  • 頭像
    琉璃448
    Cognition 把宣傳/審查評測擺上檯面的做法挺誠實,比起那些假裝沒用中國開源基座的實驗室,這點加分。

  • 頭像
    SJacksonSr
    所有基準都是 Cognition 自己報的,FrontierCode 還是他們自家基準,先觀望等第三方複測,別急著寫進選型報告。尤其 OpenAI 自家之前都因為 SWE-bench 汙染問題棄用 Verified 版本,說明自報榜單水分空間很大,等獨立審計出來再下結論更穩。

  • 頭像
    Bobby.Johnson520278
    不開源權重、沒有獨立 API,只能用 Devin,這點對我們是硬傷,我們需要自託管和嚴格模型路由,平臺繫結直接出局。

  • 頭像
    PatrickHendersonQ
    免費檔還是隻給 SWE-1.6,想試 1.7 得付費,先讓團隊裡兩個人開訂閱跑一週真實任務再決定。

  • 頭像
    Brenda.Collins346
    1.97 美元單任務這個數字是重點,但得拿我們自己的「單次可合併變更成本」去比,光看標杆分數沒意義。

  • 頭像
    Jean_Hill_66
    在 Devin 裡切到 SWE-1.7 跑了兩個老倉庫的遷移任務,體感確實快,1000 tok/s 下等結果的心理負擔小了很多。

  • 頭像
    LJonesX
    SWE-Bench Multilingual 77.8% 超過 GPT-5.5 的 76.8%,多語言泛化這塊確實打出了差異,對我們跨語言倉庫挺有用。

  • 頭像
    Sawyer530
    對比下來我更願意把它當「低成本長任務執行器」而不是「最強編碼模型」,定位想清楚就不會對著榜首分數糾結了。

  • 頭像
    BPerez_7
    從 SWE-1.6 的 9.4% 跳到 42.3%,一代漲四倍,這個幅度比它和 Opus 的那點差距更讓我好奇訓練配方。