Cognition发布SWE-1.7:基于Kimi K2.7、每秒1000 token逼近GPT-5.5

开源基座再RL

2026-07-12 14:50

做Devin编程智能体的Cognition,又放出新模型SWE-1.7。官方给的定位很克制:不喊「全面超越最强闭源」,而是把竞争点放在「差几个点、便宜一个量级」的可部署区间。它现在的身份,是Cognition训练过的最强模型。

技术路径有点反直觉。SWE-1.7的基座是月之暗面的Kimi K2.7 Code——一个本身已经过多轮强化学习后训练的模型。按圈内流行说法,在充分后训练的基座上继续RL,收益会迅速见顶。但Cognition说自己叠加的RL流程带来了大幅增益,等于直接打了「后训练天花板」的脸。

硬指标摆出来:在自建的FrontierCode 1.1 Main基准上,SWE-1.7通过率42.3%,高于Kimi K2.7 Code的30.1%,逼近GPT-5.5的43.0%,离Claude Opus 4.8的46.5%也不远。Terminal-Bench 2.1上拿到81.5%,SWE-Bench Multilingual是77.8%。

速度上它借了Cerebras的推理芯片,在Devin的Web、桌面和CLI里跑出每秒1000 token。单任务成本约1.97美元——对按任务消耗计费的编程agent产品,单位成本比榜首分数更决定规模化能力。模型还学会在上下文临界点时自动总结状态、从摘要续跑,单次任务能撑到6小时。

往后看,这件事的真正信号不在分数,而在路线。开源基座叠加自有RL、再配专用推理硬件,正在成为一条「不追最强、只追性价比」的务实路径。对开发者来说,能便宜一个量级用上接近前沿的编程能力,比多那零点几个点更有意义。

这也会倒逼闭源厂商重新定价。当「够用且便宜」的编程模型摆在面前,团队没必要为边际能力多付十倍钱。模型层的竞争,正从「谁最强」滑向「谁最值」。对预算敏感的创业公司,这是实打实的红利。