Cognition SWE-1.7

Cognition 基于 Kimi K2.7 Code 训练的软件工程智能体模型,逼近前沿、成本大降

深度报告

  • Cognition(Devin 的母公司)于 2026 年 7 月 8-9 日发布 SWE-1.7,这是其迄今训练过的最强软件工程智能体模型。它基于月之暗面(Moonshot AI)的开源模型 Kimi K2.7 Code 作为基座,再叠加 Cognition 自研的大规模强化学习后训练,直接在 Devin 环境中针对长周期异步任务调优。官方没有宣称全面超越最强闭源模型,而是把卖点放在「差几个点、便宜一个量级」的可部署区间,在自建 FrontierCode 基准上单任务成本约 1.97 美元。所有基准数字均来自 Cognition 自述,第三方独立复测尚未出现。

  • Cognition 是应用 AI 实验室,以打造自主软件工程师 Devin 闻名。其 SWE 模型家族专为智能体软件工程(agentic software engineering)工作设计,通过 Devin 的 Web、桌面与 CLI 三端交付,针对长跨度、异步的编码任务做了优化。SWE-1.7 是家族当前首个被官方正式文档记录的版本,前代是 2025 年 10 月发布的 SWE-1.6(主打模型体验与速度,曾免费三个月)。公司团队规模小但密度高,创始成员拥有 10 枚 IOI 金牌,来自 Cursor、Scale AI、Modal、Google DeepMind 等机构。

  • SWE-1.7 只在 Devin 平台内以托管形式提供,不发布开源权重、也没有独立模型 API。它在 Devin 三端可用,由 AI 芯片公司 Cerebras 提供算力,推理速度高达每秒 1000 token。训练配方有四个关键组件:第一是熵保持,用 top-p 采样加采样分布重放(sampling distribution replay)解决训练-推理的 KL 散度不匹配,配合 Muon 优化器消除训练器非确定性;第二是多集群训练,跨三大洲四个数据中心,训练器居中、推理引擎分布式,压缩权重增量体积减少 99% 以上、1-2 分钟跨洲同步,推理故障由 NVIDIA Dynamo 重路由;第三是高质量数据策划,自动执行测试、过滤低学习信号任务、防奖励黑客;第四是长跨度自压缩(self-compaction),上下文临近极限时模型自行总结并续跑,单次 rollout 最长可达 6 小时,配合交替长度惩罚(alternating length penalty)在简单任务上压缩冗余。行为上,相比 Kimi K2.7 基座,它会在改动前做更多探查式代码阅读、给出更凝练的推理链、做根因级缺陷修复。

  • SWE-1.7 不单独售卖,其能力随 Devin 订阅提供;部分价格线索来自 Windsurf Cascade 文档:SWE-1.7 Lightning 档按每百万 token 计价,输入 2.50 美元、缓存输入 1.00 美元、输出 12.50 美元。免费档用户仅能使用上一代 SWE-1.6。对 Devin 这类按任务消耗计费的产品,单位成本比榜首分数更决定规模化能力,Cognition 把 1.97 美元的单任务成本作为核心商业数字来强调。

  • 作为刚发布、且只在 Devin 平台内可用的模型,公开的一手用户反馈尚少,社媒讨论更多集中在速度与定位。开发者 dabit 评价 1000 tok/s「让异步代理工作有了实时感」,形容一种「技术上是异步、但快到你愿意盯着看」的中间态;他也指出更多推理换来更长的运行,但会放大改动的影响面。普遍认可的声音是:它把竞争点从「榜首分数」移到了「成本-性能帕累托前沿」,对按任务计费、追求规模化吞吐的团队有现实吸引力。

  • 行业媒体普遍接受其「接近前沿、但是便宜一个量级」的定位。多家评测指出,在 FrontierCode 1.1 Main 上 SWE-1.7 得 42.3%,略低于 GPT-5.5 的 43.0% 和 Claude Opus 4.8 的 46.5%,但远高于基座 Kimi K2.7 Code 的 30.1% 与上代 SWE-1.6 的 9.4%;在 Terminal-Bench 2.1 上得 81.5%(Opus 4.8 为 86.9%);在 SWE-Bench Multilingual 多语言软件工程上得 77.8%,超过了 GPT-5.5 的 76.8%。结论是它并未在所有维度领先闭源对手,却在多语言泛化和单位成本上打出了差异。Cognition 还借这次发布挑战了一个流行判断:开源基座在充分后训练后继续做 RL 的收益会迅速见顶——而 SWE-1.7 在已多轮 RL 的 Kimi K2.7 之上仍拿到大幅增益。

  • 最大的争议来自基座的出身。Kimi K2.7 Code 是来自中国大陆实验室的开源模型,Cognition 为此专门发布《Measuring the Trustworthiness of Open-Source-Derived Models》一文,用一套多语言宣传与审查评测(145 个政治敏感问题、每题 5 个样本、覆盖英文/简体/繁体中文,按六个轴打分)检验模型可信度,并强调选 Kimi K2.7 是因其编码能力与中立性兼具、再在后续训练中进一步提升中立。这套做法被业界视为「把地缘风险摆上台面」的诚实操作,但也提醒买家:模型仅通过 Devin 平台提供,需要自托管、严格模型路由或接入自有技术栈的团队,访问方式本身就是一项限制。此外,所有基准均为 Cognition 自报,独立第三方复测缺位,数字应谨慎看待。

  • 它适合已经或准备采用 Devin、按任务消耗计费、追求规模化软件工程吞吐的团队,尤其是被前沿模型单位成本压制的场景。不适合需要本地自托管、模型权重可控或要接入自有应用栈的团队——这部分用户应考虑 GLM、Kimi 等开源权重路线。替代方案包括 Anthropic 的 Claude 系列、OpenAI 的 GPT-5.5/Codex、以及 Cursor、Windsurf 等集成了多模型的编码代理。

  • SWE-1.7 是 Cognition 把「开源基座 + 自研 RL + 推理协同设计」跑通的一次示范:分数没拿榜首,但把成本曲线往左下推了一大步。对按任务付费的编程代理产品而言,这可能比几个基准百分点更有分量;只是自报数字与平台绑定,仍需独立复测与时间检验。

用户评论

  • 头像
    CGonzalez_2024
    坦白说我只关心一件事:它修的 bug 是不是根因级的。报告里说它比基座更会做根因修复、改动前先探查式阅读,这点比单纯分数更影响日常体验。我们之前用别的 agent 经常是改了表面、测试过了,结果隔壁模块因为同一个根因又炸,这种才是真浪费。

  • 头像
    6coch1
    基座选 Kimi K2.7 Code 这件事本身就值得聊,开源模型被顶级 RL 团队二次后训练还能涨十几个点,说明 RL 上限没到头。

  • 头像
    Emma.Martin_X
    多集群 RL 那套跨洲权重增量同步看着很爽,但我们更关心它防奖励黑客的沙箱设计,报告提了网络隔离和作弊零奖励,方向是对的。

  • 头像
    StarkNetStarReyes
    终端里能 1000 tok/s 实时看着 agent 干活,这种异步但够快的「中间态」比纯后台跑体验好太多,等待焦虑明显降低。以前丢一个长任务就切去干别的,回来发现跑偏了还得重来;现在半分钟就能看到它在读代码、在下探针,不对劲当场就能喊停。

  • 头像
    KimberlyKristensen
    自压缩能撑到 6 小时 rollout 是个真需求,我们之前用别的 agent 跑长任务经常上下文爆掉中途丢状态,这个设计对症。

  • 头像
    Michael.ChavezSr474
    这个分数摆位很聪明:不抢榜首,抢成本曲线。对我们这种按任务计费、一个月要消化几百个 PR 的团队,单价比那几个百分点重要得多。1.97 美元一个 FrontierCode 任务如果属实,相比 Opus 4.8 那种每次 rollout 的成本,规模化之后差距会被放大到很夸张。

  • 头像
    琉璃448
    Cognition 把宣传/审查评测摆上台面的做法挺诚实,比起那些假装没用中国开源基座的实验室,这点加分。

  • 头像
    SJacksonSr
    所有基准都是 Cognition 自己报的,FrontierCode 还是他们自家基准,先观望等第三方复测,别急着写进选型报告。尤其 OpenAI 自家之前都因为 SWE-bench 污染问题弃用 Verified 版本,说明自报榜单水分空间很大,等独立审计出来再下结论更稳。

  • 头像
    Bobby.Johnson520278
    不开源权重、没有独立 API,只能用 Devin,这点对我们是硬伤,我们需要自托管和严格模型路由,平台绑定直接出局。

  • 头像
    PatrickHendersonQ
    免费档还是只给 SWE-1.6,想试 1.7 得付费,先让团队里两个人开订阅跑一周真实任务再决定。

  • 头像
    Brenda.Collins346
    1.97 美元单任务这个数字是重点,但得拿我们自己的「单次可合并变更成本」去比,光看标杆分数没意义。

  • 头像
    Jean_Hill_66
    在 Devin 里切到 SWE-1.7 跑了两个老仓库的迁移任务,体感确实快,1000 tok/s 下等结果的心理负担小了很多。

  • 头像
    LJonesX
    SWE-Bench Multilingual 77.8% 超过 GPT-5.5 的 76.8%,多语言泛化这块确实打出了差异,对我们跨语言仓库挺有用。

  • 头像
    Sawyer530
    对比下来我更愿意把它当「低成本长任务执行器」而不是「最强编码模型」,定位想清楚就不会对着榜首分数纠结了。

  • 头像
    BPerez_7
    从 SWE-1.6 的 9.4% 跳到 42.3%,一代涨四倍,这个幅度比它和 Opus 的那点差距更让我好奇训练配方。