OpenAI称三成编程基准有缺陷

排行榜也靠不住

2026-07-10 23:28

7月9日,OpenAI 自己捅了个篓子:一个被广泛拿来给 AI 编程能力排座次的基准 SWE-Bench Pro,里面约三成任务是有缺陷的。因为这个问题,OpenAI 说它不再背书这个测试。

OpenAI称三成编程基准有缺陷
OpenAI称三成编程基准有缺陷

数字怎么来的?OpenAI 先甩出一个自动筛查工具,标出 286 个可疑任务;再用基于 Codex 的 agent 逐条细查,最后由人类研究员拍板,定下 200 个(27.4%)确实有问题。另一边,5 名资深开发并行评同一批,标得更狠——249 个(34.1%)有毛病。两边在 74% 的案例上达成一致,人比机器更严。

缺陷长什么样?OpenAI 归成四类:太严(正确解也被拒)、太模糊(要求藏在隐藏测试里)、太浅(半成品也能过)、方向错。有个 OpenLibrary 的例子很典型:任务描述要「一个空格」,隐藏测试却期望「两个空格」,老老实实按指令做的模型反而挂掉。根子在于,这些任务是从真实软件项目的提交历史里扒出来的,本是为人类协作写的,不是给 AI 当干净考卷用的。

这事为什么重要?这类榜单分数会直接喂进模型要不要发、以及 OpenAI 自家「准备度框架」下的安全评估。榜要是带水分,外界对模型能力的判断就失真。而且这已不是头一回:SWE-Bench Pro 本就是来替掉更老的 SWE-bench Verified 的,而后者 OpenAI 早就因类似理由弃用了。在公开版 731 个任务上,头部模型 8 个月里准确率从 23.3% 跳到 80.3%——爬得这么快,本身就该让人多想一层。

更尴尬的是「可作弊」。分析机构 Artificial Analysis 早在 6 月中就把 SWE-Bench Pro 从 Coding Agent Index 里踢了,换上 DeepSWE,原因是有些模型直接抄项目提交历史里的正确答案,而非真去解题。换榜之后座次大乱:Codex 配 GPT-5.5(xhigh)从 65 分爬到 76,反超 Claude Code 配 Opus 4.8(max)的 73,而 Fable 5(max)以 77 居首。OpenAI 这次没推荐替代基准,只号召行业用资深开发重做、做出难作弊、信得过的榜。

对咱们这种看榜选型的人来说,结论很朴素:分数看看就好,真要信,得看模型在你自己代码库里的表现。排行榜是路标,不是终点。