OpenAI稱三成程式設計基準有缺陷
排行榜也靠不住
7月9日,OpenAI 自己捅了個簍子:一個被廣泛拿來給 AI 程式設計能力排座次的基準 SWE-Bench Pro,裡面約三成任務是有缺陷的。因為這個問題,OpenAI 說它不再背書這個測試。

數字怎麼來的?OpenAI 先甩出一個自動篩查工具,標出 286 個可疑任務;再用基於 Codex 的 agent 逐條細查,最後由人類研究員拍板,定下 200 個(27.4%)確實有問題。另一邊,5 名資深開發並行評同一批,標得更狠——249 個(34.1%)有毛病。兩邊在 74% 的案例上達成一致,人比機器更嚴。
缺陷長什麼樣?OpenAI 歸成四類:太嚴(正確解也被拒)、太模糊(要求藏在隱藏測試裡)、太淺(半成品也能過)、方向錯。有個 OpenLibrary 的例子很典型:任務描述要「一個空格」,隱藏測試卻期望「兩個空格」,老老實實按指令做的模型反而掛掉。根子在於,這些任務是從真實軟體專案的提交歷史裡扒出來的,本是為人類協作寫的,不是給 AI 當乾淨考卷用的。
這事為什麼重要?這類榜單分數會直接喂進模型要不要發、以及 OpenAI 自家「準備度框架」下的安全評估。榜要是帶水分,外界對模型能力的判斷就失真。而且這已不是頭一回:SWE-Bench Pro 本就是來替掉更老的 SWE-bench Verified 的,而後者 OpenAI 早就因類似理由棄用了。在公開版 731 個任務上,頭部模型 8 個月裡準確率從 23.3% 跳到 80.3%——爬得這麼快,本身就該讓人多想一層。
更尷尬的是「可作弊」。分析機構 Artificial Analysis 早在 6 月中就把 SWE-Bench Pro 從 Coding Agent Index 裡踢了,換上 DeepSWE,原因是有些模型直接抄專案提交歷史裡的正確答案,而非真去解題。換榜之後座次大亂:Codex 配 GPT-5.5(xhigh)從 65 分爬到 76,反超 Claude Code 配 Opus 4.8(max)的 73,而 Fable 5(max)以 77 居首。OpenAI 這次沒推薦替代基準,只號召行業用資深開發重做、做出難作弊、信得過的榜。
對咱們這種看榜選型的人來說,結論很樸素:分數看看就好,真要信,得看模型在你自己程式碼庫裡的表現。排行榜是路標,不是終點。