中國Agent拿下OSWorld冠軍,90.2%破全球紀錄

AI競賽進入「接管螢幕」時代

2026-07-29 20:34

全球AI智慧體評測基準OSWorld迎來了一個歷史性時刻:中國團隊實在智慧研發的「實在Agent」,以90.2%的任務成功率打破全球紀錄,一舉拿下OSWorld總榜與Agentic Framework分榜雙冠軍。這不是一次普通的榜單排名變動——它意味著AI從「會聊天」正式邁入了「能幹活」的階段

先說說OSWorld是什麼。它由香港大學、卡內基梅隆大學和滑鐵盧大學聯合推出,被業界公認是含金量極高的「計算機駕駛執照考試」。它的獨特之處在於,不是在封閉的API環境裡考模型,而是把AI丟進真實的桌面作業系統裡,讓它像人一樣看螢幕、動滑鼠、敲鍵盤,完成跨應用的複雜任務。滿分361分的考場,包括辦公自動化、程式碼開發、影象處理,甚至底層運維。

這個基準在2024年剛釋出時,最強智慧體得分只有12.2%,基本屬於「演示級」。直到2025年底,行業首次以72.6%的得分突破了人類基線(72.36%)。而這次實在Agent拿下90.2%,相當於AI從「勉強透過科目二」直接飆到了「老司機上路」的水平。

更值得關注的是拉開差距的具體領域。實在Agent在三個公認最難的維度上表現異常突出:跨應用長鏈路協同拿到78.81分,領先第二名近10個百分點;非標GUI介面理解以92.3%的成功率攻下專業影象軟體GIMP的26個任務中的24個;底層系統運維更是24個任務全部滿分。這幾個數字說明一件事:它不是靠刷分上去的,而是在真正考驗「替人幹活能力」的場景裡贏的。

為什麼是一家做企業自動化的中國公司,而不是那些大名鼎鼎的基礎模型巨頭?這背後有一個行業正在驗證的邏輯:Agent = Model + Harness。大模型是發動機,提供智力;而Harness——也就是工程套件和執行架構——才是決定AI能不能在真實環境裡幹活的關鍵。同樣一個模型,配上好的Harness,效能可以提升6%到17%。當大模型的能力差距開始縮小,Harness才是決定勝負的那隻手。

實在智慧在這條路上已經跑了八年。他們累計服務了超過6000家企業客戶,其中90%是世界500強和央企國企。這些年積攢下來的真實運算元據、報錯恢復經驗和流程模板,就是他們構建Harness最值錢的原材料。

但90.2%只是一個開始。實在智慧自己也清楚,從基準高分到工業生產環境的大規模落地,中間還有一道坎要邁。企業級場景需要99.99%的可靠性,需要在複雜動態環境中抗干擾、在誤操作時能回滾,還需要每個點選都可追溯、可審計。從「考試駕照」到「上路跑活」,這才是智慧體商業化真正的下半場。