中国Agent拿下OSWorld冠军,90.2%破全球纪录

AI竞赛进入「接管屏幕」时代

2026-07-29 20:34

全球AI智能体评测基准OSWorld迎来了一个历史性时刻:中国团队实在智能研发的「实在Agent」,以90.2%的任务成功率打破全球纪录,一举拿下OSWorld总榜与Agentic Framework分榜双冠军。这不是一次普通的榜单排名变动——它意味着AI从「会聊天」正式迈入了「能干活」的阶段

先说说OSWorld是什么。它由香港大学、卡内基梅隆大学和滑铁卢大学联合推出,被业界公认是含金量极高的「计算机驾驶执照考试」。它的独特之处在于,不是在封闭的API环境里考模型,而是把AI丢进真实的桌面操作系统里,让它像人一样看屏幕、动鼠标、敲键盘,完成跨应用的复杂任务。满分361分的考场,包括办公自动化、代码开发、图像处理,甚至底层运维。

这个基准在2024年刚发布时,最强智能体得分只有12.2%,基本属于「演示级」。直到2025年底,行业首次以72.6%的得分突破了人类基线(72.36%)。而这次实在Agent拿下90.2%,相当于AI从「勉强通过科目二」直接飙到了「老司机上路」的水平。

更值得关注的是拉开差距的具体领域。实在Agent在三个公认最难的维度上表现异常突出:跨应用长链路协同拿到78.81分,领先第二名近10个百分点;非标GUI界面理解以92.3%的成功率攻下专业图像软件GIMP的26个任务中的24个;底层系统运维更是24个任务全部满分。这几个数字说明一件事:它不是靠刷分上去的,而是在真正考验「替人干活能力」的场景里赢的。

为什么是一家做企业自动化的中国公司,而不是那些大名鼎鼎的基础模型巨头?这背后有一个行业正在验证的逻辑:Agent = Model + Harness。大模型是发动机,提供智力;而Harness——也就是工程套件和运行架构——才是决定AI能不能在真实环境里干活的关键。同样一个模型,配上好的Harness,性能可以提升6%到17%。当大模型的能力差距开始缩小,Harness才是决定胜负的那只手。

实在智能在这条路上已经跑了八年。他们累计服务了超过6000家企业客户,其中90%是世界500强和央企国企。这些年积攒下来的真实操作数据、报错恢复经验和流程模板,就是他们构建Harness最值钱的原材料。

但90.2%只是一个开始。实在智能自己也清楚,从基准高分到工业生产环境的大规模落地,中间还有一道坎要迈。企业级场景需要99.99%的可靠性,需要在复杂动态环境中抗干扰、在误操作时能回滚,还需要每个点击都可追溯、可审计。从「考试驾照」到「上路跑活」,这才是智能体商业化真正的下半场。