實在Agent
以90.20%成功率登頂OSWorld全球榜首的企業級通用智慧體平臺,無需API即可像真人一樣操作任意系統
深度報告
-
2026 年 7 月 27 日,全球權威計算機智慧體基準 OSWorld 的榜首易主,來自浙江杭州的實在智慧以「實在Agent」拿下 90.20% 的執行成功率,在總榜與智慧體框架分榜同時排名第一。這是該基準釋出以來第一個突破 90% 的方案,此前公開最高分是 83.6%,而人類操作者在同等條件下的平均成功率約為 72.36%。更值得注意的是它走的路線:不是堆一個更強的原生大模型,而是「通用模型 + 自研 Harness 工程框架」的雙層架構。這個成績背後,是一家成立八年、服務 6000 多家企業客戶的 RPA 老兵。但把榜單分數直接換算成生產力,中間還隔著一條不窄的溝——OSWorld 舊版本身已接近飽和,官方推出的 2.0 版本上,同一套方案的分數會從 83.5% 掉到 20.6%。
-
實在智慧全稱浙江實在智慧科技有限公司,2018 年成立於杭州餘杭,創始人兼 CEO 孫林君此前是阿里巴巴的 P9 資深演算法專家。公司從 RPA(機器人流程自動化)起家,趕上了 2019 年前後國內 RPA 的融資熱潮,一路拿了六七輪錢:2018 年君聯資本的天使輪數千萬,2020 年松禾資本、賽智伯樂領投的 Pre-A 近億元,同年光雲科技領投的 A/A+ 輪 1 億元,2021 年英特爾資本的戰略投資,2023 年底金泰富資本與安吉智慧谷領投的 C 輪近 2 億元。累計融資約 4.7 億元人民幣。公司目前 300 到 500 人規模,官網口徑稱研發佔比超過 53%。 這家公司在國內 RPA 圈子裡的定位比較特別。它不像來也科技那樣偏對話式 AI,也不像影刀那樣主打輕量易用,而是很早就壓注「視覺理解 + 自動化執行」這條路。2021 年前後推出的 ISSUT 智慧螢幕語義理解技術,核心是不依賴 API 和介面元素 ID,直接靠視覺識別螢幕上的文字、按鈕、表格。後來又自研了 TARS(塔斯)大模型,百億引數量級,負責意圖理解和任務拆解,還有多模態版本 TARS-VL。這套「TARS + ISSUT + 智慧流程執行引擎」的組合,本質上就是今天大家說的 Computer-Use Agent,只不過實在智慧在這個概念火起來之前已經做了好幾年。 資質方面堆得很滿:國家專利獎、國家級專精特新「小巨人」、CMMI-5、資訊保安等級保護三級、連續多年入選中國和浙江的未來獨角獸榜單,100 多項發明專利。這些在 To B 政企市場是硬通貨。不過要提醒一句,官網首頁現在寫的「信通院 5 級滿分認定」,與 2022 至 2023 年官方稿件裡的「3+ 級最高認證」表述不一致,中間的升級過程沒有單獨通稿,引用時最好核實。
-
實在Agent 不是一個單品,而是一個平臺,底下掛著一整條產品線。往上看是實在Agent 企業級通用智慧體平臺,往下是實在RPA 設計器、信創 IPA 設計器、RPA 機器人執行終端、RPA 控制器(B/S 架構的任務排程中樞),旁邊還有 IDP 智慧文件審閱和實在取數寶兩個垂直產品。官網把智慧體市場也做起來了,宣稱有 5000 多個行業沉澱的智慧體應用可以開箱即用,實際點進去看是按客服、跨境、運營、銷售、電商、人事、財務分類的場景模板,條目像「Temu 財務報告庫」「BOSS 直聘智慧篩選」「增值稅發票識別」這種,點「獲取」會跳到留資頁面,不是直接下載。 核心賣點是「無需 API 介面,像真人一樣操作」。支援 Windows、信創系統(統信、麒麟)、Android,能操作 ERP、CRM、瀏覽器、微信、釘釘這些日常軟體。對於國內大量遺留系統沒有開放介面的現實,這個能力確實是剛需。工作流搭建走的是拖拽路線,配合元件庫和 MCP 工具,零程式碼人群也能上手。官網首頁展示的場景包括網路輿情分析、亞馬遜競品分析、小紅書文案仿寫、抖音意向客戶獲取、生意參謀週報生成、1688 選品,明顯是電商運營和跨境賣家的高頻需求。 真正讓它拿下 OSWorld 榜首的,是被稱為「Harness 工程」的那一層。這個詞現在在 Agent 圈越來越熱,簡單說就是包在模型外面的工程框架:複雜任務怎麼拆解排程、執行錯了怎麼自我糾錯、多個智慧體之間怎麼協同、長鏈路任務的狀態和記憶怎麼管、什麼時候切換模型、工具鏈怎麼閉環。執行層面實在Agent 採用「API 優先、GUI 兜底」的混合排程——能走介面就走介面,走不通才降級到視覺操作,這比純視覺方案在效率和穩定性上都有優勢。 Harness 這套東西的價值有資料支撐。斯坦福和清華的研究顯示,在完全相同的底層模型前提下,僅僅改進 Harness 工程設計,OSWorld 這類基準上的分數差距可以達到 6 到 17 個百分點。也有工程案例表明,同模型同提示詞,只最佳化任務拆解、狀態管理、步驟驗證、失敗恢復這幾個環節,任務成功率能從 70% 以下拉到 95% 以上。這就是為什麼 OSWorld TOP10 裡有 6 席選擇了框架路線,而不是純原生模型。 具體到 OSWorld 的 361 道實戰題,實在Agent 拿了 325.59 分。分類別看,跨應用協同、GIMP 影象處理、系統底層操作這些硬骨頭場景表現突出,日常高頻的 Calc、Impress、Writer、VSCode 也保持了高完成度。官方的說法是,在不專門訓練模型的前提下,僅靠架構與工程創新就能達到世界級水平。 安全機制也做了一層。高風險和敏感資料操作會觸發「安全斷路器」自動提權確認,支援操作撤銷與回滾,執行在沙盒隔離環境裡,全鏈路日誌可審計。公司說目標是把可靠性推向工業級的 99.99%——注意這是目標不是現狀,從 90.2% 到 99.99% 之間的距離,比從 12% 到 90% 更難走。
-
這是最不透明的一塊。官網沒有任何公開價目表,所有入口都指向「免費獲取」「免費試用」「下載體驗」的留資表單,典型的 To B 銷售線索打法。 能確定的免費部分是社群版:實在RPA 設計器社群版面向個人開發者、開源專案、學術教育和小型團隊免費,但明確限定非商業用途,OCR 和驗證碼這類高階元件有免費額度上限,也不提供官方技術支援。想真正商用,必須走商務談判。 至於企業版價格,官方內容營銷文章裡散落著幾個口徑,彼此還對不上。有一篇寫買斷制單機器人從幾萬到數十萬元永久授權,訂閱制 1.5 萬到 15 萬元一年,實施開發簡單場景 1 到 3 萬、複雜場景數十萬,運維費按初投的 15% 到 20% 計;換算到場景維度,單場景數萬元一年,跨部門多流程 15 到 30 萬一年,全鏈路改造 50 到 100 萬一次性。另一篇說許可證按機器人數量收費,基礎版 1 萬到 3 萬元一年。更早的文章又寫單個數字員工授權加綜合部署成本約 3 到 5 萬一年。三處口徑打架,只能當作數量級參考,真實報價一定是一客一議。 交付形態支援 SaaS、私有化部署和軟硬一體機,還跟華為搞過「Agent + DeepSeek 昇騰一體機」,跟惠普做過 Z 系列數字員工一體機。生態上宣稱超千家生態夥伴、400 多家渠道夥伴。這套打法很清楚:政企和大型企業客戶為主,靠渠道和專案制落地,客單價不低但交付重。
-
正面反饋集中在效率提升的量化收益上,官網列了一長串案例。周黑鴨用實在Agent 做 50 個平臺、近 90 個系統的資料核對,從人工每月 600 小時降到每天自動執行 14 小時,一年省下近 188 萬元、約 8 個財務人力。太平鳥每天自動獲取 30 家店鋪超 1000 種資料,人工每週只需 1 小時,效率提升 300%、成本降低 80%、準確率穩定在 100%。妙潔一年執行 5700 多小時,年省近 62 萬人力成本。青島啤酒整合多系統資料後庫存成本降了 87%。江中藥業覆蓋 50 餘個日常業務場景,資料獲取效率提升 6 倍。 使用者原話裡也有幾條比較真實的表達。有跨境賣家說「抖音店鋪後臺頁面更新非常頻繁,資料來源經常發生變化,但實在Agent 都能及時維護更新流程」,這句其實點出了 Computer-Use 類產品的核心痛點和廠商維護投入。有客戶說「實在Agent 對我們來說是價效比最高的一項投資,業務人員沒有減少,但能做的工作更多了」——這個表述比「替代多少人力」誠實得多。 負面反饋在第三方點評平臺上能看到。36 氪企業軟體點評站上實在智慧的使用者評分約 4.0 分,吐槽集中在幾點:穩定性偶有波動、客戶端效能佔用偏高、跨系統相容性有短板、遇到真正複雜的判斷類問題處理能力不足。CSDN 上的評測文章提到產品體系偏複雜、行業模板往往需要二次開發才能用,這基本是國產 RPA 的通病。 需要說明的是,所有量化收益資料都來自廠商自述和客戶配合的案例通稿,沒有第三方審計。客戶數量的口徑也一直在變:2022 年說 1500 到 2500 家,2024 年底 4000 家,官網「關於我們」寫 5000 家,2026 年 7 月的新聞稿變成 6000 家。增長曲線合理,但精確性存疑。
-
這次登頂在國內媒體上傳播很廣,36 氪、品玩、浙商雜誌、中華時報都做了報道。主流敘事有兩個:一個是「工程化正規化轉移」,即 Agent = Model + Harness,模型是大腦但光有大腦不夠,工程排程能力正在成為決定落地效果的核心變數;另一個是「浙產之光」的地方產業敘事。清華大學智慧產業研究院院長張亞勤在今年 1 月的 AGI-Next 峰會上判斷,以對話為核心的 Chat 正規化已經結束,AI 競爭轉向能辦事的智慧體時代——這個觀點被廣泛引用來給實在Agent 的成績背書。 不過要客觀說,機器之心、量子位、雷峰網、InfoQ 這些技術媒體的獨立深度報道沒有找到,多篇報道措辭高度雷同,通稿屬性明顯。真正有分量的第三方技術分析目前缺位。 競品格局上,OSWorld 榜單是個不錯的觀察視窗。此前的關鍵節點包括 Simular Agent S2 以 72.6% 首次超過人類基準,Pointer 做到 83.6%,Anthropic 的 Claude Sonnet 5 報 81.2%,谷歌 Gemini 3.6 Flash 約 83%。Meta、MiniMax、UiPath、聯想都在榜上。位元組的 UI-TARS 走的是原生端到端模型路線,UI-TARS-2 曾報 47.5 分。實在Agent 與它們最大的區別就是框架路線——不訓專用模型,靠工程層把通用模型的能力壓榨出來。這條路的好處是模型迭代紅利可以直接吃到,壞處是護城河更依賴工程 Know-how 而非模型資產。 國內 RPA 賽道的競爭則要激烈得多。影刀、來也科技、弘璣 Cyclone、藝賽旗、金智維、UiPath 中國區都在搶同一批政企客戶。值得注意的是,在某些第三方的 2026 中國 RPA 廠商 TOP10 榜單裡,實在智慧只排到第 4,落後於藝賽旗和來也。OSWorld 的技術領先和市場份額領先,顯然不是一回事。
-
第一層爭議來自基準本身。OSWorld 由香港大學 XLANG Lab 聯合 CMU、滑鐵盧大學提出,2024 年發表於 NeurIPS。2025 年官方推出 OSWorld-Verified 時,主動承認原版存在 300 多個問題,包括網頁內容變動、CAPTCHA 干擾、指令歧義、評測指令碼脆弱等,並明確指出「當前領先模型的成功主要源於大量人類軌跡資料」——這句話本身就暗示了過擬合風險。 更尖銳的質疑來自 UC Berkeley 的 Dawn Song 團隊。他們構建了一個自動 exploit agent,在包括 OSWorld 在內的 8 大 Agent 基準上,不真正解題就能拿到 73% 到 100% 的高分,揭示評分器可被操縱的結構性漏洞。這項工作登上過 Hacker News 熱榜第一。這不是說實在智慧刷分,而是說明這類基準的分數需要配合完整的 harness 披露才有意義,「不披露 harness 的分數近乎無意義」已經成為部分研究者的共識。 第二層是與真實環境的差距。XLANG 已經發布 OSWORLD 2.0,任務改成更長程、更復雜的真實工作流,結果同一模型在舊版能拿 83.5%,新版只有 20.6%。這個斷崖式落差說明舊榜確實趨近飽和,90% 與生產環境可用之間還有相當距離。實在智慧自己也承認,企業真實辦公環境充滿軟體版本更新、隨機廣告彈窗、系統通知抖動、網路延遲這些非標準干擾,而在財務、HR、供應鏈這些場景裡,9.8% 的失敗率可能意味著發錯郵件或填錯付款金額這樣的重大風險。 第三層是 Computer-Use 類智慧體的通用安全風險。這類 Agent 直接接管螢幕和鍵鼠,天然面臨 prompt injection(網頁裡藏一段隱藏指令就可能誘導 Agent 洩露檔案)、憑證竊取、越權操作等威脅。IBM 的報告稱,97% 出現 AI 相關資料洩露的組織缺乏對 AI 系統的訪問控制。實在Agent 有安全斷路器和審計日誌,但這套機制在真實攻防下的強度,還沒有公開的第三方測試結果。 第四層是行業層面的商業化困境,這可能是最實際的問題。國產 RPA 廠商的客戶年流失率均值約 30%,而美國同行的中位數是 7%。行業普遍陷入價格戰和重定製的專案制泥潭,人均年產出只有 20 到 30 萬元,「整個行業不賺錢」是從業者的普遍感受。實在智慧的公開經營資料不詳,啟信寶上能看到集團層面有若干關聯風險記錄,但具體的裁員、訴訟、業績負面報道沒有找到公開資訊。C 輪融資停在 2023 年底,之後兩年多沒有新一輪公開訊息,也沒有 IPO 輔導資訊。
-
最匹配的是有大量跨系統重複操作、且這些系統沒有開放 API 的中大型企業,典型場景是財務對賬、多平臺電商資料採集、供應鏈單據處理、HR 簡歷初篩。如果你的痛點正好是「幾十個後臺每天要人工登入導資料」,實在取數寶這類產品的 ROI 會非常直觀,前面提到的周黑鴨、太平鳥案例都是這個模式。 信創環境是另一個明確優勢區。支援統信、麒麟,有等保三級和一堆國家級資質,對央國企和政府客戶來說這是准入門檻而不是加分項。 不太適合的情況也很清楚。個人開發者和小團隊:社群版限定非商業用途,商用要走銷售流程,起步成本不低;輕量自動化需求,用 Python 指令碼、Playwright 或者影刀這類更輕的工具可能更划算。高風險不可逆操作場景要謹慎:涉及資金劃轉、對外傳送、生產系統寫入的流程,務必開啟人工確認環節,不要指望 90% 的成功率能直接放開跑。還有就是期待「買來即用」的企業要有心理準備,行業模板通常需要二次開發,交付週期和實施成本要提前算進預算。 替代方案上,國內可以對比影刀 RPA(更輕更便宜)、來也科技(對話式 AI 更強)、藝賽旗和金智維(金融行業積累深);國際方案 UiPath 生態最成熟但價格和信創合規是問題;如果只需要瀏覽器內自動化,Anthropic 的 Claude Computer Use、OpenAI 的 Operator 或開源的 browser-use 都值得評估。
-
實在Agent 拿下 OSWorld 90.20% 是一個實打實的工程成就,它證明了在不訓練專用模型的前提下,靠八年積累的自動化 Know-how 和 Harness 工程體系,中國團隊能在全球智慧體基準上做到斷層領先。這個成績對整個行業的啟示大於對單個公司的營銷價值——它把「Agent = Model + Harness」這個判斷從假設變成了可驗證的事實。 但榜單只是駕照考試,不是馬路實戰。OSWorld 舊版趨近飽和、2.0 版本分數斷崖、基準評分器本身被證明可被操縱,這些都提醒我們不要把 90.2% 直接讀成「可以放心用了」。真正的考驗在於:能不能把這套能力以可接受的成本、可控的風險、可複製的交付方式,塞進幾千家企業亂七八糟的真實辦公環境裡,並且讓客戶第二年還願意續費。對一家困在 RPA 行業 30% 流失率和重專案制泥潭裡的公司來說,這道題比刷榜難得多。
使用者評論
-
SButler_88—OSWorld 90.2% 確實牛,但得潑盆冷水,舊版基準已經快飽和了,2.0 版本同一套方案直接掉到 20.6%,榜單和真實生產環境差著一截呢。 -
悠然454—OSWorld 2.0 把任務從兩分鐘拉長到平均一點六小時、要兩百五十多步,最強模型也就做兩成,說明長程任務才是真難關。實在Agent 在 1.0 登頂很猛,但能不能扛住 2.0 那種一下午的活還得再看,現在下單別隻盯著那 90.2% 看。 -
KCook_Plus3—看到 UC Berkeley 那個 Dawn Song 團隊做的 exploit agent 研究挺觸目驚心,不真正解題、靠操縱評分器就能在 OSWorld 這類基準上拿到七成到滿分的高分,還登上了 Hacker News 熱榜第一。這說明光看榜首分數真沒意義,得看 harness 披露得全不全,不然就是自嗨,實在智慧也沒法用一句話撇清。 -
AngelaWard_66—上週做了個跨系統同步的實測,原來用爬蟲加人工同步一次要十五分鐘、出錯率百分之八點幾,換實在Agent 後一次只要一分多鐘、出錯率低於千分之一,而且 UI 變了它自己能重新對映,維護成本幾乎為零,這 ROI 確實能算過來賬。 -
ticklishswan803—我們做跨境電商的,抖音店鋪後臺頁面更新特別頻繁,資料來源經常變,以前爬蟲一變就崩,得專人盯著改。但實在Agent 每次都能及時維護更新流程,UI 變了它自己重新對映,比純指令碼省心太多,這點對我們的日常運營幫助最大,終於不用半夜被報警叫起來改選擇器了。 -
AlanSanchez—真香,一句話就能生成流程。 -
ChainChaserKristensen—用了半年多,體感是它適合幾十個後臺每天人工登入導資料這種痛點,我們供應鏈單據處理效率提升很明顯,但客服類複雜語義理解還是一般,真要替代人做決策還早,目前定位成數字員工助理更準。 -
Richard_ChavezSr—Agent OS v5.2 那套 PDA-M-R 閉環架構(感知、決策、執行、記憶、反思)聽著玄,實際用下來自主重試和狀態管理確實比老 RPA 穩。網路卡頓它會自己等一會再試,遇到異常能走替代路徑,不像老 RPA 指令碼報錯就直接停,這點對長流程特別關鍵。 -
趙濤—在信創環境踩過坑,麒麟系統上字型渲染引擎和 Windows 不同,導致 Agent 定位按鈕座標出現偏移,根因是依賴絕對座標而非視覺識別。後來改用它的視覺識別按影象特徵點匹配才穩下來,還順手把 NPU 推理框架用容器隔離了,看來純座標定位在信創上真的不靠譜,視覺才是正道。 -
BruceBerg—我們對接的是 DeepSeek 私有化部署,資料安全這塊比較放心,token 消耗也比公有云 API 低不少,加上它本來的 RPA 執行層,算是把思考和動手打通了。不過實施週期不短,跨部門複雜流程從 POC 到上線跑了小半年,行業模板基本都二次開發過,預算要提前算進去。 -
Mo_nique613—我們財務用它核對幾十個平臺的訂單,以前每月要六百小時,現在每天自動跑,人基本不用管了。 -
BrianRogersK0—實在Agent 最打動我的是不用對接 API,我們那套老 ERP 根本沒介面,純靠視覺識別照樣能把資料抓出來填回去,對遺留系統太友好了。 -
Linda_CampbellII—期待能直接替代人力,結果還是得留人複核。 -
陳月—實在Agent 企業版大概什麼價位啊?官網全是留資表單,連個價目表都不敢放,有沒有踩過坑的老哥說一下真實報價? -
Sandra.Hart—價格這塊真不透明,我看到的口徑從單機器人幾萬到數十萬都有,訂閱制一年一萬五到十五萬,三處對不上,只能當數量級參考,最後肯定是一客一議。 -
NWood_Max—客戶端效能佔用偏高,跑大型流程時機器風扇響得不行。 -
pARKER76—穩定性偶有波動,複雜一點的判斷類任務還是得人工兜底,別指望它完全自主跑完。 -
RBennettIII—安全斷路器這個設計不錯,涉及敏感資料會自動提權確認,敢讓 Agent 動財務之前必須開著。 -
purplewolf123—別在資金劃撥這種不可逆操作上放開跑,9.8% 的失敗率放到付款場景就是發錯錢的風險,人工最後一道閘門必須留著。 -
NodeRunnerHartman—建議先用社群版練手,非商業免費,別一上來就走商務流程,銷售那邊報價一客一議,水挺深。 -
廖晨勇—行業模板大多要二次開發才能用,CSDN 那篇評測說得實在,這基本是國產 RPA 的通病,買來即用基本不現實。 -
Christina_RossK—三十六條點評站上評分大概四點零,吐槽集中在穩定性、相容性和複雜判斷,跟我們實際用的體感差不多,瑕不掩瑜但別神話。 -
Joyce_GomezQ—浙產之光,確實給力哈哈。 -
ABrown_2021—免費社群版真香,就是不能商用。 -
Alan_JonesQ—周黑鴨那個案例挺有說服力,五十個平臺近九十套系統核對,一年省下快兩百萬、約八個財務人力,雖然資料來自廠商通稿沒第三方審計,但模式確實是這個模式。 -
RWhite_2024—新手建議從高頻規則明確的場景切入,比如財務票據處理、報表生成,小步快跑驗證 ROI,別一上來就搞全鏈路改造,那預算和實施週期都吃不消。 -
Sarah_Roberts_Pro—視覺識別是真強,CSS 類名變了它還能認出訂單號和商品數量,比 XPath 定位抗造。 -
DianaMurphy36907—有在央國企信創環境落地的嗎?等保三級和一堆國家級資質看著像准入門檻,想了解下實際交付重不重。