騰訊 Hy-Embodied 具身基座模型
騰訊基於混元大模型打造的具身智慧基座模型系列,涵蓋視覺理解(VLM-1.0)、世界認知(RxBrain-1.0)和視覺-語言-動作聯合模型(VLA-0.5),在 WAIC 2026 釋出並開源
深度報告
-
2026年7月,騰訊在上海世界人工智慧大會(WAIC)上正式釋出了一套完整的具身智慧基座模型體系——Hy-Embodied 系列,包括視覺理解模型 VLM-1.0、世界認知模型 RxBrain-1.0、以及視覺-語言-動作聯合模型 VLA-0.5。這是騰訊首次系統性地將「感知—認知—行動」整合為一個完整的具身智慧閉環。三個模型全部基於騰訊混元大模型打造,並在釋出當天同步開源。與此同時,騰訊還推出了持續線上具身智慧體 Apexio、具身原生框架 TairosAgent,以及對 Tairos(鈦螺絲)開放平臺的全面升級,覆蓋從雲端算力到機器人本體的全鏈路。這套方案的核心判斷是:當前最智慧的 AI 本質上仍是「缸中之腦」——它擅長推理和對話,卻缺乏與物理世界直接互動的閉環。Hy-Embodied 系列瞄準的正是這個缺口。
-
Hy-Embodied 系列由騰訊 Robotics X 實驗室、福田實驗室與騰訊混元聯合研發。騰訊 Robotics X 實驗室成立於 2018 年,長期專注機器人與具身智慧的基礎研究,福田實驗室則聚焦空間智慧與具身互動,兩者在 2025 年已有「鈦螺絲」Tairos 開放平臺等一系列積累。 三個模型的定位分工非常清晰:VLM-1.0 像「右腦」,負責理解影象、空間和場景,在僅消耗上一代旗艦約十分之一算力的前提下,就接近了同等水平的視覺理解效能;RxBrain-1.0 像具身的「大腦」,在一個統一架構中同時完成文字推理與視覺目標想象——它不只告訴動作模型「接下來該做什麼」,還能以影象形式展示「做完之後世界應該變成什麼樣」;VLA-0.5 像「小腦」和身體之間的橋樑,把高層的認知目標轉化成連續的、可糾錯的物理動作序列。 這次釋出並非單純的學術成果展示。騰訊在 WAIC 論壇上同步宣佈,VLA-0.5 已經進入一家日化品工廠進行生產實測,在高混合、小批次、SKU 頻繁迭代的真實產線上,作業成功率超過 95%,單件節拍快於 6 秒,新增一個 SKU 留給資料採集與模型後訓練的時間不到 3 天。
-
VLM-1.0 的核心能力是開放世界的視覺理解。它接收多視角影象輸入,輸出空間語義表徵——物體位置、可操作性判斷、場景佈局等。相比上一代 VLM,它在計算量降低約 90% 的前提下,在 CV-Bench、EmbSpatial 等空間理解基準上保持了接近的效能,這意味著它更適合部署在算力受限的機器人本體上。 RxBrain-1.0 是整套模型中最具技術亮點的部分。它採用 Mixture-of-Transformers 架構,以模態為路由,將文字 Token、輸入視覺 Token 和生成視覺 Token 分別路由到專用計算路徑。文字與視覺理解各佔約 1.5B 引數,視覺生成額外增加 2.4B 的 FFN Expert,總引數約 6.2B。它在 GenEval 文生圖評測中拿到 82.4 分,與生成專用模型 BAGEL 的 82 分持平,說明統一架構沒有以犧牲生成質量為代價。在具身推理方面,它在 RxBrain-Bench 的綜合規劃得分 0.68,遠超模組化方案——相比之下,由 Qwen3-VL-2B 與 Qwen-Image-Edit 組合的 Agent 得分僅為 0.431。在多步規劃和視覺目標想象這類聯合任務中,統一模型的優勢非常明顯:模組化系統在多步執行時容易出現語言重複、目標影象與計劃脫節、狀態漂移等問題,而 RxBrain 在同一個上下文中交替生成子任務文字和目標影象,並將上一輪生成結果重新注入後續規劃,一致性遠優於外部編排。 RxBrain 還進一步擴充套件了動作生成分支 Action MoT。它給動作 Token 配置了獨立的注意力投影和 FFN,同時保留與其他模態的全域性注意力互動。動作引數由視覺理解分支初始化,並引入門控融合機制——動作專家可以按通道從視覺生成專家中選擇性地借用世界狀態預測與規劃特徵。真機驗證中,在 DOBOT X-Trainer 和方舟無限 A5 兩類機械臂上,擺放餐具、摺疊收納眼鏡、丟垃圾三個多階段任務的平均成功率達到 87%,相比 π0 的 68% 和 π0.5 的 82% 均有明顯提升。 VLA-0.5 則主打事實驗證。它在第三方 RoboDojo 評測的五個維度——泛化、記憶、精細操作、長程執行、開放語義理解——中拿到了模擬綜合排名第一,在長程任務和記憶任務兩個維度同樣位居榜首。超過一萬小時的高精度人類示教資料是它的訓練基礎。 在智慧體層面,Apexio 的架構頗具巧思。它由三層以不同頻率同時線上的能力構成:最上層認知系統按需喚醒做深度思考,中間層感知行動系統以約 15Hz 持續接收多模態資訊並快速調整,最下層執行系統以更高頻率執行、像條件反射一樣瞬間處理碰撞與失衡。系統同時由「目標驅動」(完成任務)和「生存驅動」(維護安全、控制能耗)兩條主線牽引,即使沒有外部指令,也在持續感知和準備下一次行動。 TairosAgent 則是從設計第一天起就為機器人本體原生打造的框架,而非從通用框架改造而來。它透過統一的硬體適配層和標準化 Skill 介面,可以接入不同型號的機器人。據騰訊披露,在導航、講解、被打斷後恢復等典型場景中,響應時間從通用框架的幾十秒縮短到 2-3 秒。
-
Hy-Embodied 系列模型全部開源。模型權重可以在 GitHub 和 HuggingFace 上直接下載。VLM-1.0 和 VLA-0.5 使用 MIT 許可證,RxBrain-1.0 也採用了開放許可。 騰訊的變現路徑更偏向平臺層和雲服務層。Tairos 平臺面向機器人整機和系統開發商開放,提供開源的模型、智慧體、開發工具和一站式服務。騰訊雲則搭建了從算力底座、模型服務到感知互動的三層基礎設施體系,並推出了雲端的 EaaS(Embodied-AI-as-a-Service)。這意味著客戶可以按需呼叫具身智慧能力,而不必自建全套基礎設施。 此外,騰訊雲 HAI(高效能 AI 算力)、多網聚合加速、TRRO 等服務也與 Hy-Embodied 系列聯動。工業客戶可以透過騰訊雲直接獲取訓練和部署所需的算力、儲存和網路能力。
-
正面評價 第三方社群的反饋集中在幾個點上:統一架構的工程取捨被認為非常務實。多位 AI 從業者在 HuggingFace 評論區提到,RxBrain 將文字推理與視覺想象塞進約 6B 引數裡的做法「比單純堆引數更值得學習」;真機驗證資料公開且與開源模型一一對應,也獲得了好評。在 Reddit 的 r/MachineLearning 板塊,有使用者評價「終於有一家大廠在做具身智慧時不是隻發論文了」。 中文社群的反饋更多集中在對「缸中之腦」論述的認同上。知乎上的高贊回答普遍認為,張正友在 WAIC 上的判斷「點出了當前大模型的根本侷限」,Hy-Embodied 的釋出「至少表明騰訊在走一條不一樣的路」。 負面反饋 批評聲音主要集中在實際可用性的距離上。RxBrain 在 8 步長程規劃場景中得分從 0.69 下降到了 0.55,一步比一步差的趨勢說明視覺想象的誤差累積仍是瓶頸。一些技術評論指出,雖然 RxBrain 展示了「統一大腦」的潛力,但要讓它在工廠產線上連續執行數小時不出錯,「現在還不是時候」。 定價方面也有一些不滿。模型雖開源,但真正要在工廠裡跑起來,騰訊雲算力的成本並不低——有知乎使用者算了一筆賬,部署一套完整的 Hy-Embodied 方案,僅 GPU 租賃成本每月就要數萬元。Tairos 平臺的企業級服務也並非免費。 使用場景 除了工業產線,騰訊還披露了導購導覽和養老服務兩個落地場景。在商場導覽機器人場景中,VLA-0.5 能夠根據自然語言指令完成帶路、介紹商品、回答問詢等任務;在養老場景中,模型主要負責藥品遞送、跌倒檢測響應和簡單的陪伴對話。
-
從行業反應來看,Hy-Embodied 系列的釋出被視為一個重要的訊號:中國大廠正在從「模型層競爭」轉向「應用層競爭」。與 Google、Meta 等海外公司在機器人領域的謹慎表態不同,騰訊這次直接給出了從基礎模型到雲服務再到開放平臺的全棧方案,而且明確表示——開源、可商用。 在 RoboDojo 綜合排名第一的成績,意味著 VLA-0.5 至少在模擬環境中的綜合能力已經超過了當前主流的開放方案。不過也要看到,模擬與真機之間仍有差距:在 RoboDojo 中表現出色的模型,在物理世界中可能因為感測器噪聲、延遲、硬體差異等問題表現打折。騰訊在真機上只測試了三類任務(擺放餐具、收納眼鏡、丟垃圾),覆蓋範圍有限。 從競品格局來看,國內具身智慧賽道已經相當擁擠。位元組跳動有 GR-2 系列、華為有盤古具身模型、小米有 CyberOne 及背後的力控演算法團隊。騰訊的優勢在於模型全部開源、混元大模型全家桶的協同效應、以及 Tairos 平臺的生態積累。劣勢則在於:相比位元組和小米,騰訊在硬體——尤其是人形機器人整機——方面的佈局相對薄弱,當前更多依賴合作伙伴。
-
一個值得注意的爭議點是「開源」的實際含義。Hy-Embodied 三個模型雖然開源了權重和推理程式碼,但訓練資料(超過 5 萬小時具身資料)並未開放。訓練資料的規模和質量直接決定了模型的泛化能力上限,當其他團隊無法復現或定製時,所謂「開源」的實際可複用性就要打折扣。 另一個風險來自行業應用的成熟度。日化品工廠的實測資料看起來漂亮(>95% 成功率),但這只是一個 SKU 變化頻繁但操作相對簡單的場景。汽車裝配、精密電子製造等對精度和容錯率要求更高的行業,具身智慧模型的當前能力是否足以支撐,尚無公開驗證資料。 此外,Apexio 的三層架構雖然在技術上很有說服力,但從三層「同時線上」到真正穩定落地,涉及大量系統工程和硬體適配工作。正如一位機器人工程背景的知乎答主所評論的:「實驗室展示的 demo 和在產線上跑兩個班不出岔子,是兩個完全不同的東西。」
-
Hy-Embodied 系列最適合以下兩類使用者:第一類是機器人系統和整機開發商,可以直接下載開源模型進行二次開發和適配,利用 Tairos 平臺的工具鏈降低原型開發成本。第二類是工業客戶,可以透過騰訊雲的 EaaS 服務快速試水具身智慧在產線上的可行性,而不必自建訓練和部署基礎設施。 不太適合的場景包括:對定位精度要求極高的精密裝配線、安全關鍵應用(如醫療手術輔助),以及需要在邊緣端極低功耗裝置上執行的場景。在這些情況下,面向技能的專用模型或規則系統目前可能仍是更穩妥的選擇。
-
騰訊 Hy-Embodied 系列是 2026 年具身智慧領域最重要的開源方案之一。它在模型架構上的核心貢獻——把文字推理與視覺想象統一到一個連續認知序列中——確實回應了「缸中之腦」的問題。但也要客觀地說,從「讓機器人理解世界」到「讓機器人在真實世界中穩定工作」,Hy-Embodied 系列目前只完成了第一步。整套方案在長程任務的穩定性、訓練資料的可獲取性、以及複雜工業場景的適配性上,還有很長的路要走。
使用者評論
-
STurner_2020—騰訊這波發得挺猛的,VLM、RxBrain、VLA 三件套一口氣全開源了,關鍵是真有工廠落地資料,不是隻發論文。 -
MDiaz1689—RxBrain 那個統一文字推理和視覺想象的思路有點意思,比單純的 VLM+World Model 拼起來更優雅。 -
Emma_Hernandez—看了張正友關於「缸中之腦」的訪談,說得挺透的。現在大模型確實像關在缸裡的大腦,知識很豐富但沒有身體去驗證。 -
BrandonPowellK87—日化品工廠那個落地案例有點說服力,95% 成功率、6 秒/件的節拍、新增 SKU 只要 3 天適配,這資料在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的規模做到接近上代 A32B 的效果,這個效率提升是真的香,機器人端部署不用背那麼重的計算包袱了。 -
AnnaPetersonIII99—騰訊堅持不做機器人硬體本體,這點倒是挺清醒的。做平臺和大腦的邏輯對,但問題在於——機器人廠商願不願意把「大腦」外包給騰訊? -
TheElisaHidalgo_2024—全棧都開源了,Apache-2.0 協議,這點比位元組和小米厚道不少。不過訓練資料沒開源,5 萬小時的資料不放出來,別人想復現定製還是難。 -
Jonathan77z—Apexio 那個三層架構——認知、感知行動、執行——頻率從低到高分三層,挺像人腦的分層設計。說響應時間從幾十秒縮短到 2-3 秒,這個提升確實大。 -
PEbel—RoboDojo 模擬綜合第一確實好看,但模擬和真機之間的差距懂的都懂。騰訊自己也不敢多吹模擬,重點在講工廠實測。 -
MrLillySveum—說到底 RxBrain 目前最大的瓶頸還是視覺想象的誤差累積問題,八步規劃從 0.69 掉到 0.55,真的跑長程任務還是懸。 -
Bryan_Williams_2021—智元、星海圖它們都自研大模型了,騰訊的「平臺+生態」邏輯在移動網際網路時代沒錯,但在具身智慧這個領域,資料是核心生產資料,機器人廠商真的甘心把自己大腦交給別人? -
CClark_X266—VLA-0.5 那個 UMI 採集系統挺紮實的,亞毫米級精度、一萬小時人類示教資料,這是真金白銀砸出來的。不是那種「在模擬裡跑了幾個 benchmark 就吹上天」的路線。 -
beautifulcat979—騰訊這次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起發了,覆蓋面確實廣。但具身智慧這塊還是覺得偏早期,離真正的通用機器人還有很大距離。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生圖得分 82.4,和 BAGEL 的 82 分持平,一個具身認知模型能做出這個生成質量確實意外。說明統一架構沒有犧牲生成能力。 -
SAmen—WAIC 轉了一圈,騰訊的展臺是人最多的之一。現場那個按摩機器人「小六」的力控確實驚豔,聽說基於腱繩傳動,能復現人手的按摩軌跡。 -
MMitchellJr86—對比前年 WAIC 的 PPT 釋出,騰訊這次有了 Tairos 平臺的一年沉澱、有了工廠落地資料、有了開源生態,進步還是看得見的。但具身智慧這個賽道還有很長的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在說自己做了世界模型。張正友說「世界模型還沒有統一定義」,還是比較誠實的。 -
rtko4f2uts—騰訊的 EaaS 思路對中小機器人廠商很友好,不用自建訓練和部署基礎設施。但 GPU 的租賃成本算下來一個月也得幾萬塊,也不是小數目。 -
GloriaMiller_2021—Hy-Embodied 這個命名體系挺好的,VLM 是眼睛、RxBrain 是大腦、VLA 是小腦。對開發者來說很清楚該用哪個。 -
Sharon_Cooper_99_684—騰訊如果不做硬體本體,那和宇樹、智元它們的競合關係會很微妙——既是平臺提供方,又是投資人。這種雙重身份怎麼處理還沒看到答案。