騰訊開源三大具身基座模型,張正友詳解「三層腦」破解機器人反應慢
分層架構的具身新思路
WAIC 2026期間,騰訊正式開源了Hy-Embodied-VLM、Hy-Embodied-RxBrain、Hy-Embodied-VLA三款具身基座模型。同時釋出的還有持續線上的具身智慧體Apexio和原生框架TairosAgent,共同構成了騰訊具身智慧的完整矩陣。
騰訊Robotics X實驗室主任張正友在採訪中透露了一個值得深思的故事。團隊曾經把機器人的各項能力封裝成Skill,交給通用的智慧體框架OpenClaw去排程,結果「整個效果非常之差」,甚至還不如去年給宇樹做的導覽系統。張正友的結論很直接:OpenClaw這類框架服務的是數字系統裡的智慧體——操控的身體相當於瀏覽器,不是機器人。瀏覽器可以等,機器人卻不能。一個任務從下達到響應要幾十秒,肯定受不了。
隨後團隊為機器人的任務排程和模型協同設計了原生的TairosAgent框架,將響應時間壓到2至3秒。這個時間主要對應上層任務理解與智慧體互動,而真正涉及碰撞、失衡和力覺變化的身體反應,必須快得多。
由此,騰訊將具身智慧拆成了三個同時線上但執行頻率不同的層級。Hy-Embodied-VLM負責空間與場景理解,Hy-Embodied-RxBrain負責認知規劃與未來狀態想象,Hy-Embodied-VLA負責高層目標到連續動作的轉化。 核心思路是讓不同型別的智慧以不同頻率執行:最上層認知系統按需喚醒,中間層感知行動系統以約15Hz持續接收多模態資訊並快速調整動作,最下層執行系統以更高頻率執行,像條件反射一樣處理碰撞和失衡。
張正友認為這套分層架構不會因為算力進步而被淘汰——它對應的不是某一代模型的效能限制,而是物理世界本身存在的時間尺度差異。
特別值得一提的是RxBrain模型。它不只依賴語言生成任務步驟和約束,還會提前預測每個子任務完成後物理世界應該呈現什麼狀態。語言表達目的約束,視覺承載位置姿態。這就解釋了「裂腦」實驗的用意:語言只是認知的一條低頻寬容通道,RxBrain把視覺狀態放進資訊通路,相當於拓寬了認知頻寬。
落地層面,騰訊已經和宇樹、智元、越疆等頭部本體企業深度合作。Hy-Embodied-VLA已進入一家日化品工廠進行生產測試,在高混合、小批次的產線上,作業成功率超過95%,單件節拍快於6秒。面對新增SKU,留給資料採集和模型後訓練的時間不到3天。
從瀏覽器到機器人,從小六的四種按摩手法到日化工廠的萬次穩定抓取——騰訊用這套分層架構給出了一條具身智慧走出實驗室的務實路徑。