腾讯开源三大具身基座模型,张正友详解「三层脑」破解机器人反应慢

分层架构的具身新思路

2026-07-27 02:39

WAIC 2026期间,腾讯正式开源了Hy-Embodied-VLM、Hy-Embodied-RxBrain、Hy-Embodied-VLA三款具身基座模型。同时发布的还有持续在线的具身智能体Apexio和原生框架TairosAgent,共同构成了腾讯具身智能的完整矩阵。

腾讯Robotics X实验室主任张正友在采访中透露了一个值得深思的故事。团队曾经把机器人的各项能力封装成Skill,交给通用的智能体框架OpenClaw去调度,结果「整个效果非常之差」,甚至还不如去年给宇树做的导览系统。张正友的结论很直接:OpenClaw这类框架服务的是数字系统里的智能体——操控的身体相当于浏览器,不是机器人。浏览器可以等,机器人却不能。一个任务从下达到响应要几十秒,肯定受不了。

随后团队为机器人的任务调度和模型协同设计了原生的TairosAgent框架,将响应时间压到2至3秒。这个时间主要对应上层任务理解与智能体交互,而真正涉及碰撞、失衡和力觉变化的身体反应,必须快得多。

由此,腾讯将具身智能拆成了三个同时在线但运行频率不同的层级。Hy-Embodied-VLM负责空间与场景理解,Hy-Embodied-RxBrain负责认知规划与未来状态想象,Hy-Embodied-VLA负责高层目标到连续动作的转化。 核心思路是让不同类型的智能以不同频率运行:最上层认知系统按需唤醒,中间层感知行动系统以约15Hz持续接收多模态信息并快速调整动作,最下层执行系统以更高频率运行,像条件反射一样处理碰撞和失衡。

张正友认为这套分层架构不会因为算力进步而被淘汰——它对应的不是某一代模型的性能限制,而是物理世界本身存在的时间尺度差异。

特别值得一提的是RxBrain模型。它不只依赖语言生成任务步骤和约束,还会提前预测每个子任务完成后物理世界应该呈现什么状态。语言表达目的约束,视觉承载位置姿态。这就解释了「裂脑」实验的用意:语言只是认知的一条低带宽容通道,RxBrain把视觉状态放进信息通路,相当于拓宽了认知带宽。

落地层面,腾讯已经和宇树、智元、越疆等头部本体企业深度合作。Hy-Embodied-VLA已进入一家日化品工厂进行生产测试,在高混合、小批量的产线上,作业成功率超过95%,单件节拍快于6秒。面对新增SKU,留给数据采集和模型后训练的时间不到3天。

从浏览器到机器人,从小六的四种按摩手法到日化工厂的万次稳定抓取——腾讯用这套分层架构给出了一条具身智能走出实验室的务实路径。