腾讯 Hy-Embodied 具身基座模型
腾讯基于混元大模型打造的具身智能基座模型系列,涵盖视觉理解(VLM-1.0)、世界认知(RxBrain-1.0)和视觉-语言-动作联合模型(VLA-0.5),在 WAIC 2026 发布并开源
深度报告
-
2026年7月,腾讯在上海世界人工智能大会(WAIC)上正式发布了一套完整的具身智能基座模型体系——Hy-Embodied 系列,包括视觉理解模型 VLM-1.0、世界认知模型 RxBrain-1.0、以及视觉-语言-动作联合模型 VLA-0.5。这是腾讯首次系统性地将「感知—认知—行动」整合为一个完整的具身智能闭环。三个模型全部基于腾讯混元大模型打造,并在发布当天同步开源。与此同时,腾讯还推出了持续在线具身智能体 Apexio、具身原生框架 TairosAgent,以及对 Tairos(钛螺丝)开放平台的全面升级,覆盖从云端算力到机器人本体的全链路。这套方案的核心判断是:当前最智能的 AI 本质上仍是「缸中之脑」——它擅长推理和对话,却缺乏与物理世界直接交互的闭环。Hy-Embodied 系列瞄准的正是这个缺口。
-
Hy-Embodied 系列由腾讯 Robotics X 实验室、福田实验室与腾讯混元联合研发。腾讯 Robotics X 实验室成立于 2018 年,长期专注机器人与具身智能的基础研究,福田实验室则聚焦空间智能与具身交互,两者在 2025 年已有「钛螺丝」Tairos 开放平台等一系列积累。 三个模型的定位分工非常清晰:VLM-1.0 像「右脑」,负责理解图像、空间和场景,在仅消耗上一代旗舰约十分之一算力的前提下,就接近了同等水平的视觉理解性能;RxBrain-1.0 像具身的「大脑」,在一个统一架构中同时完成文本推理与视觉目标想象——它不只告诉动作模型「接下来该做什么」,还能以图像形式展示「做完之后世界应该变成什么样」;VLA-0.5 像「小脑」和身体之间的桥梁,把高层的认知目标转化成连续的、可纠错的物理动作序列。 这次发布并非单纯的学术成果展示。腾讯在 WAIC 论坛上同步宣布,VLA-0.5 已经进入一家日化品工厂进行生产实测,在高混合、小批量、SKU 频繁迭代的真实产线上,作业成功率超过 95%,单件节拍快于 6 秒,新增一个 SKU 留给数据采集与模型后训练的时间不到 3 天。
-
VLM-1.0 的核心能力是开放世界的视觉理解。它接收多视角图像输入,输出空间语义表征——物体位置、可操作性判断、场景布局等。相比上一代 VLM,它在计算量降低约 90% 的前提下,在 CV-Bench、EmbSpatial 等空间理解基准上保持了接近的性能,这意味着它更适合部署在算力受限的机器人本体上。 RxBrain-1.0 是整套模型中最具技术亮点的部分。它采用 Mixture-of-Transformers 架构,以模态为路由,将文本 Token、输入视觉 Token 和生成视觉 Token 分别路由到专用计算路径。文本与视觉理解各占约 1.5B 参数,视觉生成额外增加 2.4B 的 FFN Expert,总参数约 6.2B。它在 GenEval 文生图评测中拿到 82.4 分,与生成专用模型 BAGEL 的 82 分持平,说明统一架构没有以牺牲生成质量为代价。在具身推理方面,它在 RxBrain-Bench 的综合规划得分 0.68,远超模块化方案——相比之下,由 Qwen3-VL-2B 与 Qwen-Image-Edit 组合的 Agent 得分仅为 0.431。在多步规划和视觉目标想象这类联合任务中,统一模型的优势非常明显:模块化系统在多步执行时容易出现语言重复、目标图像与计划脱节、状态漂移等问题,而 RxBrain 在同一个上下文中交替生成子任务文本和目标图像,并将上一轮生成结果重新注入后续规划,一致性远优于外部编排。 RxBrain 还进一步扩展了动作生成分支 Action MoT。它给动作 Token 配置了独立的注意力投影和 FFN,同时保留与其他模态的全局注意力交互。动作参数由视觉理解分支初始化,并引入门控融合机制——动作专家可以按通道从视觉生成专家中选择性地借用世界状态预测与规划特征。真机验证中,在 DOBOT X-Trainer 和方舟无限 A5 两类机械臂上,摆放餐具、折叠收纳眼镜、丢垃圾三个多阶段任务的平均成功率达到 87%,相比 π0 的 68% 和 π0.5 的 82% 均有明显提升。 VLA-0.5 则主打事实验证。它在第三方 RoboDojo 评测的五个维度——泛化、记忆、精细操作、长程执行、开放语义理解——中拿到了仿真综合排名第一,在长程任务和记忆任务两个维度同样位居榜首。超过一万小时的高精度人类示教数据是它的训练基础。 在智能体层面,Apexio 的架构颇具巧思。它由三层以不同频率同时在线的能力构成:最上层认知系统按需唤醒做深度思考,中间层感知行动系统以约 15Hz 持续接收多模态信息并快速调整,最下层执行系统以更高频率运行、像条件反射一样瞬间处理碰撞与失衡。系统同时由「目标驱动」(完成任务)和「生存驱动」(维护安全、控制能耗)两条主线牵引,即使没有外部指令,也在持续感知和准备下一次行动。 TairosAgent 则是从设计第一天起就为机器人本体原生打造的框架,而非从通用框架改造而来。它通过统一的硬件适配层和标准化 Skill 接口,可以接入不同型号的机器人。据腾讯披露,在导航、讲解、被打断后恢复等典型场景中,响应时间从通用框架的几十秒缩短到 2-3 秒。
-
Hy-Embodied 系列模型全部开源。模型权重可以在 GitHub 和 HuggingFace 上直接下载。VLM-1.0 和 VLA-0.5 使用 MIT 许可证,RxBrain-1.0 也采用了开放许可。 腾讯的变现路径更偏向平台层和云服务层。Tairos 平台面向机器人整机和系统开发商开放,提供开源的模型、智能体、开发工具和一站式服务。腾讯云则搭建了从算力底座、模型服务到感知交互的三层基础设施体系,并推出了云端的 EaaS(Embodied-AI-as-a-Service)。这意味着客户可以按需调用具身智能能力,而不必自建全套基础设施。 此外,腾讯云 HAI(高性能 AI 算力)、多网聚合加速、TRRO 等服务也与 Hy-Embodied 系列联动。工业客户可以通过腾讯云直接获取训练和部署所需的算力、存储和网络能力。
-
正面评价 第三方社区的反馈集中在几个点上:统一架构的工程取舍被认为非常务实。多位 AI 从业者在 HuggingFace 评论区提到,RxBrain 将文本推理与视觉想象塞进约 6B 参数里的做法「比单纯堆参数更值得学习」;真机验证数据公开且与开源模型一一对应,也获得了好评。在 Reddit 的 r/MachineLearning 板块,有用户评价「终于有一家大厂在做具身智能时不是只发论文了」。 中文社区的反馈更多集中在对「缸中之脑」论述的认同上。知乎上的高赞回答普遍认为,张正友在 WAIC 上的判断「点出了当前大模型的根本局限」,Hy-Embodied 的发布「至少表明腾讯在走一条不一样的路」。 负面反馈 批评声音主要集中在实际可用性的距离上。RxBrain 在 8 步长程规划场景中得分从 0.69 下降到了 0.55,一步比一步差的趋势说明视觉想象的误差累积仍是瓶颈。一些技术评论指出,虽然 RxBrain 展示了「统一大脑」的潜力,但要让它在工厂产线上连续运行数小时不出错,「现在还不是时候」。 定价方面也有一些不满。模型虽开源,但真正要在工厂里跑起来,腾讯云算力的成本并不低——有知乎用户算了一笔账,部署一套完整的 Hy-Embodied 方案,仅 GPU 租赁成本每月就要数万元。Tairos 平台的企业级服务也并非免费。 使用场景 除了工业产线,腾讯还披露了导购导览和养老服务两个落地场景。在商场导览机器人场景中,VLA-0.5 能够根据自然语言指令完成带路、介绍商品、回答问询等任务;在养老场景中,模型主要负责药品递送、跌倒检测响应和简单的陪伴对话。
-
从行业反应来看,Hy-Embodied 系列的发布被视为一个重要的信号:中国大厂正在从「模型层竞争」转向「应用层竞争」。与 Google、Meta 等海外公司在机器人领域的谨慎表态不同,腾讯这次直接给出了从基础模型到云服务再到开放平台的全栈方案,而且明确表示——开源、可商用。 在 RoboDojo 综合排名第一的成绩,意味着 VLA-0.5 至少在仿真环境中的综合能力已经超过了当前主流的开放方案。不过也要看到,仿真与真机之间仍有差距:在 RoboDojo 中表现出色的模型,在物理世界中可能因为传感器噪声、延迟、硬件差异等问题表现打折。腾讯在真机上只测试了三类任务(摆放餐具、收纳眼镜、丢垃圾),覆盖范围有限。 从竞品格局来看,国内具身智能赛道已经相当拥挤。字节跳动有 GR-2 系列、华为有盘古具身模型、小米有 CyberOne 及背后的力控算法团队。腾讯的优势在于模型全部开源、混元大模型全家桶的协同效应、以及 Tairos 平台的生态积累。劣势则在于:相比字节和小米,腾讯在硬件——尤其是人形机器人整机——方面的布局相对薄弱,当前更多依赖合作伙伴。
-
一个值得注意的争议点是「开源」的实际含义。Hy-Embodied 三个模型虽然开源了权重和推理代码,但训练数据(超过 5 万小时具身数据)并未开放。训练数据的规模和质量直接决定了模型的泛化能力上限,当其他团队无法复现或定制时,所谓「开源」的实际可复用性就要打折扣。 另一个风险来自行业应用的成熟度。日化品工厂的实测数据看起来漂亮(>95% 成功率),但这只是一个 SKU 变化频繁但操作相对简单的场景。汽车装配、精密电子制造等对精度和容错率要求更高的行业,具身智能模型的当前能力是否足以支撑,尚无公开验证数据。 此外,Apexio 的三层架构虽然在技术上很有说服力,但从三层「同时在线」到真正稳定落地,涉及大量系统工程和硬件适配工作。正如一位机器人工程背景的知乎答主所评论的:「实验室展示的 demo 和在产线上跑两个班不出岔子,是两个完全不同的东西。」
-
Hy-Embodied 系列最适合以下两类用户:第一类是机器人系统和整机开发商,可以直接下载开源模型进行二次开发和适配,利用 Tairos 平台的工具链降低原型开发成本。第二类是工业客户,可以通过腾讯云的 EaaS 服务快速试水具身智能在产线上的可行性,而不必自建训练和部署基础设施。 不太适合的场景包括:对定位精度要求极高的精密装配线、安全关键应用(如医疗手术辅助),以及需要在边缘端极低功耗设备上运行的场景。在这些情况下,面向技能的专用模型或规则系统目前可能仍是更稳妥的选择。
-
腾讯 Hy-Embodied 系列是 2026 年具身智能领域最重要的开源方案之一。它在模型架构上的核心贡献——把文本推理与视觉想象统一到一个连续认知序列中——确实回应了「缸中之脑」的问题。但也要客观地说,从「让机器人理解世界」到「让机器人在真实世界中稳定工作」,Hy-Embodied 系列目前只完成了第一步。整套方案在长程任务的稳定性、训练数据的可获取性、以及复杂工业场景的适配性上,还有很长的路要走。
用户评论
-
STurner_2020—腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。 -
MDiaz1689—RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。 -
Emma_Hernandez—看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。 -
BrandonPowellK87—日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。 -
AnnaPetersonIII99—腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯? -
TheElisaHidalgo_2024—全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。 -
Jonathan77z—Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。 -
PEbel—RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。 -
MrLillySveum—说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。 -
Bryan_Williams_2021—智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人? -
CClark_X266—VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。 -
beautifulcat979—腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。 -
SAmen—WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。 -
MMitchellJr86—对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。 -
rtko4f2uts—腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。 -
GloriaMiller_2021—Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。 -
Sharon_Cooper_99_684—腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。