Modèles de base Hy-Embodied de Tencent
Série de modèles de base d'IA incarnée de Tencent construite sur Hunyuan, couvrant la compréhension visuelle (VLM-1.0), la cognition du monde (RxBrain-1.0) et le modèle vision-langage-action (VLA-0.5), dévoilée et open-sourcée au WAIC 2026
Rapport détaillé
-
En juillet 2026, Tencent a officiellement publié un ensemble complet de systèmes de modèles de base intelligents incarnés - la série Hy-Embodied - lors de la Conférence mondiale sur l'intelligence artificielle (WAIC) à Shanghai, y compris le modèle de compréhension visuelle VLM-1.0, le modèle de cognition mondiale RxBrain-1.0 et le modèle conjoint vision-langage-action VLA-0.5. C'est la première fois que Tencent intègre systématiquement « perception-cognition-action » dans une boucle fermée complète d'intelligence incarnée. Les trois modèles sont construits sur la base du grand modèle Hunyuan de Tencent et étaient open source simultanément le jour de leur sortie. Dans le même temps, Tencent a également lancé l'intelligence incorporée en ligne continue Apexio, le cadre natif incorporé TairosAgent et une mise à niveau complète de la plate-forme ouverte Tairos (vis en titane), couvrant l'ensemble du lien depuis la puissance du cloud computing jusqu'au corps du robot. Le principal jugement de cette solution est que l’IA la plus intelligente actuelle est encore essentiellement un « cerveau dans une cuve » : elle est bonne en raisonnement et en dialogue, mais il lui manque une boucle fermée pour une interaction directe avec le monde physique. La série Hy-Emboded cible cette lacune.
-
La série Hy-Emboded est développée conjointement par Tencent Robotics X Laboratory, Futian Laboratory et Tencent Hunyuan. Tencent Robotique La répartition du travail de positionnement entre les trois modèles est très claire : VLM-1.0 est comme le « cerveau droit », responsable de la compréhension des images, des espaces et des scènes. Il est proche du même niveau de performances de compréhension visuelle tout en ne consommant qu'environ un dixième de la puissance de calcul du produit phare de la génération précédente ; RxBrain-1.0 Comme un « cerveau » incarné, il complète simultanément le raisonnement textuel et l'imagination visuelle de la cible dans une architecture unifiée - il indique non seulement au modèle d'action « quoi faire ensuite », mais montre également « à quoi devrait ressembler le monde après l'avoir fait » sous forme d'images ; VLA-0.5 est comme un pont entre le « cervelet » et le corps, convertissant les objectifs cognitifs de haut niveau en séquences d'actions physiques continues et corrigeables aux erreurs. Cette version n'est pas simplement une présentation de réalisations académiques. Tencent a annoncé simultanément lors du forum WAIC que le VLA-0.5 était entré dans une usine chimique quotidienne pour des tests de production réels. Sur une ligne de production réelle avec un mélange élevé, de petits lots et des itérations fréquentes du SKU, le taux de réussite des opérations dépasse 95 %, le cycle d'une seule pièce est plus rapide que 6 secondes et le temps d'ajout d'un nouveau SKU est inférieur à 3 jours pour la collecte de données et la post-formation du modèle.
-
La capacité principale de VLM-1.0 est la compréhension visuelle du monde ouvert. Il reçoit des entrées d'images multi-vues et génère une représentation sémantique spatiale - position de l'objet, jugement d'opérabilité, disposition de la scène, etc. Par rapport au VLM de génération précédente, il maintient des performances proches sur les benchmarks de compréhension spatiale tels que CV-Bench et EmbSpatial tout en réduisant la quantité de calcul d'environ 90 %, ce qui signifie qu'il est plus adapté au déploiement sur des robots avec une puissance de calcul limitée. RxBrain-1.0 est la partie la plus techniquement mise en évidence de l'ensemble du modèle. Il adopte l'architecture Mixture-of-Transformers et utilise la modalité comme itinéraire pour acheminer respectivement le jeton de texte, le jeton visuel d'entrée et le jeton visuel généré vers des chemins informatiques dédiés. La compréhension textuelle et visuelle représente chacune environ 1,5 milliard de paramètres, et la génération visuelle ajoute 2,4 milliards supplémentaires de FFN Expert, avec un nombre total de paramètres d'environ 6,2 milliards. Il a obtenu 82,4 points dans l'évaluation du graphique vincentien GenEval, ce qui est le même que les 82 points du modèle BAGEL spécifique à la génération, indiquant que l'architecture unifiée ne sacrifie pas la qualité de la génération. En termes de raisonnement incorporé, son score de planification globale sur RxBrain-Bench est de 0,68, dépassant de loin la solution modulaire - en comparaison, l'agent composé de Qwen3-VL-2B et Qwen-Image-Edit n'a obtenu qu'un score de 0,431. Dans les tâches conjointes telles que la planification en plusieurs étapes et l'imagination visuelle des cibles, les avantages du modèle unifié sont très évidents : les systèmes modulaires sont sujets à des problèmes tels que la duplication de langage, la déconnexion des images cibles du plan et la dérive d'état lors de l'exécution en plusieurs étapes. Cependant, RxBrain génère alternativement le texte des sous-tâches et les images cibles dans le même contexte, et réinjecte les résultats de la génération précédente dans la planification ultérieure. La cohérence est bien meilleure que l’orchestration externe. RxBrain étend également la branche de génération d'actions Action MoT. Il configure une projection d'attention indépendante et un FFN pour les jetons d'action tout en conservant les interactions d'attention globale avec d'autres modalités. Les paramètres d'action sont initialisés par la branche de compréhension visuelle et un mécanisme de fusion fermée est introduit : les experts en action peuvent emprunter de manière sélective des fonctionnalités de prévision et de planification de l'état du monde aux experts en génération visuelle par canal. Lors de la vérification réelle de la machine, sur les bras robotiques DOBOT X-Trainer et Ark Infinite A5, le taux de réussite moyen des trois tâches en plusieurs étapes consistant à placer la vaisselle, plier et ranger les verres et jeter les déchets a atteint 87 %, ce qui est considérablement amélioré par rapport aux 68 % de π0 et aux 82 % de π0,5.VLA-0.5 se concentre sur la vérification des faits. Il s'est classé premier dans le classement général des simulations dans les cinq dimensions de l'évaluation tierce de RoboDojo : généralisation, mémoire, fonctionnement précis, exécution à longue portée et compréhension sémantique ouverte. Il s’est également classé premier dans les deux dimensions des tâches à longue portée et des tâches de mémoire. Plus de 10 000 heures de données pédagogiques humaines de haute précision constituent sa base de formation. Au niveau de l’agent, l’architecture d’Apexio est assez ingénieuse. Il se compose de trois couches de capacités qui sont en ligne en même temps à différentes fréquences : le système cognitif de la couche supérieure se réveille à la demande pour effectuer une réflexion approfondie, le système de perception et d'action de la couche intermédiaire reçoit en
-
Tous les modèles de la série Hy-Emboded sont open source. Les poids des modèles peuvent être téléchargés directement sur GitHub et HuggingFace. VLM-1.0 et VLA-0.5 utilisent la licence MIT, et RxBrain-1.0 adopte également une licence ouverte. Le chemin de monétisation de Tencent est davantage axé sur la couche plate-forme et la couche de service cloud. La plateforme Tairos est ouverte aux développeurs de robots et de systèmes, fournissant des modèles open source, des agents, des outils de développement et des services à guichet unique. Tencent Cloud a construit un système d'infrastructure à trois couches depuis la base de puissance de calcul, le service modèle jusqu'à l'interaction de perception, et a lancé un EaaS (Embodied-AI-as-a-Service) basé sur le cloud. Cela signifie que les clients peuvent faire appel à des capacités d’intelligence embarquée à la demande sans avoir à construire eux-mêmes une infrastructure complète. De plus, Tencent Cloud HAI (puissance de calcul IA haute performance), l'accélération de l'agrégation multi-réseaux, TRRO et d'autres services sont également liés à la série Hy-Embodied. Les clients industriels peuvent obtenir directement la puissance de calcul, les capacités de stockage et de réseau nécessaires à la formation et au déploiement via Tencent Cloud.
-
avis positif Les retours de la communauté tierce se sont concentrés sur quelques points : Les compromis techniques de l'architecture unifiée ont été considérés comme très pragmatiques. De nombreux praticiens de l'IA ont mentionné dans la zone de commentaires de HuggingFace que l'approche de RxBrain consistant à regrouper le raisonnement textuel et l'imagination visuelle dans environ 6B paramètres est « plus digne d'être apprise que de simplement accumuler des paramètres ». Les données réelles de vérification de la machine sont publiques et correspondent au modèle open source un à un, et ont également reçu des éloges. Dans la section r/MachineLearning de Reddit, un utilisateur a commenté : « Enfin, une grande entreprise ne se contente pas de publier des articles lorsqu'il s'agit d'intelligence incarnée. » Les retours de la communauté chinoise sont davantage axés sur la reconnaissance du débat « cerveau dans une cuve ». Les réponses très appréciées sur Zhihu pensent généralement que le jugement de Zhang Zhengyou sur WAIC "a souligné les limites fondamentales du grand modèle actuel" et que la sortie de Hy-Emboded "montre au moins que Tencent emprunte une voie différente". commentaires négatifs Les critiques portaient sur la distance de disponibilité réelle. Le score de RxBrain dans le scénario de planification à long terme en 8 étapes est passé de 0,69 à 0,55. La tendance à l'aggravation progressive montre que l'accumulation d'erreurs dans l'imagination visuelle reste un goulot d'étranglement. Certains commentaires techniques ont souligné que bien que RxBrain ait démontré le potentiel d'un « cerveau unifié », « ce n'est pas le moment » pour qu'il fonctionne sur une chaîne de production en usine pendant des heures sans erreurs. Il existe également une certaine insatisfaction concernant les prix. Bien que le modèle soit open source, le coût de la puissance de calcul de Tencent Cloud n'est pas faible lorsqu'il s'agit de l'exécuter en usine. Un utilisateur de Zhihu a calculé un compte et déployé une solution Hy-Emboded complète. Le coût mensuel de location du GPU à lui seul s'élève à des dizaines de milliers de yuans. Les services d’entreprise de la plateforme Tairos ne sont pas non plus gratuits. Scénarios d'utilisation Outre les lignes de production industrielle, Tencent a également dévoilé deux scénarios de mise en œuvre de guides d'achat et de services de soins aux personnes âgées. Dans le scénario du robot de navigation du centre commercial, VLA-0.5 peut effectuer des tâches telles que montrer la voie, présenter des produits et répondre aux demandes de renseignements basées sur des instructions en langage naturel ; dans le scénario de soins aux personnes âgées, le modèle est principalement responsable de la délivrance des médicaments, de la réponse à la détection des chutes et du simple dialogue entre compagnons.
-
À en juger par la réaction de l'industrie, la sortie de la série Hy-Embodied est considérée comme un signal important : les principaux fabricants chinois passent de la « concurrence au niveau des modèles » à la « concurrence au niveau des applications ». Contrairement à la position prudente d'entreprises étrangères telles que Google et Meta dans le domaine de la robotique, Tencent a directement fourni cette fois une solution complète allant des modèles de base aux services cloud en passant par les plates-formes ouvertes, et a clairement indiqué qu'elle était open source et disponible dans le commerce. Se classer premier dans le classement complet de RoboDojo signifie que les capacités complètes de VLA-0.5, du moins dans l'environnement de simulation, ont surpassé les solutions ouvertes traditionnelles actuelles. Cependant, il convient également de noter qu'il existe encore un écart entre la simulation et la machine réelle : un modèle qui fonctionne bien dans RoboDojo peut avoir de mauvais résultats dans le monde physique en raison de problèmes tels que le bruit des capteurs, la latence et les différences matérielles. Tencent n’a testé que trois types de tâches (organiser la vaisselle, ranger les verres et jeter les déchets) sur de vrais téléphones, et la couverture était limitée. Du point de vue du paysage concurrentiel des produits, le secteur national de l’intelligence incorporée est déjà très encombré. ByteDance a la série GR-2, Huawei a le modèle de corps Pangu et Xiaomi a CyberOne et l'équipe d'algorithmes de contrôle de force derrière. Les avantages de Tencent résident dans l'open source de tous les modèles, la synergie du seau familial de grands modèles Hunyuan et l'accumulation écologique de la plateforme Tairos. L'inconvénient est que par rapport à Byte et Xiaomi, la configuration matérielle de Tencent - en particulier les robots humanoïdes - est relativement faible et s'appuie actuellement davantage sur des partenaires.
-
Un point de controverse qui mérite d’être noté est la signification réelle du terme « open source ». Bien que les poids et les codes d'inférence des trois modèles Hy-Emboded soient open source, les données d'entraînement (plus de 50 000 heures de données incorporées) ne sont pas ouvertes. L'échelle et la qualité des données d'entraînement déterminent directement la limite supérieure de la capacité de généralisation du modèle. Lorsque d'autres équipes ne peuvent pas le reproduire ou le personnaliser, la réutilisation réelle de ce que l'on appelle « l'open source » sera compromise. Un autre risque vient de la maturité des applications industrielles. Les données réelles mesurées par l'usine chimique quotidienne sont magnifiques (taux de réussite > 95 %), mais il ne s'agit que d'un scénario dans lequel le SKU change fréquemment mais où l'opération est relativement simple. Il n'existe aucune donnée publique de vérification indiquant si les capacités actuelles des modèles d'intelligence incorporée sont suffisantes pour soutenir des secteurs tels que l'assemblage automobile et la fabrication d'électronique de précision qui ont des exigences plus élevées en matière de précision et de tolérance aux pannes. De plus, bien que l'architecture à trois couches d'Apexio soit techniquement convaincante, passer d'une mise en œuvre « en ligne simultanée » à trois couches à une mise en œuvre véritablement stable implique de nombreux travaux d'ingénierie système et d'adaptation matérielle. Comme l'a commenté un répondant de Zhihu ayant une formation en ingénierie robotique : « La démonstration présentée en laboratoire et le fonctionnement en deux équipes sur la chaîne de production sans aucun problème sont deux choses complètement différentes. »
-
La série Hy-Embodied est la plus adaptée aux deux types d'utilisateurs suivants : Le premier type est celui des développeurs de systèmes robotiques et de machines complètes, qui peuvent directement télécharger des modèles open source pour le développement et l'adaptation secondaires, et utiliser la chaîne d'outils de la plateforme Tairos pour réduire les coûts de développement de prototypes. La deuxième catégorie est celle des clients industriels, qui peuvent tester rapidement la faisabilité de l'intelligence incorporée dans les lignes de production grâce au service EaaS de Tencent Cloud sans avoir à construire leur propre infrastructure de formation et de déploiement. Les scénarios moins adaptés incluent : les chaînes d'assemblage de précision qui nécessitent une précision de positionnement extrêmement élevée, les applications critiques pour la sécurité (telles que l'assistance médico-chirurgicale) et les scénarios qui doivent fonctionner sur des appareils à très faible consommation en périphérie. Dans ces cas, les modèles ou systèmes de règles dédiés axés sur les compétences peuvent encore constituer une option plus sûre pour le moment.
-
La série Tencent Hy-Embodied est l’une des solutions open source les plus importantes dans le domaine de l’intelligence incarnée en 2026. Sa contribution essentielle à l’architecture des modèles – unifiant le raisonnement textuel et l’imagination visuelle en une séquence cognitive continue – répond au problème du « cerveau dans une cuve ». Mais pour être objectif, de « laisser les robots comprendre le monde » à « faire fonctionner les robots de manière stable dans le monde réel », la série Hy-Embodied n'a fait que franchir la première étape. L'ensemble de la solution a encore un long chemin à parcourir en termes de stabilité pour les missions longue distance, de disponibilité des données de formation et d'adaptabilité à des scénarios industriels complexes.
Avis des utilisateurs
-
STurner_2020—腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。 -
MDiaz1689—RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。 -
Emma_Hernandez—看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。 -
BrandonPowellK87—日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。 -
AnnaPetersonIII99—腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯? -
TheElisaHidalgo_2024—全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。 -
Jonathan77z—Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。 -
PEbel—RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。 -
MrLillySveum—说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。 -
Bryan_Williams_2021—智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人? -
CClark_X266—VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。 -
beautifulcat979—腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。 -
SAmen—WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。 -
MMitchellJr86—对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。 -
rtko4f2uts—腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。 -
GloriaMiller_2021—Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。 -
Sharon_Cooper_99_684—腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。