Modelos base Hy-Embodied de Tencent
Serie de modelos base de IA encarnada de Tencent construida sobre Hunyuan, que abarca comprensión visual (VLM-1.0), cognición del mundo (RxBrain-1.0) y modelo visión-lenguaje-acción (VLA-0.5), presentada y liberada como código abierto en WAIC 2026
Informe detallado
-
En julio de 2026, Tencent lanzó oficialmente un conjunto completo de sistemas de modelos base inteligentes incorporados, la serie Hy-Embodied, en la Conferencia Mundial de Inteligencia Artificial (WAIC) en Shanghai, incluido el modelo de comprensión visual VLM-1.0, el modelo de cognición mundial RxBrain-1.0 y el modelo conjunto de visión-lenguaje-acción VLA-0.5. Esta es la primera vez que Tencent integra sistemáticamente "percepción-cognición-acción" en un circuito cerrado completo de inteligencia encarnada. Los tres modelos están construidos en base al modelo grande Hunyuan de Tencent y fueron de código abierto simultáneamente el día de su lanzamiento. Al mismo tiempo, Tencent también lanzó la inteligencia incorporada continua en línea Apexio, el marco nativo incorporado TairosAgent y una actualización integral de la plataforma abierta Tairos (tornillo de titanio), que cubre todo el vínculo desde la potencia de la computación en la nube hasta el cuerpo del robot. La conclusión central de esta solución es que la IA más inteligente actual sigue siendo esencialmente un "cerebro en una tina": es buena para razonar y dialogar, pero carece de un circuito cerrado para la interacción directa con el mundo físico. La serie Hy-Embodied aborda esta brecha.
-
La serie Hy-Embodied es desarrollada conjuntamente por Tencent Robotics X Laboratory, Futian Laboratory y Tencent Hunyuan. Robótica Tencent La división del trabajo en materia de posicionamiento entre los tres modelos es muy clara: VLM-1.0 es como el "cerebro derecho", responsable de comprender imágenes, espacios y escenas. Está cerca del mismo nivel de rendimiento de comprensión visual y consume sólo aproximadamente una décima parte de la potencia informática del buque insignia de la generación anterior; RxBrain-1.0 Como un "cerebro" encarnado, completa simultáneamente el razonamiento de texto y la imaginación visual del objetivo en una arquitectura unificada: no solo le dice al modelo de acción "qué hacer a continuación", sino que también muestra "cómo debería verse el mundo después de hacerlo" en forma de imágenes; VLA-0.5 es como un puente entre el "cerebelo" y el cuerpo, convirtiendo objetivos cognitivos de alto nivel en secuencias de acción física continuas y con corrección de errores. Este comunicado no es simplemente una muestra de logros académicos. Tencent anunció simultáneamente en el foro WAIC que VLA-0.5 ingresó a una fábrica de productos químicos diarios para realizar pruebas de producción reales. En una línea de producción real con mucha mezcla, lotes pequeños e iteraciones frecuentes de SKU, la tasa de éxito de la operación supera el 95 %, el ciclo de una sola pieza es más rápido que 6 segundos y el tiempo para agregar un nuevo SKU es de menos de 3 días para la recopilación de datos y la capacitación posterior del modelo.
-
La capacidad principal de VLM-1.0 es la comprensión visual del mundo abierto. Recibe entrada de imágenes de múltiples vistas y genera representaciones semánticas espaciales: posición del objeto, juicio de operabilidad, diseño de escena, etc. En comparación con el VLM de la generación anterior, mantiene un rendimiento cercano en puntos de referencia de comprensión espacial como CV-Bench y EmbSpatial al tiempo que reduce la cantidad de cálculo en aproximadamente un 90 %, lo que significa que es más adecuado para su implementación en robots con potencia informática limitada. RxBrain-1.0 es la parte técnicamente más destacada de todo el modelo. Adopta la arquitectura de mezcla de transformadores y utiliza la modalidad como ruta para enrutar el token de texto, el token visual de entrada y el token visual generado a rutas informáticas dedicadas, respectivamente. La comprensión visual y de texto representa cada uno aproximadamente 1,5 mil millones de parámetros, y la generación visual agrega 2,4 mil millones adicionales de FFN Expert, con un recuento total de parámetros de aproximadamente 6,2 mil millones. Obtuvo 82,4 puntos en la evaluación del gráfico vicenciano GenEval, que es lo mismo que los 82 puntos del modelo BAGEL específico de generación, lo que indica que la arquitectura unificada no sacrifica la calidad de la generación. En términos de razonamiento incorporado, su puntuación de planificación integral en RxBrain-Bench es 0,68, superando con creces la solución modular; en comparación, el Agente compuesto por Qwen3-VL-2B y Qwen-Image-Edit obtuvo solo 0,431. En tareas conjuntas como la planificación de varios pasos y la imaginación visual del objetivo, las ventajas del modelo unificado son muy obvias: los sistemas modulares son propensos a problemas como la duplicación del lenguaje, la desconexión de las imágenes del objetivo del plan y la deriva del estado durante la ejecución de varios pasos. Sin embargo, RxBrain genera alternativamente texto de subtarea e imágenes de destino en el mismo contexto, y reinyecta la ronda anterior de resultados de generación en la planificación posterior. La coherencia es mucho mejor que la orquestación externa. RxBrain también amplía aún más la rama de generación de acciones Action MoT. Configura una proyección de atención independiente y FFN para tokens de acción al tiempo que conserva las interacciones de atención global con otras modalidades. Los parámetros de acción son inicializados por la rama de comprensión visual y se introduce un mecanismo de fusión cerrado: los expertos en acción pueden tomar prestadas selectivamente funciones de planificación y predicción del estado mundial de los expertos en generación visual por canal. En la verificación de la máquina real, en los brazos robóticos DOBOT X-Trainer y Ark Infinite A5, la tasa de éxito promedio de las tres tareas de múltiples etapas de colocar la vajilla, doblar y guardar vasos y tirar la basura alcanzó el 87 %, lo que mejora significativamente en comparación con el 68 % de π0 y el 82 % de π0,5.VLA-0.5 se centra en la verificación de hechos. Ocupó el primer lugar en la clasificación general de simulación en las cinco dimensiones de la evaluación de RoboDojo de terceros: generalización, memoria, operación fina, ejecución de largo alcance y comprensión semántica abierta. También ocupó el primer lugar en las dos dimensiones de tareas de largo alcance y tareas de memoria. Más de 10.000 horas de datos de enseñanza humana de alta precisión son su base de formación. A nivel de agente, la arquitectura de Apexio es bastante ingeniosa. Consta de tres capas de capacidades que están en línea al mismo tiempo en diferentes frecuencias: el sistema cognitivo de la capa superior se despierta a pedido para pensar profundamente, el sistema de percepción y acción de la capa intermedia recibe continuamente información multimodal a aproximadamente 15 Hz y se ajusta rápidamente, y el sistema de ejecución de la capa inferior se ejecuta a una frecuencia
-
Todos los modelos de la serie Hy-Embodied son de código abierto. Los pesos de los modelos se pueden descargar directamente en GitHub y HuggingFace. VLM-1.0 y VLA-0.5 utilizan la licencia MIT y RxBrain-1.0 también adopta una licencia abierta. El camino de monetización de Tencent se centra más en la capa de plataforma y la capa de servicios en la nube. La plataforma Tairos está abierta a desarrolladores de sistemas y robots y proporciona modelos, agentes, herramientas de desarrollo y servicios integrales de código abierto. Tencent Cloud ha construido un sistema de infraestructura de tres capas desde la base de potencia informática, el servicio modelo hasta la interacción de percepción, y lanzó EaaS (AI-como-servicio incorporado) basado en la nube. Esto significa que los clientes pueden recurrir a capacidades de inteligencia incorporadas bajo demanda sin tener que construir ellos mismos una infraestructura completa. Además, Tencent Cloud HAI (potencia informática de IA de alto rendimiento), aceleración de agregación multired, TRRO y otros servicios también están vinculados con la serie Hy-Embodied. Los clientes industriales pueden obtener directamente la potencia informática, el almacenamiento y las capacidades de red necesarias para la capacitación y la implementación a través de Tencent Cloud.
-
reseña positiva Los comentarios de la comunidad de terceros se centraron en algunos puntos: Las compensaciones de ingeniería de la arquitectura unificada se consideraron muy pragmáticas. Muchos profesionales de la IA mencionaron en el área de comentarios de HuggingFace que el enfoque de RxBrain de agrupar el razonamiento textual y la imaginación visual en aproximadamente 6B de parámetros es "más digno de aprender que simplemente acumular parámetros". Los datos reales de verificación de la máquina son públicos y corresponden uno a uno al modelo de código abierto, y también han recibido elogios. En la sección r/MachineLearning de Reddit, un usuario comentó: "Finalmente, una empresa importante no se limita a publicar artículos sobre inteligencia incorporada". La respuesta de la comunidad china se centra más en el reconocimiento del debate sobre el "cerebro en una tina". Las respuestas muy elogiadas sobre Zhihu generalmente creen que el juicio de Zhang Zhengyou sobre WAIC "señaló las limitaciones fundamentales del gran modelo actual" y que el lanzamiento de Hy-Embodied "al menos muestra que Tencent está tomando un camino diferente". retroalimentación negativa Las críticas se centraron en la distancia de la disponibilidad real. La puntuación de RxBrain en el escenario de planificación a largo plazo de 8 pasos cayó de 0,69 a 0,55. La tendencia a empeorar paso a paso muestra que la acumulación de errores en la imaginación visual sigue siendo un cuello de botella. Algunos comentarios técnicos señalaron que aunque RxBrain ha demostrado el potencial de un "cerebro unificado", "ahora no es el momento" para que funcione en una línea de producción de fábrica durante horas sin errores. También hay cierta insatisfacción con los precios. Aunque el modelo es de código abierto, el costo de la potencia informática de Tencent Cloud no es bajo cuando se trata de ejecutarlo en una fábrica. Un usuario de Zhihu calculó una cuenta e implementó una solución completa de Hy-Embodied. Solo el costo mensual del alquiler de la GPU es de decenas de miles de yuanes. Los servicios de nivel empresarial de la plataforma Tairos tampoco son gratuitos. Escenarios de uso Además de las líneas de producción industrial, Tencent también reveló dos escenarios de implementación de guías de compras y servicios de atención a personas mayores. En el escenario del robot de navegación de un centro comercial, VLA-0.5 puede completar tareas como marcar el camino, presentar productos y responder consultas basándose en instrucciones en lenguaje natural; en el escenario de atención a personas mayores, el modelo es el principal responsable de la entrega de medicamentos, la respuesta de detección de caídas y el diálogo simple con compañeros.
-
A juzgar por la reacción de la industria, el lanzamiento de la serie Hy-Embodied se considera una señal importante: los principales fabricantes chinos están pasando de la "competencia de capas de modelos" a la "competencia de capas de aplicaciones". A diferencia de la postura cautelosa de empresas extranjeras como Google y Meta en el campo de la robótica, esta vez Tencent proporcionó directamente una solución completa, desde modelos básicos hasta servicios en la nube y plataformas abiertas, y dejó en claro que es de código abierto y está disponible comercialmente. Ocupar el primer lugar en la clasificación integral de RoboDojo significa que las capacidades integrales de VLA-0.5, al menos en el entorno de simulación, han superado las principales soluciones abiertas actuales. Sin embargo, también cabe señalar que todavía existe una brecha entre la simulación y la máquina real: un modelo que funciona bien en RoboDojo puede funcionar mal en el mundo físico debido a problemas como el ruido del sensor, la latencia y las diferencias de hardware. Tencent solo probó tres tipos de tareas (arreglar la vajilla, guardar vasos y tirar la basura) en teléfonos reales y la cobertura fue limitada. Desde la perspectiva del panorama de productos competitivos, la pista de inteligencia incorporada nacional ya está bastante concurrida. ByteDance tiene la serie GR-2, Huawei tiene el modelo de cuerpo Pangu y Xiaomi tiene CyberOne y el equipo de algoritmo de control de fuerza detrás. Las ventajas de Tencent radican en el código abierto de todos los modelos, la sinergia del grupo de la familia de modelos grandes de Hunyuan y la acumulación ecológica de la plataforma Tairos. La desventaja es que, en comparación con Byte y Xiaomi, el diseño de hardware de Tencent, especialmente los robots humanoides, es relativamente débil y actualmente depende más de sus socios.
-
Un punto de controversia que vale la pena señalar es el significado real de "código abierto". Aunque los pesos y códigos de inferencia de los tres modelos Hy-Embodied son de código abierto, los datos de entrenamiento (más de 50.000 horas de datos incorporados) no están abiertos. La escala y la calidad de los datos de entrenamiento determinan directamente el límite superior de la capacidad de generalización del modelo. Cuando otros equipos no puedan reproducirlo o personalizarlo, la reutilización real del llamado "código abierto" se verá comprometida. Otro riesgo proviene de la madurez de las aplicaciones industriales. Los datos medidos reales de la fábrica de productos químicos diarios se ven hermosos (tasa de éxito >95%), pero este es solo un escenario donde el SKU cambia con frecuencia pero la operación es relativamente simple. No hay datos de verificación pública sobre si las capacidades actuales de los modelos de inteligencia incorporada son suficientes para respaldar industrias como el ensamblaje de automóviles y la fabricación de productos electrónicos de precisión, que tienen mayores requisitos de precisión y tolerancia a fallas. Además, aunque la arquitectura de tres capas de Apexio es técnicamente convincente, desde una implementación "en línea simultánea" de tres capas hasta una implementación verdaderamente estable implica mucho trabajo de ingeniería de sistemas y adaptación de hardware. Como comentó un encuestado de Zhihu con experiencia en ingeniería robótica: "La demostración mostrada en el laboratorio y ejecutar dos turnos en la línea de producción sin ningún problema son dos cosas completamente diferentes".
-
La serie Hy-Embodied es más adecuada para los siguientes dos tipos de usuarios: el primer tipo son los desarrolladores de sistemas robóticos y máquinas completas, que pueden descargar directamente modelos de código abierto para desarrollo secundario y adaptación, y utilizar la cadena de herramientas de la plataforma Tairos para reducir los costos de desarrollo de prototipos. La segunda categoría son los clientes industriales, que pueden probar rápidamente la viabilidad de la inteligencia incorporada en las líneas de producción a través del servicio EaaS de Tencent Cloud sin tener que construir su propia infraestructura de capacitación e implementación. Los escenarios que son menos adecuados incluyen: líneas de ensamblaje de precisión que requieren una precisión de posicionamiento extremadamente alta, aplicaciones críticas para la seguridad (como asistencia médica quirúrgica) y escenarios que deben ejecutarse en dispositivos de potencia extremadamente baja en el borde. En estos casos, los modelos dedicados o sistemas de reglas orientados a las habilidades pueden seguir siendo una opción más segura por ahora.
-
La serie Tencent Hy-Embodied es una de las soluciones de código abierto más importantes en el campo de la inteligencia incorporada en 2026. Su contribución principal a la arquitectura de modelos (unificar el razonamiento textual y la imaginación visual en una secuencia cognitiva continua) responde al problema del “cerebro en una tina”. Pero para ser objetivo, desde "dejar que los robots comprendan el mundo" hasta "hacer que los robots funcionen de manera estable en el mundo real", la serie Hy-Embodied solo ha completado el primer paso. Toda la solución todavía tiene un largo camino por recorrer en términos de estabilidad para misiones de larga distancia, disponibilidad de datos de entrenamiento y adaptabilidad a escenarios industriales complejos.
Reseñas de usuarios
-
STurner_2020—腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。 -
MDiaz1689—RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。 -
Emma_Hernandez—看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。 -
BrandonPowellK87—日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。 -
AnnaPetersonIII99—腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯? -
TheElisaHidalgo_2024—全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。 -
Jonathan77z—Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。 -
PEbel—RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。 -
MrLillySveum—说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。 -
Bryan_Williams_2021—智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人? -
CClark_X266—VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。 -
beautifulcat979—腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。 -
SAmen—WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。 -
MMitchellJr86—对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。 -
rtko4f2uts—腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。 -
GloriaMiller_2021—Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。 -
Sharon_Cooper_99_684—腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。