Modelos base Hy-Embodied da Tencent

Série de modelos base de IA incorporada da Tencent construída sobre o Hunyuan, cobrindo compreensão visual (VLM-1.0), cognição de mundo (RxBrain-1.0) e modelo visão-linguagem-ação (VLA-0.5), lançada em código aberto na WAIC 2026

Relatório detalhado

  • Em julho de 2026, a Tencent lançou oficialmente um conjunto completo de sistemas de modelos básicos inteligentes incorporados - a série Hy-Empowered - na Conferência Mundial de Inteligência Artificial (WAIC) em Xangai, incluindo o modelo de compreensão visual VLM-1.0, o modelo de cognição mundial RxBrain-1.0 e o modelo conjunto de visão-linguagem-ação VLA-0.5. Esta é a primeira vez que a Tencent integra sistematicamente “percepção-cognição-ação” em um ciclo fechado completo de inteligência incorporada. Todos os três modelos são construídos com base no modelo grande Hunyuan da Tencent e foram abertos simultaneamente no dia do lançamento. Ao mesmo tempo, a Tencent também lançou a inteligência incorporada on-line contínua Apexio, a estrutura nativa incorporada TairosAgent e uma atualização abrangente da plataforma aberta Tairos (parafuso de titânio), cobrindo todo o link, desde o poder da computação em nuvem até o corpo do robô. O julgamento central desta solução é que a IA mais inteligente actual ainda é essencialmente um “cérebro numa cuba” – é boa em raciocínio e diálogo, mas carece de um ciclo fechado para interacção directa com o mundo físico. A série Hy-Empowered visa esta lacuna.

  • A série Hy-Emcorporada é desenvolvida em conjunto pelo Laboratório Tencent Robotics X, Laboratório Futian e Tencent Hunyuan. Robótica Tencent A divisão de trabalho do posicionamento entre os três modelos é muito clara: o VLM-1.0 é como o “cérebro direito”, responsável pela compreensão de imagens, espaços e cenas. Está próximo do mesmo nível de desempenho de compreensão visual, consumindo apenas cerca de um décimo do poder de computação do carro-chefe da geração anterior; RxBrain-1.0 Como um "cérebro" incorporado, ele completa simultaneamente o raciocínio do texto e a imaginação visual do alvo em uma arquitetura unificada - não apenas diz ao modelo de ação "o que fazer a seguir", mas também mostra "como o mundo deveria ficar depois de fazer isso" na forma de imagens; O VLA-0.5 é como uma ponte entre o “cerebelo” e o corpo, convertendo objetivos cognitivos de alto nível em sequências de ação física contínuas e corrigíveis por erros. Este lançamento não é simplesmente uma exibição de realizações acadêmicas. A Tencent anunciou simultaneamente no fórum WAIC que o VLA-0.5 entrou em uma fábrica química diária para testes de produção reais. Em uma linha de produção real com alta mistura, pequenos lotes e iterações frequentes de SKU, a taxa de sucesso da operação excede 95%, o ciclo de peça única é mais rápido que 6 segundos e o tempo para adicionar um novo SKU é inferior a 3 dias para coleta de dados e pós-treinamento do modelo.

  • A principal capacidade do VLM-1.0 é a compreensão visual do mundo aberto. Ele recebe entrada de imagem multivisualização e gera representação semântica espacial - posição do objeto, julgamento de operabilidade, layout da cena, etc. Em comparação com o VLM da geração anterior, ele mantém desempenho próximo em benchmarks de compreensão espacial, como CV-Bench e EmbSpatial, enquanto reduz a quantidade de cálculo em cerca de 90%, o que significa que é mais adequado para implantação em robôs com poder de computação limitado. RxBrain-1.0 é a parte mais destacada tecnicamente de todo o modelo. Ele adota a arquitetura Mixture-of-Transformers e usa a modalidade como rota para rotear o token de texto, o token visual de entrada e o token visual gerado para caminhos de computação dedicados, respectivamente. A compreensão de texto e visual representa cerca de 1,5B de parâmetros, e a geração visual adiciona 2,4B adicionais de FFN Expert, com uma contagem total de parâmetros de cerca de 6,2B. Obteve 82,4 pontos na avaliação do gráfico GenEval Vicentino, o mesmo que os 82 pontos do modelo específico de geração BAGEL, indicando que a arquitetura unificada não sacrifica a qualidade da geração. Em termos de raciocínio incorporado, sua pontuação de planejamento abrangente no RxBrain-Bench é de 0,68, excedendo em muito a solução modular – em comparação, o Agente composto por Qwen3-VL-2B e Qwen-Image-Edit obteve apenas 0,431. Em tarefas conjuntas, como planejamento em várias etapas e imaginação visual do alvo, as vantagens do modelo unificado são muito óbvias: sistemas modulares são propensos a problemas como duplicação de linguagem, imagens alvo desconectadas do plano e desvio de estado durante a execução em várias etapas. No entanto, o RxBrain gera alternadamente texto de subtarefa e imagens de destino no mesmo contexto e reinjeta a rodada anterior de resultados de geração no planejamento subsequente. A consistência é muito melhor do que a orquestração externa. RxBrain também estende ainda mais o ramo de geração de ação Action MoT. Ele configura projeção de atenção independente e FFN para tokens de ação, ao mesmo tempo que mantém interações de atenção global com outras modalidades. Os parâmetros de ação são inicializados pelo ramo de compreensão visual e um mecanismo de fusão fechado é introduzido - os especialistas em ação podem emprestar seletivamente recursos de previsão e planejamento do estado mundial de especialistas em geração visual por canal. Na verificação real da máquina, nos braços robóticos DOBOT X-Trainer e Ark Infinite A5, a taxa média de sucesso das três tarefas de vários estágios de colocar talheres, dobrar e armazenar copos e jogar fora o lixo atingiu 87%, o que é significativamente melhorado em comparação com 68% de π0 e 82% de π0,5.VLA-0.5 concentra-se na verificação de fatos. Ele ficou em primeiro lugar na classificação geral de simulação nas cinco dimensões da avaliação do RoboDojo de terceiros – generalização, memória, operação precisa, execução de longo alcance e compreensão semântica aberta. Também ficou em primeiro lugar nas duas dimensões de tarefas de longo alcance e tarefas de memória. Mais de 10.000 horas de dados de ensino humano de alta precisão são sua base de treinamento. No nível do agente, a arquitetura do Apexio é bastante engenhosa. Consiste em três camadas de capacidades que estão online ao mesmo tempo em frequências diferentes: o sistema cognitivo da camada superior acorda sob demanda para fazer pensamentos profundos, o sistema de percepção e ação da camada intermediária recebe continuamente informações multimodais em cerca de 15 Hz e se ajusta rapidamente, e o sistema de execução da camada inferior funciona em uma frequência mais alta e lida instantaneamente com colisões e desequilíbrios como reflexos condicionados. O sistema é movido simultaneamente por duas linhas principais: “goal drive” (conclusão de tarefas) e “survival drive” (manter a segurança, controlar o consumo de energia). Mesmo sem

  • Todos os modelos da série Hy-Empowered são de código aberto. Os pesos dos modelos podem ser baixados diretamente no GitHub e HuggingFace. VLM-1.0 e VLA-0.5 usam a licença MIT, e o RxBrain-1.0 também adota uma licença aberta. O caminho de monetização da Tencent está mais focado na camada de plataforma e na camada de serviço em nuvem. A plataforma Tairos está aberta a desenvolvedores de robôs e sistemas, fornecendo modelos de código aberto, agentes, ferramentas de desenvolvimento e serviços completos. A Tencent Cloud construiu um sistema de infraestrutura de três camadas, desde a base de poder de computação, serviço de modelo até interação de percepção, e lançou EaaS (IA incorporada como serviço) baseado em nuvem. Isso significa que os clientes podem recorrer a recursos de inteligência incorporados sob demanda, sem precisar construir eles próprios uma infraestrutura completa. Além disso, Tencent Cloud HAI (poder de computação de IA de alto desempenho), aceleração de agregação multi-rede, TRRO e outros serviços também estão vinculados à série Hy-Empowered. Os clientes industriais podem obter diretamente o poder de computação, o armazenamento e os recursos de rede necessários para treinamento e implantação por meio da Tencent Cloud.

  • avaliação positiva O feedback da comunidade terceirizada concentrou-se em alguns pontos: As compensações de engenharia da arquitetura unificada foram consideradas muito pragmáticas. Muitos profissionais de IA mencionaram na área de comentários do HuggingFace que a abordagem do RxBrain de comprimir o raciocínio textual e a imaginação visual em cerca de 6B de parâmetros é “mais digna de aprendizado do que simplesmente acumular parâmetros”. Os dados reais de verificação da máquina são públicos e correspondem ao modelo de código aberto um a um, e também receberam elogios. Na seção r/MachineLearning do Reddit, um usuário comentou: “Finalmente, uma grande empresa não está apenas publicando artigos quando se trata de inteligência incorporada”. O feedback da comunidade chinesa está mais focado no reconhecimento da discussão do “cérebro numa cuba”. As respostas altamente elogiadas sobre Zhihu geralmente acreditam que o julgamento de Zhang Zhengyou sobre o WAIC "apontou as limitações fundamentais do grande modelo atual" e que o lançamento do Hy-Empowered "pelo menos mostra que a Tencent está seguindo um caminho diferente". feedback negativo As críticas centraram-se na distância da disponibilidade real. A pontuação do RxBrain no cenário de planejamento de longo prazo em 8 etapas caiu de 0,69 para 0,55. A tendência de piorar passo a passo mostra que o acúmulo de erros na imaginação visual ainda é um gargalo. Alguns comentários técnicos apontaram que embora o RxBrain tenha demonstrado o potencial de um “cérebro unificado”, “agora não é o momento” para que ele funcione em uma linha de produção de fábrica por horas sem erros. Também há alguma insatisfação com os preços. Embora o modelo seja de código aberto, o custo do poder de computação da Tencent Cloud não é baixo quando se trata de executá-lo em uma fábrica. Um usuário da Zhihu calculou uma conta e implantou uma solução Hy-Empowered completa. Só o custo mensal do aluguel da GPU é de dezenas de milhares de yuans. Os serviços de nível empresarial da plataforma Tairos também não são gratuitos. Cenários de uso Além das linhas de produção industrial, a Tencent também divulgou dois cenários de implementação de guias de compras e serviços de atendimento a idosos. No cenário do robô de navegação em shopping centers, o VLA-0.5 pode realizar tarefas como liderar o caminho, apresentar produtos e responder perguntas com base em instruções em linguagem natural; no cenário de atendimento a idosos, o modelo é responsável principalmente pela entrega de medicamentos, resposta à detecção de quedas e simples diálogo com o acompanhante.

  • A julgar pela reação da indústria, o lançamento da série Hy-Empowered é considerado um sinal importante: os principais fabricantes chineses estão mudando da “competição na camada de modelo” para a “competição na camada de aplicação”. Diferente da postura cautelosa de empresas estrangeiras como Google e Meta no campo da robótica, a Tencent forneceu diretamente uma solução full-stack, desde modelos básicos até serviços em nuvem e plataformas abertas desta vez, e deixou claro que é de código aberto e disponível comercialmente. Ficar em primeiro lugar na classificação abrangente do RoboDojo significa que as capacidades abrangentes do VLA-0.5, pelo menos no ambiente de simulação, ultrapassaram as atuais soluções abertas convencionais. No entanto, também deve ser observado que ainda existe uma lacuna entre a simulação e a máquina real: um modelo que funciona bem no RoboDojo pode ter um desempenho ruim no mundo físico devido a problemas como ruído do sensor, latência e diferenças de hardware. A Tencent testou apenas três tipos de tarefas (arrumar talheres, guardar copos e jogar lixo fora) em telefones reais, e a cobertura foi limitada. Do ponto de vista do cenário competitivo de produtos, o caminho da inteligência incorporada nacional já está bastante lotado. ByteDance tem a série GR-2, a Huawei tem o modelo de corpo Pangu e a Xiaomi tem o CyberOne e a equipe de algoritmo de controle de força por trás dele. As vantagens da Tencent residem no código aberto de todos os modelos, na sinergia do grande modelo familiar Hunyuan e no acúmulo ecológico da plataforma Tairos. A desvantagem é que, em comparação com Byte e Xiaomi, o layout da Tencent em hardware – especialmente robôs humanóides – é relativamente fraco e atualmente depende mais de parceiros.

  • Um ponto de controvérsia digno de nota é o verdadeiro significado de “código aberto”. Embora os pesos e códigos de inferência dos três modelos Hy-Emcorporados sejam de código aberto, os dados de treinamento (mais de 50.000 horas de dados incorporados) não são abertos. A escala e a qualidade dos dados de treinamento determinam diretamente o limite superior da capacidade de generalização do modelo. Quando outras equipes não conseguirem reproduzi-lo ou customizá-lo, a real reutilização do chamado “código aberto” ficará comprometida. Outro risco vem da maturidade das aplicações industriais. Os dados reais medidos da fábrica química diária parecem lindos (taxa de sucesso> 95%), mas este é apenas um cenário em que o SKU muda com frequência, mas a operação é relativamente simples. Não existem dados de verificação pública sobre se as capacidades actuais dos modelos de inteligência incorporada são suficientes para apoiar indústrias como a montagem automóvel e o fabrico de electrónica de precisão, que têm requisitos mais elevados de precisão e tolerância a falhas. Além disso, embora a arquitetura de três camadas do Apexio seja tecnicamente convincente, desde o "on-line simultâneo" de três camadas até a implementação verdadeiramente estável, envolve muito trabalho de engenharia de sistema e adaptação de hardware. Como comentou um entrevistado da Zhihu com experiência em engenharia robótica: “A demonstração mostrada no laboratório e a execução de dois turnos na linha de produção sem problemas são duas coisas completamente diferentes”.

  • A série Hy-Empowered é mais adequada para os dois tipos de usuários a seguir: O primeiro tipo são desenvolvedores de sistemas robóticos e máquinas completas, que podem baixar diretamente modelos de código aberto para desenvolvimento e adaptação secundários e usar a cadeia de ferramentas da plataforma Tairos para reduzir custos de desenvolvimento de protótipos. A segunda categoria são os clientes industriais, que podem testar rapidamente a viabilidade da inteligência incorporada nas linhas de produção por meio do serviço EaaS da Tencent Cloud, sem precisar construir sua própria infraestrutura de treinamento e implantação. Os cenários menos adequados incluem: linhas de montagem de precisão que exigem precisão de posicionamento extremamente alta, aplicações críticas de segurança (como assistência médico-cirúrgica) e cenários que precisam ser executados em dispositivos de energia extremamente baixa na borda. Nestes casos, modelos dedicados ou sistemas de regras orientados para as competências podem ainda ser uma opção mais segura por enquanto.

  • A série Tencent Hy-Empowered é uma das soluções de código aberto mais importantes no campo da inteligência incorporada em 2026. Sua principal contribuição na arquitetura de modelos – unificando o raciocínio textual e a imaginação visual em uma sequência cognitiva contínua – responde ao problema do “cérebro em uma cuba”. Mas, para ser objetivo, desde “deixar os robôs entenderem o mundo” até “fazer os robôs trabalharem de forma estável no mundo real”, a série Hy-Empowered apenas completou o primeiro passo. Toda a solução ainda tem um longo caminho a percorrer em termos de estabilidade para missões de longa distância, disponibilidade de dados de treinamento e adaptabilidade a cenários industriais complexos.

Avaliações de usuários

  • avatar
    STurner_2020
    腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。

  • avatar
    MDiaz1689
    RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。

  • avatar
    Emma_Hernandez
    看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。

  • avatar
    BrandonPowellK87
    日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。

  • avatar
    lazysnake753
    Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。

  • avatar
    AnnaPetersonIII99
    腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯?

  • avatar
    TheElisaHidalgo_2024
    全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。

  • avatar
    Jonathan77z
    Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。

  • avatar
    PEbel
    RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。

  • avatar
    MrLillySveum
    说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。

  • avatar
    Bryan_Williams_2021
    智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人?

  • avatar
    CClark_X266
    VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。

  • avatar
    beautifulcat979
    腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。

  • avatar
    BeverlyRobinsonSr
    RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。

  • avatar
    SAmen
    WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。

  • avatar
    MMitchellJr86
    对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。

  • avatar
    Heather_Ramos_2024
    世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。

  • avatar
    rtko4f2uts
    腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。

  • avatar
    GloriaMiller_2021
    Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。

  • avatar
    Sharon_Cooper_99_684
    腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。