Базовые модели Tencent Hy-Embodied
Серия базовых моделей воплощённого ИИ от Tencent на основе Hunyuan: визуальное понимание (VLM-1.0), познание мира (RxBrain-1.0) и модель «зрение-язык-действие» (VLA-0.5); представлена и открыта на WAIC 2026
Подробный отчёт
-
В июле 2026 года на Всемирной конференции по искусственному интеллекту (WAIC) в Шанхае Tencent официально представила полный набор воплощенных систем интеллектуальных базовых моделей — серию Hy-Embodied, включая модель визуального понимания VLM-1.0, модель мирового познания RxBrain-1.0 и совместную модель видения-языка-действия VLA-0.5. Это первый случай, когда Tencent систематически интегрировала «восприятие-познание-действие» в замкнутый цикл полного воплощения интеллекта. Все три модели созданы на основе большой модели Tencent Hunyuan и были открыты одновременно в день выпуска. В то же время Tencent также запустила непрерывный онлайн-воплощенный интеллект Apexio, встроенную встроенную платформу TairosAgent и комплексное обновление открытой платформы Tairos (титановый винт), охватывающее всю связь от мощности облачных вычислений до тела робота. Основное суждение этого решения заключается в том, что нынешний самый умный ИИ по-прежнему представляет собой «мозг в бочке» — он хорош в рассуждениях и диалоге, но ему не хватает замкнутого контура для прямого взаимодействия с физическим миром. Серия Hy-Embodied нацелена на устранение этого пробела.
-
Серия Hy-Embodied разработана совместно Tencent Robotics X Laboratory, Futian Laboratory и Tencent Hunyuan. Тенсент Робототехника Разделение труда между тремя моделями очень четкое: VLM-1.0 похож на «правое полушарие мозга», отвечающее за понимание изображений, пространств и сцен. Он близок к тому же уровню производительности визуального восприятия, потребляя при этом лишь около одной десятой вычислительной мощности флагмана предыдущего поколения; RxBrain-1.0 Подобно воплощенному «мозгу», он одновременно завершает текстовые рассуждения и визуальное воображение цели в единой архитектуре — он не только сообщает модели действия «что делать дальше», но и показывает «как должен выглядеть мир после этого» в виде изображений; VLA-0.5 действует как мост между «мозжечком» и телом, преобразуя когнитивные цели высокого уровня в непрерывные последовательности физических действий с возможностью исправления ошибок. Этот выпуск – не просто демонстрация академических достижений. Одновременно Tencent объявила на форуме WAIC, что VLA-0.5 поступил на ежедневный химический завод для реальных производственных испытаний. На реальной производственной линии с интенсивным смешиванием, небольшими партиями и частыми итерациями SKU уровень успешности операций превышает 95%, цикл изготовления единичных изделий составляет более 6 секунд, а время добавления нового SKU составляет менее 3 дней для сбора данных и постобучения модели.
-
Основная возможность VLM-1.0 — визуальное понимание открытого мира. Он получает входные данные многоракурсного изображения и выводит пространственное семантическое представление — положение объекта, оценку работоспособности, макет сцены и т. д. По сравнению с VLM предыдущего поколения он поддерживает близкие показатели производительности в тестах пространственного понимания, таких как CV-Bench и EmbSpatial, при этом сокращая объем вычислений примерно на 90 %, что означает, что он больше подходит для развертывания на роботах с ограниченной вычислительной мощностью. RxBrain-1.0 — наиболее технически подчёркнутая часть всей модели. Он принимает архитектуру «Смесь трансформеров» и использует модальность в качестве маршрута для маршрутизации текстового токена, входного визуального токена и сгенерированного визуального токена к выделенным вычислительным путям соответственно. На текстовое и визуальное понимание приходится около 1,5 миллиарда параметров, а на визуальное генерирование добавляются дополнительные 2,4 миллиарда параметров FFN Expert, при общем количестве параметров около 6,2 миллиарда. Он набрал 82,4 балла в оценке винсентианского графа GenEval, что соответствует 82 баллам модели BAGEL для конкретного поколения, что указывает на то, что унифицированная архитектура не жертвует качеством генерации. С точки зрения воплощенных рассуждений, его комплексная оценка планирования на RxBrain-Bench составляет 0,68, что намного превышает показатель модульного решения - для сравнения, Агент, состоящий из Qwen3-VL-2B и Qwen-Image-Edit, набрал всего 0,431. В совместных задачах, таких как многоэтапное планирование и визуальное представление целей, преимущества унифицированной модели весьма очевидны: модульные системы склонны к таким проблемам, как дублирование языка, отключение целевых изображений от плана и дрейф состояния во время многоэтапного выполнения. Однако RxBrain поочередно генерирует текст подзадачи и целевые изображения в одном и том же контексте и повторно вводит результаты предыдущего раунда генерации в последующее планирование. Согласованность намного лучше, чем внешняя оркестровка. RxBrain также расширяет ветку Action MoT для генерации действий. Он настраивает независимую проекцию внимания и FFN для жетонов действий, сохраняя при этом глобальное взаимодействие внимания с другими модальностями. Параметры действий инициализируются ветвью визуального понимания, и вводится механизм закрытого слияния — эксперты по действиям могут выборочно заимствовать функции прогнозирования и планирования состояния мира у экспертов визуальной генерации по каналам. При реальной проверке машины на роботизированных манипуляторах DOBOT X-Trainer и Ark Infinite A5 средний показатель успешности трех многоэтапных задач по расстановке посуды, складыванию и хранению стаканов и выбрасыванию мусора достиг 87 %, что значительно лучше по сравнению с 68 % у π0 и 82 % у π0,5.VLA-0.5 фокусируется на проверке фактов. Он занял первое место в общем рейтинге моделирования по пяти параметрам сторонней оценки RoboDojo — обобщение, память, точная работа, выполнение на большие расстояния и открытое семантическое понимание. Он также занял первое место по двум параметрам: задачи на большие расстояния и задачи на память. Основой его обучения являются более 10 000 часов высокоточных данных обучения людей. На уровне агента архитектура Apexio весьма изобретательна. Он состоит из трех уровней возможностей, которые одновременно работают на разных частотах: когнитивная система верхнего уровня просыпается по требованию для глубокого мышления, система восприятия и действий среднего уровня постоянно получает мультимодальную информацию с частотой около 15 Гц и быстро адаптируется, а исполнительная система нижнего уровня работает на более высокой частоте и мгновенно обрабатывает столкновения и дисбалансы, такие как условные рефлексы. В системе одновременно действуют две основные линии: «целевой драйв» (выполнение задач) и «драйв выживания» (поддержание безопасности, контроль
-
Все модели серии Hy-Embodied имеют открытый исходный код. Вес модели можно загрузить непосредственно на GitHub и HuggingFace. VLM-1.0 и VLA-0.5 используют лицензию MIT, а RxBrain-1.0 также использует открытую лицензию. Путь монетизации Tencent больше ориентирован на уровень платформы и уровень облачных сервисов. Платформа Tairos открыта для разработчиков роботов и систем и предоставляет модели с открытым исходным кодом, агенты, инструменты разработки и универсальные услуги. Tencent Cloud создала трехуровневую инфраструктурную систему: от вычислительной мощности, модельного сервиса до взаимодействия с восприятием, а также запустила облачное EaaS (Embodied-AI-as-a-Service). Это означает, что клиенты могут использовать встроенные интеллектуальные возможности по требованию без необходимости самостоятельно создавать полную инфраструктуру. Кроме того, с серией Hy-Embodied также связаны Tencent Cloud HAI (высокопроизводительная вычислительная мощность искусственного интеллекта), ускорение многосетевой агрегации, TRRO и другие сервисы. Промышленные заказчики могут напрямую получить вычислительную мощность, хранилище и сетевые возможности, необходимые для обучения и развертывания, через Tencent Cloud.
-
положительный отзыв Отзывы стороннего сообщества сосредоточились на нескольких моментах: инженерные компромиссы унифицированной архитектуры считались очень прагматичными. Многие специалисты по искусственному интеллекту отметили в разделе комментариев HuggingFace, что подход RxBrain, заключающийся в объединении текстовых рассуждений и визуального воображения примерно в 6B параметров, «более достоин изучения, чем простое нагромождение параметров». Реальные данные проверки машины являются общедоступными и соответствуют модели с открытым исходным кодом «один к одному», а также получили высокую оценку. В разделе r/MachineLearning на Reddit пользователь прокомментировал: «Наконец-то крупная компания не просто публикует статьи, когда речь идет о воплощенном интеллекте». Отзывы китайского сообщества больше ориентированы на признание дискуссии «мозг в чане». Высоко оцененные ответы на Zhihu обычно полагают, что суждение Чжан Чжэнъю о WAIC «указало на фундаментальные ограничения текущей большой модели» и что выпуск Hy-Embodied «по крайней мере показывает, что Tencent идет по другому пути». отрицательный отзыв Критика была сосредоточена на расстоянии фактической доступности. Оценка RxBrain в 8-шаговом сценарии долгосрочного планирования упала с 0,69 до 0,55. Тенденция постепенного ухудшения ситуации показывает, что накопление ошибок в зрительном воображении по-прежнему является узким местом. В некоторых технических комментариях отмечалось, что, хотя RxBrain продемонстрировал потенциал «единого мозга», «сейчас не время» для того, чтобы он часами работал на заводской производственной линии без ошибок. Есть также некоторое недовольство ценами. Хотя исходный код модели открыт, стоимость вычислительной мощности Tencent Cloud не является низкой, если речь идет о ее запуске на заводе. Пользователь Zhihu рассчитал учетную запись и развернул полное решение Hy-Embodied. Одна только ежемесячная стоимость аренды графического процессора составляет десятки тысяч юаней. Услуги корпоративного уровня платформы Tairos также не бесплатны. Сценарии использования Помимо промышленных производственных линий, Tencent также раскрыла два сценария реализации путеводителей по магазинам и услуг по уходу за пожилыми людьми. В сценарии навигационного робота торгового центра VLA-0.5 может выполнять такие задачи, как руководство, представление продуктов и ответы на запросы на основе инструкций на естественном языке; в сценарии ухода за пожилыми людьми модель в основном отвечает за доставку лекарств, реакцию на обнаружение падения и простой диалог с собеседником.
-
Судя по реакции отрасли, выпуск серии Hy-Embodied расценивается как важный сигнал: крупные китайские производители переходят от «конкуренции модельного уровня» к «конкуренции прикладного уровня». В отличие от осторожной позиции зарубежных компаний, таких как Google и Meta, в области робототехники, Tencent на этот раз напрямую предоставила полнофункциональное решение, от базовых моделей до облачных сервисов и открытых платформ, и дала понять, что оно имеет открытый исходный код и коммерчески доступно. Первое место в комплексном рейтинге RoboDojo означает, что комплексные возможности VLA-0.5, по крайней мере в среде моделирования, превзошли текущие основные открытые решения. Однако следует также отметить, что между симуляцией и реальной машиной все еще существует разрыв: модель, которая хорошо работает в RoboDojo, может плохо работать в физическом мире из-за таких проблем, как шум датчика, задержка и различия в оборудовании. Tencent тестировала только три типа задач (расстановка посуды, хранение стаканов и выбрасывание мусора) на реальных телефонах, и охват был ограничен. С точки зрения конкурентной среды, отечественный рынок воплощенного интеллекта уже довольно перегружен. У ByteDance есть серия GR-2, у Huawei — модель корпуса Pangu, а у Xiaomi — CyberOne и команда алгоритмов управления силой, стоящая за ней. Преимущества Tencent заключаются в открытом исходном коде всех моделей, синергии семейства больших моделей Hunyuan и экологическом накоплении платформы Tairos. Недостаток заключается в том, что по сравнению с Byte и Xiaomi аппаратное обеспечение Tencent, особенно гуманоидных роботов, относительно слабое, и в настоящее время компания больше полагается на партнеров.
-
Стоит отметить один спорный момент — фактическое значение слова «открытый исходный код». Хотя веса и коды вывода трех моделей Hy-Embodied имеют открытый исходный код, данные обучения (более 50 000 часов воплощенных данных) не являются открытыми. Масштаб и качество обучающих данных напрямую определяют верхний предел обобщающей способности модели. Когда другие команды не смогут воспроизвести или настроить его, реальная возможность повторного использования так называемого «открытого исходного кода» будет поставлена под угрозу. Другой риск связан с зрелостью отраслевых приложений. Фактические данные ежедневных измерений на химическом заводе выглядят красиво (уровень успеха >95%), но это всего лишь сценарий, в котором SKU часто меняется, но операция относительно проста. Нет общедоступных данных проверки того, достаточны ли текущие возможности моделей встроенного интеллекта для поддержки таких отраслей, как сборка автомобилей и производство точной электроники, где предъявляются более высокие требования к точности и отказоустойчивости. Кроме того, хотя трехуровневая архитектура Apexio технически убедительна, переход от трехуровневого «одновременного онлайна» к действительно стабильной реализации требует большого объема работы по системному проектированию и адаптации оборудования. Как прокомментировал респондент Zhihu, имеющий опыт работы в области робототехники: «Демо-версия, показанная в лаборатории, и работа на производственной линии в две смены без каких-либо проблем — это две совершенно разные вещи».
-
Серия Hy-Embodied наиболее подходит для следующих двух типов пользователей: первый тип — это разработчики роботизированных систем и комплексных машин, которые могут напрямую загружать модели с открытым исходным кодом для вторичной разработки и адаптации, а также использовать цепочку инструментов платформы Tairos для снижения затрат на разработку прототипа. Вторая категория — это промышленные заказчики, которые могут быстро проверить возможность внедрения встроенного интеллекта на производственных линиях с помощью EaaS-сервиса Tencent Cloud без необходимости создания собственной инфраструктуры обучения и развертывания. К менее подходящим сценариям относятся: прецизионные сборочные линии, требующие чрезвычайно высокой точности позиционирования, критически важные для безопасности приложения (например, медицинская хирургическая помощь) и сценарии, которые должны работать на периферийных устройствах с чрезвычайно низким энергопотреблением. В этих случаях специализированные модели или системы правил, ориентированные на навыки, на данный момент могут быть более безопасным вариантом.
-
Серия Tencent Hy-Embodied — одно из наиболее важных решений с открытым исходным кодом в области воплощенного интеллекта в 2026 году. Ее основной вклад в архитектуру моделей — объединение текстовых рассуждений и визуального воображения в непрерывную когнитивную последовательность — действительно отвечает на проблему «мозг в бочке». Но если быть объективным, серия Hy-Embodied завершила лишь первый шаг — от «позволить роботам понять мир» до «заставить роботов стабильно работать в реальном мире». Всему решению еще предстоит пройти долгий путь с точки зрения стабильности для миссий на большие расстояния, доступности обучающих данных и адаптивности к сложным промышленным сценариям.
Отзывы пользователей
-
STurner_2020—腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。 -
MDiaz1689—RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。 -
Emma_Hernandez—看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。 -
BrandonPowellK87—日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。 -
AnnaPetersonIII99—腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯? -
TheElisaHidalgo_2024—全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。 -
Jonathan77z—Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。 -
PEbel—RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。 -
MrLillySveum—说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。 -
Bryan_Williams_2021—智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人? -
CClark_X266—VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。 -
beautifulcat979—腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。 -
SAmen—WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。 -
MMitchellJr86—对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。 -
rtko4f2uts—腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。 -
GloriaMiller_2021—Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。 -
Sharon_Cooper_99_684—腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。