テンセント Hy-Embodied 身体性基盤モデル
テンセントが混元大規模モデルを基盤に開発した身体性AI基盤モデルシリーズ。視覚理解(VLM-1.0)、世界認知(RxBrain-1.0)、視覚-言語-動作統合モデル(VLA-0.5)を含み、WAIC 2026で発表・オープンソース化
詳細レポート
-
2026年7月、テンセントは、上海で開催された世界人工知能会議(WAIC)で、視覚理解モデルVLM-1.0、世界認識モデルRxBrain-1.0、視覚・言語・行動共同モデルVLA-0.5を含む、身体化されたインテリジェントベースモデルシステムの完全なセットであるHy-Embodiedシリーズを正式にリリースした。 Tencent が「知覚 - 認知 - 行動」を完全な身体化されたインテリジェンスの閉ループに体系的に統合したのはこれが初めてです。 3 つのモデルはすべて Tencent の Hunyuan 大型モデルに基づいて構築されており、リリース日に同時にオープンソース化されました。同時に、テンセントは、継続的なオンラインの身体化インテリジェンスである Apexio、身体化されたネイティブ フレームワーク TairosAgent、およびクラウド コンピューティングのパワーからロボット本体に至るリンク全体をカバーする Tairos (チタン ネジ) オープン プラットフォームの包括的なアップグレードも開始しました。このソリューションの核となる判断は、現在最もインテリジェントな AI は依然として本質的には「水槽の中の脳」であるということです。AI は推論と対話には優れていますが、物理世界と直接対話するための閉ループが欠けています。 Hy-Embodied シリーズはこのギャップをターゲットにしています。
-
Hy-Embodied シリーズは、Tencent Robotics X Laboratory、Futian Laboratory、Tencent Hunyuan によって共同開発されています。テンセントロボティクス 3 つのモデル間の役割分担は非常に明確です。VLM-1.0 は「右脳」のようなもので、画像、空間、シーンの理解に責任を負います。前世代のフラッグシップの約 10 分の 1 のコンピューティング能力を消費するだけでありながら、同レベルの視覚理解パフォーマンスに近い性能を備えています。 RxBrain-1.0 具現化された「脳」のように、統一されたアーキテクチャでテキスト推論と視覚的ターゲットの想像力を同時に完成させます。行動モデルに「次に何をすべきか」を伝えるだけでなく、「それを実行した後に世界がどのように見えるべきか」を画像の形で示します。 VLA-0.5 は「小脳」と身体の間の架け橋のようなもので、高レベルの認知目標を継続的でエラー修正可能な一連の身体動作に変換します。 このリリースは単に学術的業績を展示するものではありません。 TencentはWAICフォーラムで、VLA-0.5が実際の生産テストのために毎日化学工場に入ったことを同時に発表した。混合率が高く、バッチが小さく、SKU が頻繁に繰り返される実際の生産ラインでは、操作の成功率は 95% を超え、単一ピースのサイクルは 6 秒よりも速く、データ収集とモデルのポストトレーニングにかかる新しい SKU の追加時間は 3 日未満です。
-
VLM-1.0 の中核となる機能は、オープンワールドの視覚的理解です。多視点画像の入力を受け取り、オブジェクトの位置、操作性の判断、シーンのレイアウトなどの空間意味表現を出力します。前世代の VLM と比較して、CV-Bench や EmbSpatial などの空間理解ベンチマークでほぼ同等のパフォーマンスを維持しながら、計算量を約 90% 削減しているため、計算能力が限られたロボットへの導入に適しています。 RxBrain-1.0 は、モデル全体の中で技術的に最も強調されている部分です。 Mixture-of-Transformers アーキテクチャを採用し、テキスト トークン、入力ビジュアル トークン、生成されたビジュアル トークンをそれぞれ専用のコンピューティング パスにルーティングするルートとしてモダリティを使用します。テキストと視覚的な理解はそれぞれ約 1.5B のパラメーターを占め、視覚的な生成にはさらに 2.4B の FFN Expert が追加され、合計パラメーター数は約 6.2B になります。 GenEval Vincentian グラフ評価では 82.4 ポイントを獲得し、これは世代固有モデル BAGEL の 82 ポイントと同じであり、統合アーキテクチャが世代の品質を犠牲にしていないことを示しています。具現化された推論に関しては、RxBrain-Bench の総合計画スコアは 0.68 で、モジュール型ソリューションをはるかに上回っています。これと比較すると、Qwen3-VL-2B と Qwen-Image-Edit で構成されるエージェントのスコアはわずか 0.431 でした。マルチステップの計画や視覚的なターゲットの想像などの共同タスクでは、統合モデルの利点は非常に明白です。モジュラー システムでは、言語の重複、ターゲットのイメージが計画から切り離される、マルチステップの実行中の状態のドリフトなどの問題が発生しやすくなります。ただし、RxBrain は同じコンテキスト内でサブタスク テキストとターゲット画像を交互に生成し、前回の生成結果を後続の計画に再注入します。一貫性は外部オーケストレーションよりもはるかに優れています。 RxBrain は、アクション生成ブランチ Action MoT もさらに拡張します。他のモダリティとのグローバルな注意の相互作用を維持しながら、独立した注意の投影とアクション トークンの FFN を構成します。アクション パラメーターは視覚理解ブランチによって初期化され、ゲート フュージョン メカニズムが導入されます。アクション エキスパートは、チャネルごとにビジュアル生成エキスパートから世界状態の予測および計画機能を選択的に借用できます。 DOBOT X-TrainerとArk Infinite A5ロボットアームの実機検証では、食器を置く、グラスをたたむ・収納する、ゴミを捨てるという3つの多段階作業の平均成功率が87%に達し、π0の68%、π0.5の82%と比べて大幅に向上した。VLA-0.5 は事実の検証に重点を置いています。サードパーティの RoboDojo 評価の 5 つの側面 (汎用性、記憶力、細かい操作性、長距離実行、オープンな意味理解) における総合シミュレーション ランキングで 1 位にランクされました。また、長距離タスクと記憶タスクの 2 つの側面でも 1 位にランクされました。 10,000 時間を超える高精度の人間の教師データがトレーニングの基礎となります。 エージェントレベルでは、Apexio のアーキテクチャは非常に独創的です。これは、異なる周波数で同時にオンラインになる 3 つの機能層で構成されます。最上層の認知システムは、深い思考を行うためにオンデマンドで起動し、中間層の認識および行動システムは、約 15Hz でマルチモーダル情報を継続的に受信し、迅速に調整します。最下層の実行システムは、より高い周波数で実行され、条件反射のように衝突や不均衡を即座に処理します。このシステムは、「ゴールドライブ」(タスクの完了)と「サバイバルドライブ」(安全性の維持、エネルギー消費の制御)の 2 つの主要なラインによって同時に駆動されます。外部からの指示がなくても、常に感知して次の行動に備えます。 TairosAgent は、一般的なフレームワークを変更するのではなく、設計の初日からロボット本体用にネイティブに構築されるフレームワークです。統合されたハードウェア アダプテーション レイヤーと標準化されたスキル インターフェイスを通じて、さまざまなモデルのロボットに接続できます。テンセントによると、ナビゲーションや説明、中断後の復旧などの典型的なシナリオでは、応答時間が一般的なフレームワークの数十秒から2~3秒に短縮されるという。
-
Hy-Embodied シリーズのモデルはすべてオープンソースです。モデルの重みは、GitHub および HuggingFace で直接ダウンロードできます。 VLM-1.0とVLA-0.5はMITライセンスを採用しており、RxBrain-1.0もオープンライセンスを採用しています。 Tencent の収益化の道は、プラットフォーム層とクラウド サービス層により重点を置いています。 Tairos プラットフォームはロボットおよびシステム開発者に開かれており、オープンソース モデル、エージェント、開発ツール、ワンストップ サービスを提供します。 Tencent Cloudは、コンピューティングパワーベース、モデルサービス、知覚インタラクションに至る3層のインフラストラクチャシステムを構築し、クラウドベースのEaaS(Embodied-AI-as-a-Service)を開始しました。これは、顧客が完全なインフラストラクチャを自分で構築することなく、オンデマンドで組み込まれたインテリジェンス機能を呼び出すことができることを意味します。 さらに、Tencent Cloud HAI(高性能AIコンピューティングパワー)、マルチネットワークアグリゲーションアクセラレーション、TRROなどのサービスもHy-Embodiedシリーズと連携しています。産業顧客は、Tencent Cloud を通じてトレーニングと展開に必要なコンピューティング能力、ストレージ、ネットワーク機能を直接入手できます。
-
肯定的なレビュー サードパーティ コミュニティからのフィードバックは、いくつかの点に焦点を当てていました。 統合アーキテクチャのエンジニアリング上のトレードオフは、非常に実用的であると考えられていました。 HuggingFace のコメント エリアでは、多くの AI 実践者が、テキストによる推論と視覚的な想像力を約 60 億個のパラメーターに詰め込む RxBrain のアプローチは、「単にパラメーターを山盛りにするよりも学ぶ価値がある」と述べています。実機検証データが公開されており、オープンソースモデルに1対1で対応しており、こちらも好評をいただいております。 Reddit の r/MachineLearning セクションでは、あるユーザーが「ついに大手企業が、身体化されたインテリジェンスに関して論文を発表するだけではなくなった」とコメントしました。 中国人コミュニティからのフィードバックは、「水槽の中の脳」議論の認識に重点が置かれています。 Zhihu に関する高く評価された回答は一般に、WAIC に対する張正佑氏の判決は「現在の大規模モデルの根本的な限界を指摘した」ものであり、Hy-Embodied のリリースは「少なくとも Tencent が異なる道を歩んでいることを示している」と考えている。 否定的なフィードバック 批判は実際に利用可能になるまでの距離に焦点を当てた。 8 ステップの長期計画シナリオにおける RxBrain のスコアは 0.69 から 0.55 に低下しました。段階的に悪化する傾向は、視覚的想像力におけるエラーの蓄積が依然としてボトルネックであることを示しています。一部の技術コメントでは、RxBrain は「統合頭脳」の可能性を実証しているものの、工場の生産ラインで何時間もエラーなく稼働させるには「今は時期ではない」と指摘しています。 価格設定にも不満はあります。このモデルはオープンソースですが、工場で実行するとなると、Tencent Cloud のコンピューティング能力のコストは決して低くありません。 Zhihu ユーザーはアカウントを計算し、完全な Hy-Embodied ソリューションを導入しました。毎月のGPUレンタル費用だけでも数万元かかる。 Tairos プラットフォームのエンタープライズ グレードのサービスも無料ではありません。 利用シーン 工業生産ラインに加えて、テンセントはショッピングガイドと高齢者介護サービスの2つの導入シナリオも明らかにした。ショッピング モールのナビゲーション ロボットのシナリオでは、VLA-0.5 は自然言語の指示に基づいて道案内、商品の紹介、問い合わせへの回答などのタスクを実行できます。高齢者介護のシナリオでは、モデルは主に薬の配達、転倒検知への対応、簡単なコンパニオンとの対話を担当します。
-
業界の反応から判断すると、Hy-Embodied シリーズのリリースは、中国の大手メーカーが「モデル層の競争」から「アプリケーション層の競争」に移行しつつあるという重要なシグナルであると考えられます。ロボット分野におけるグーグルやメタなどの海外企業の慎重な姿勢とは異なり、テンセントは今回、基本モデルからクラウドサービス、オープンプラットフォームに至るフルスタックソリューションを直接提供し、オープンソースかつ商用利用可能であることを明確にした。 RoboDojo の総合ランキングで 1 位になったことは、VLA-0.5 の総合的な機能が、少なくともシミュレーション環境において、現在主流のオープン ソリューションを上回っていることを意味します。ただし、シミュレーションと実際のマシンの間にはまだギャップがあることにも注意する必要があります。RoboDojo で適切にパフォーマンスを発揮するモデルが、センサーのノイズ、遅延、ハードウェアの違いなどの問題により、物理世界ではパフォーマンスが低下する可能性があります。テンセントが実際の携帯電話でテストしたのは 3 種類のタスク (食器の配置、グラスの保管、ゴミ捨て) のみであり、対象範囲も限られていました。 競争力のある製品環境の観点から見ると、国内の身体化されたインテリジェンストラックはすでにかなり混雑しています。 ByteDanceにはGR-2シリーズがあり、HuaweiにはPanguボディモデルがあり、XiaomiにはCyberOneとその背後にある力制御アルゴリズムチームがあります。 Tencent の利点は、すべてのモデルのオープンソース、Hunyuan の大型モデル ファミリー バケットの相乗効果、Tairos プラットフォームの生態学的蓄積にあります。欠点は、Byte や Xiaomi と比較して、Tencent のハードウェア、特に人型ロボットのレイアウトが比較的弱く、現在はパートナーへの依存度が高いことです。
-
注目すべき論争のポイントの 1 つは、「オープンソース」の実際の意味です。 3 つの Hy-Embodied モデルの重みと推論コードはオープンソースですが、トレーニング データ (50,000 時間以上の具現化データ) はオープンではありません。トレーニング データの規模と品質は、モデルの汎化能力の上限を直接決定します。他のチームがそれを再現したりカスタマイズしたりできない場合、いわゆる「オープンソース」の実際の再利用性が損なわれてしまいます。 もう 1 つのリスクは、業界アプリケーションの成熟からもたらされます。毎日の化学工場の実測データは美しく見えます (成功率 > 95%)。これは、SKU が頻繁に変更されるシナリオにすぎませんが、操作は比較的単純です。身体化されたインテリジェンス モデルの現在の機能が、精度とフォールト トレランスに対してより高い要件が求められる自動車組立や精密エレクトロニクス製造などの業界をサポートするのに十分であるかどうかについて、公的に検証されたデータはありません。 さらに、Apexio の 3 層アーキテクチャは技術的には説得力がありますが、3 層の「同時オンライン」から真に安定した実装までには、多くのシステム エンジニアリングとハードウェア適応作業が必要です。ロボット工学の背景を持つ Zhihu の回答者は、「実験室で見せられたデモと、問題なく生産ラインで 2 つのシフトを実行することは、まったく別のことです。」とコメントしました。
-
Hy-Embodied シリーズは、次の 2 つのタイプのユーザーに最適です。 1 つ目のタイプはロボット システムおよび完成機の開発者で、二次開発および適応のためにオープン ソース モデルを直接ダウンロードでき、Tairos プラットフォームのツール チェーンを使用してプロトタイプ開発コストを削減できます。 2 番目のカテゴリーは産業顧客です。彼らは、独自のトレーニングや展開インフラストラクチャを構築することなく、Tencent Cloud の EaaS サービスを通じて、生産ラインでの具体化されたインテリジェンスの実現可能性を迅速にテストできます。 あまり適さないシナリオには、非常に高い位置決め精度を必要とする精密組立ライン、安全性が重要なアプリケーション (医療外科支援など)、エッジで非常に低電力のデバイスで実行する必要があるシナリオなどがあります。このような場合、現時点ではスキル指向の専用モデルまたはルール システムの方が安全な選択肢である可能性があります。
-
Tencent Hy-Embodied シリーズは、2026 年の身体化インテリジェンスの分野で最も重要なオープンソース ソリューションの 1 つです。モデル アーキテクチャにおけるその中心的な貢献、つまりテキストによる推論と視覚的想像力を連続的な認知シーケンスに統合することは、「水槽の中の脳」問題に確実に対応します。しかし、客観的に見ると、「ロボットに世界を理解させる」から「ロボットを現実世界で安定して動作させる」まで、Hy-Embodiedシリーズはまだ最初のステップを終えたばかりです。長距離ミッションの安定性、トレーニング データの可用性、複雑な産業シナリオへの適応性の点で、ソリューション全体にはまだ長い道のりがあります。
ユーザーレビュー
-
STurner_2020—腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。 -
MDiaz1689—RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。 -
Emma_Hernandez—看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。 -
BrandonPowellK87—日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。 -
AnnaPetersonIII99—腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯? -
TheElisaHidalgo_2024—全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。 -
Jonathan77z—Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。 -
PEbel—RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。 -
MrLillySveum—说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。 -
Bryan_Williams_2021—智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人? -
CClark_X266—VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。 -
beautifulcat979—腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。 -
SAmen—WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。 -
MMitchellJr86—对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。 -
rtko4f2uts—腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。 -
GloriaMiller_2021—Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。 -
Sharon_Cooper_99_684—腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。