Model dasar Hy-Embodied Tencent

Seri model dasar AI embodied dari Tencent berbasis Hunyuan, mencakup pemahaman visual (VLM-1.0), kognisi dunia (RxBrain-1.0), dan model visi-bahasa-aksi (VLA-0.5), dirilis dan di-open-source-kan di WAIC 2026

Laporan mendalam

  • Pada bulan Juli 2026, Tencent secara resmi merilis satu set lengkap sistem model dasar cerdas yang diwujudkan - seri Hy-Embodied - di Konferensi Kecerdasan Buatan Dunia (WAIC) di Shanghai, termasuk model pemahaman visual VLM-1.0, model kognisi dunia RxBrain-1.0, dan model visi-bahasa-aksi gabungan VLA-0.5. Ini adalah pertama kalinya Tencent secara sistematis mengintegrasikan "persepsi-kognisi-tindakan" ke dalam lingkaran tertutup kecerdasan yang diwujudkan secara lengkap. Ketiga model tersebut dibuat berdasarkan model besar Hunyuan Tencent dan bersumber terbuka secara bersamaan pada hari peluncurannya. Pada saat yang sama, Tencent juga meluncurkan kecerdasan yang diwujudkan secara online Apexio, kerangka kerja asli yang diwujudkan TairosAgent, dan peningkatan komprehensif platform terbuka Tairos (sekrup titanium), yang mencakup seluruh tautan mulai dari kekuatan komputasi awan hingga badan robot. Penilaian inti dari solusi ini adalah bahwa AI paling cerdas saat ini pada dasarnya masih merupakan "otak di dalam tong" - AI ini bagus dalam penalaran dan dialog, namun tidak memiliki loop tertutup untuk interaksi langsung dengan dunia fisik. Seri Hy-Embodied menargetkan kesenjangan ini.

  • Seri Hy-Embodied dikembangkan bersama oleh Tencent Robotics X Laboratory, Futian Laboratory, dan Tencent Hunyuan. Robotika Tencent Pembagian kerja positioning antara ketiga model tersebut sangat jelas: VLM-1.0 seperti "otak kanan", yang bertanggung jawab untuk memahami gambar, ruang, dan pemandangan. Performa pemahaman visualnya hampir sama, namun hanya mengonsumsi sepersepuluh daya komputasi dari produk andalan generasi sebelumnya; RxBrain-1.0 Seperti "otak" yang diwujudkan, ia secara bersamaan melengkapi penalaran teks dan imajinasi target visual dalam arsitektur terpadu - tidak hanya memberi tahu model tindakan "apa yang harus dilakukan selanjutnya", tetapi juga menunjukkan "seperti apa dunia setelah melakukannya" dalam bentuk gambar; VLA-0,5 seperti jembatan antara "otak kecil" dan tubuh, mengubah tujuan kognitif tingkat tinggi menjadi rangkaian tindakan fisik yang berkelanjutan dan dapat diperbaiki dari kesalahan. Pelepasan ini bukan sekedar pamer prestasi akademis. Tencent secara bersamaan mengumumkan di forum WAIC bahwa VLA-0.5 telah memasuki pabrik kimia harian untuk pengujian produksi sebenarnya. Pada lini produksi nyata dengan pencampuran tinggi, batch kecil, dan iterasi SKU yang sering, tingkat keberhasilan operasi melebihi 95%, siklus satu bagian lebih cepat dari 6 detik, dan waktu untuk menambahkan SKU baru kurang dari 3 hari untuk pengumpulan data dan model pasca pelatihan.

  • Kemampuan inti VLM-1.0 adalah pemahaman visual dunia terbuka. Ia menerima input dan output gambar multi-tampilan representasi semantik spasial - posisi objek, penilaian pengoperasian, tata letak pemandangan, dll. Dibandingkan dengan VLM generasi sebelumnya, VLM ini mempertahankan kinerja yang baik pada tolok ukur pemahaman spasial seperti CV-Bench dan EmbSpatial sekaligus mengurangi jumlah penghitungan sekitar 90%, yang berarti lebih cocok untuk diterapkan pada robot dengan daya komputasi terbatas. RxBrain-1.0 adalah bagian yang paling disorot secara teknis dari keseluruhan model. Ini mengadopsi arsitektur Mixture-of-Transformers dan menggunakan modalitas sebagai rute untuk merutekan Token teks, memasukkan Token visual, dan Token visual yang dihasilkan ke jalur komputasi khusus. Pemahaman teks dan visual masing-masing menyumbang sekitar 1,5 miliar parameter, dan pembuatan visual menambahkan 2,4 miliar tambahan Pakar FFN, dengan total jumlah parameter sekitar 6,2 miliar. Ini mencetak 82,4 poin dalam evaluasi grafik GenEval Vincentian, yang sama dengan 82 poin dari model BAGEL khusus generasi, yang menunjukkan bahwa arsitektur terpadu tidak mengorbankan kualitas generasi. Dalam hal penalaran yang terkandung, skor perencanaan komprehensifnya di RxBrain-Bench adalah 0,68, jauh melebihi solusi modular - sebagai perbandingan, Agen yang terdiri dari Qwen3-VL-2B dan Qwen-Image-Edit hanya mendapat skor 0,431. Dalam tugas gabungan seperti perencanaan multi-langkah dan imajinasi target visual, keuntungan dari model terpadu sangat jelas: sistem modular rentan terhadap masalah seperti duplikasi bahasa, gambar target terputus dari rencana, dan penyimpangan status selama eksekusi multi-langkah. Namun, RxBrain secara bergantian menghasilkan teks subtugas dan gambar target dalam konteks yang sama, dan memasukkan kembali hasil pembuatan putaran sebelumnya ke dalam perencanaan berikutnya. Konsistensinya jauh lebih baik dibandingkan orkestrasi eksternal. RxBrain juga memperluas cabang pembuatan aksi Aksi MoT. Ini mengonfigurasi proyeksi perhatian independen dan FFN untuk token tindakan sambil mempertahankan interaksi perhatian global dengan modalitas lain. Parameter tindakan diinisialisasi oleh cabang pemahaman visual, dan mekanisme fusi yang terjaga keamanannya diperkenalkan - pakar tindakan dapat secara selektif meminjam fitur prediksi dan perencanaan keadaan dunia dari pakar generasi visual melalui saluran. Dalam verifikasi mesin sebenarnya, pada lengan robot DOBOT X-Trainer dan Ark Infinite A5, tingkat keberhasilan rata-rata dari tiga tugas multi-tahap yaitu menempatkan peralatan makan, melipat dan menyimpan gelas, serta membuang sampah mencapai 87%, meningkat secara signifikan dibandingkan dengan π0 sebesar 68% dan π0,5 sebesar 82%.VLA-0.5 berfokus pada verifikasi fakta. Ini menempati peringkat pertama dalam peringkat simulasi keseluruhan dalam lima dimensi evaluasi RoboDojo pihak ketiga - generalisasi, memori, pengoperasian yang baik, eksekusi jangka panjang, dan pemahaman semantik terbuka. Ia juga menempati peringkat pertama dalam dua dimensi tugas jangka panjang dan tugas memori. Lebih dari 10.000 jam data pengajaran manusia berpresisi tinggi menjadi dasar pelatihannya. Di tingkat agen, arsitektur Apexio cukup cerdik. Ini terdiri dari tiga lapisan kemampuan yang online pada saat yang sama pada frekuensi yang berbeda: sistem kognitif lapisan atas bangun berdasarkan permintaan untuk melakukan pemikiran mendalam, sistem persepsi dan tindakan lapisan tengah terus-menerus menerima informasi multimodal sekitar 15 Hz dan menyesuaikan dengan cepat, dan sistem eksekusi lapisan bawah berjalan pada frekuensi yang lebih tinggi dan secara instan menangani tabrakan dan ketidakseimbangan seperti refleks yang terkondisi. Sistem ini digerakkan secara bersamaan oleh dua jalur utama: "goal drive" (penyelesaian tugas) dan "survival drive" (menjaga keselamatan, mengendalikan konsumsi energi). Bahkan tanpa instruksi eksternal, ia terus merasakan dan

  • Semua model seri Hy-Embodied adalah open source. Bobot model dapat diunduh langsung di GitHub dan HuggingFace. VLM-1.0 dan VLA-0.5 menggunakan lisensi MIT, dan RxBrain-1.0 juga mengadopsi lisensi terbuka. Jalur monetisasi Tencent lebih fokus pada lapisan platform dan lapisan layanan cloud. Platform Tairos terbuka untuk robot dan pengembang sistem, menyediakan model sumber terbuka, agen, alat pengembangan, dan layanan terpadu. Tencent Cloud telah membangun sistem infrastruktur tiga lapis mulai dari basis daya komputasi, layanan model hingga interaksi persepsi, dan meluncurkan EaaS (Embodied-AI-as-a-Service) berbasis cloud. Artinya, pelanggan dapat memanfaatkan kemampuan intelijen sesuai permintaan tanpa harus membangun sendiri infrastruktur yang lengkap. Selain itu, Tencent Cloud HAI (daya komputasi AI berkinerja tinggi), akselerasi agregasi multi-jaringan, TRRO, dan layanan lainnya juga dihubungkan dengan seri Hy-Embodied. Pelanggan industri dapat secara langsung memperoleh daya komputasi, penyimpanan, dan kemampuan jaringan yang diperlukan untuk pelatihan dan penerapan melalui Tencent Cloud.

  • ulasan positif Masukan dari komunitas pihak ketiga terfokus pada beberapa poin: Pertukaran rekayasa dari arsitektur terpadu dianggap sangat pragmatis. Banyak praktisi AI menyebutkan di area komentar HuggingFace bahwa pendekatan RxBrain dalam menjejalkan penalaran tekstual dan imajinasi visual ke dalam sekitar 6 miliar parameter adalah "lebih layak untuk dipelajari daripada sekadar menumpuk parameter." Data verifikasi mesin sebenarnya bersifat publik dan sesuai dengan model sumber terbuka satu-ke-satu, dan juga mendapat pujian. Di bagian r/MachineLearning Reddit, seorang pengguna berkomentar, "Akhirnya sebuah perusahaan besar tidak hanya menerbitkan makalah dalam hal kecerdasan yang diwujudkan." Masukan dari komunitas Tionghoa lebih terfokus pada pengakuan atas diskusi "otak dalam tong". Jawaban yang sangat dipuji atas Zhihu umumnya percaya bahwa penilaian Zhang Zhengyou terhadap WAIC "menunjukkan keterbatasan mendasar dari model besar saat ini" dan bahwa peluncuran Hy-Embodied "setidaknya menunjukkan bahwa Tencent mengambil jalan yang berbeda." umpan balik negatif Kritik terfokus pada jarak ketersediaan aktual. Skor RxBrain dalam skenario perencanaan jangka panjang 8 langkah turun dari 0,69 menjadi 0,55. Tren yang semakin parah secara bertahap menunjukkan bahwa akumulasi kesalahan dalam imajinasi visual masih menjadi hambatan. Beberapa komentar teknis menunjukkan bahwa meskipun RxBrain telah menunjukkan potensi "otak yang bersatu", "sekarang bukan waktunya" untuk menjalankannya di jalur produksi pabrik selama berjam-jam tanpa kesalahan. Ada juga ketidakpuasan terhadap harga. Meskipun modelnya open source, biaya daya komputasi Tencent Cloud tidak murah jika dijalankan di pabrik. Seorang pengguna Zhihu menghitung akun dan menerapkan solusi Hy-Embodied yang lengkap. Biaya sewa GPU bulanan saja sudah mencapai puluhan ribu yuan. Layanan tingkat perusahaan pada platform Tairos juga tidak gratis. Skenario penggunaan Selain lini produksi industri, Tencent juga mengungkapkan dua skenario penerapan panduan belanja dan layanan perawatan lansia. Dalam skenario robot navigasi pusat perbelanjaan, VLA-0.5 dapat menyelesaikan tugas seperti memimpin, memperkenalkan produk, dan menjawab pertanyaan berdasarkan instruksi bahasa alami; dalam skenario perawatan lansia, model ini terutama bertanggung jawab atas pemberian obat, respons deteksi jatuh, dan dialog pendamping yang sederhana.

  • Dilihat dari reaksi industri, peluncuran seri Hy-Embodied dianggap sebagai sinyal penting: pabrikan besar Tiongkok beralih dari "persaingan lapisan model" ke "persaingan lapisan aplikasi". Berbeda dari sikap hati-hati perusahaan luar negeri seperti Google dan Meta di bidang robotika, kali ini Tencent secara langsung memberikan solusi full-stack mulai dari model dasar hingga layanan cloud hingga platform terbuka, dan memperjelas bahwa itu adalah open source dan tersedia secara komersial. Menempati peringkat pertama dalam peringkat komprehensif RoboDojo berarti bahwa kemampuan komprehensif VLA-0.5, setidaknya dalam lingkungan simulasi, telah melampaui solusi terbuka arus utama saat ini. Namun, perlu diperhatikan juga bahwa masih terdapat kesenjangan antara simulasi dan mesin sebenarnya: model yang berperforma baik di RoboDojo mungkin berperforma buruk di dunia fisik karena masalah seperti noise sensor, latensi, dan perbedaan perangkat keras. Tencent hanya menguji tiga jenis tugas (menata peralatan makan, menyimpan gelas, dan membuang sampah) pada ponsel asli, dan jangkauannya terbatas. Dari perspektif lanskap produk yang kompetitif, jalur intelijen dalam negeri sudah cukup ramai. ByteDance memiliki seri GR-2, Huawei memiliki model bodi Pangu, dan Xiaomi memiliki CyberOne dan tim algoritma kontrol gaya di belakangnya. Keunggulan Tencent terletak pada semua model yang bersifat open source, sinergi dari keranjang keluarga model besar Hunyuan, dan akumulasi ekologis platform Tairos. Kekurangannya dibandingkan Byte dan Xiaomi, tata letak Tencent pada perangkat keras—khususnya robot humanoid—relatif lemah, dan saat ini lebih bergantung pada mitra.

  • Salah satu poin kontroversi yang perlu diperhatikan adalah arti sebenarnya dari “open source.” Meskipun bobot dan kode inferensi dari ketiga model Hy-Embodied bersifat open source, data pelatihan (lebih dari 50.000 jam data yang diwujudkan) tidak terbuka. Skala dan kualitas data pelatihan secara langsung menentukan batas atas kemampuan generalisasi model. Ketika tim lain tidak dapat mereproduksi atau menyesuaikannya, penggunaan kembali sebenarnya dari apa yang disebut "sumber terbuka" akan terganggu. Risiko lain datang dari kematangan aplikasi industri. Data pengukuran aktual pabrik kimia harian terlihat bagus (tingkat keberhasilan >95%), namun ini hanyalah skenario di mana SKU sering berubah namun pengoperasiannya relatif sederhana. Tidak ada data verifikasi publik mengenai apakah kemampuan model intelijen yang ada saat ini cukup untuk mendukung industri seperti perakitan otomotif dan manufaktur elektronik presisi yang memiliki persyaratan akurasi dan toleransi kesalahan yang lebih tinggi. Selain itu, meskipun arsitektur tiga lapis Apexio secara teknis meyakinkan, dari tiga lapis "online simultan" hingga implementasi yang benar-benar stabil memerlukan banyak pekerjaan rekayasa sistem dan adaptasi perangkat keras. Seperti yang dikomentari oleh seorang responden Zhihu dengan latar belakang teknik robotika: "Demo yang ditampilkan di laboratorium dan menjalankan dua shift di jalur produksi tanpa masalah adalah dua hal yang sangat berbeda."

  • Seri Hy-Embodied paling cocok untuk dua jenis pengguna berikut: Tipe pertama adalah sistem robot dan pengembang mesin lengkap, yang dapat langsung mengunduh model sumber terbuka untuk pengembangan dan adaptasi sekunder, dan menggunakan rantai alat platform Tairos untuk mengurangi biaya pengembangan prototipe. Kategori kedua adalah pelanggan industri, yang dapat dengan cepat menguji kelayakan kecerdasan yang terkandung dalam lini produksi melalui layanan EaaS Tencent Cloud tanpa harus membangun infrastruktur pelatihan dan penerapannya sendiri. Skenario yang kurang sesuai meliputi: jalur perakitan presisi yang memerlukan akurasi posisi sangat tinggi, aplikasi yang kritis terhadap keselamatan (seperti bantuan bedah medis), dan skenario yang perlu dijalankan pada perangkat edge berdaya sangat rendah. Dalam kasus ini, model atau sistem aturan khusus yang berorientasi pada keterampilan mungkin masih merupakan pilihan yang lebih aman untuk saat ini.

  • Seri Tencent Hy-Embodied adalah salah satu solusi open source terpenting di bidang kecerdasan yang diwujudkan pada tahun 2026. Kontribusi intinya dalam arsitektur model—menyatukan penalaran tekstual dan imajinasi visual ke dalam rangkaian kognitif yang berkelanjutan—menanggapi masalah “otak dalam tong”. Namun secara objektif, dari "membiarkan robot memahami dunia" hingga "membuat robot bekerja secara stabil di dunia nyata", seri Hy-Embodied baru menyelesaikan langkah pertama. Perjalanan keseluruhan solusi masih panjang dalam hal stabilitas misi jarak jauh, ketersediaan data pelatihan, dan kemampuan beradaptasi terhadap skenario industri yang kompleks.

Ulasan pengguna

  • avatar
    STurner_2020
    腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。

  • avatar
    MDiaz1689
    RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。

  • avatar
    Emma_Hernandez
    看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。

  • avatar
    BrandonPowellK87
    日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。

  • avatar
    lazysnake753
    Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。

  • avatar
    AnnaPetersonIII99
    腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯?

  • avatar
    TheElisaHidalgo_2024
    全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。

  • avatar
    Jonathan77z
    Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。

  • avatar
    PEbel
    RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。

  • avatar
    MrLillySveum
    说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。

  • avatar
    Bryan_Williams_2021
    智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人?

  • avatar
    CClark_X266
    VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。

  • avatar
    beautifulcat979
    腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。

  • avatar
    BeverlyRobinsonSr
    RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。

  • avatar
    SAmen
    WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。

  • avatar
    MMitchellJr86
    对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。

  • avatar
    Heather_Ramos_2024
    世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。

  • avatar
    rtko4f2uts
    腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。

  • avatar
    GloriaMiller_2021
    Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。

  • avatar
    Sharon_Cooper_99_684
    腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。