Mô hình nền tảng Hy-Embodied của Tencent
Dòng mô hình nền tảng AI hiện thân của Tencent xây dựng trên Hunyuan, gồm hiểu thị giác (VLM-1.0), nhận thức thế giới (RxBrain-1.0) và mô hình thị giác-ngôn ngữ-hành động (VLA-0.5), công bố và mã nguồn mở tại WAIC 2026
Báo cáo chuyên sâu
-
Vào tháng 7 năm 2026, Tencent chính thức phát hành bộ hoàn chỉnh các hệ thống mô hình cơ sở thông minh hiện thân - dòng Hy-Embbed - tại Hội nghị Trí tuệ nhân tạo thế giới (WAIC) ở Thượng Hải, bao gồm mô hình hiểu biết trực quan VLM-1.0, mô hình nhận thức thế giới RxBrain-1.0 và mô hình hành động-ngôn ngữ-tầm nhìn chung VLA-0.5. Đây là lần đầu tiên Tencent tích hợp một cách có hệ thống “nhận thức-nhận thức-hành động” vào một vòng khép kín thông minh được thể hiện hoàn chỉnh. Cả ba mô hình đều được xây dựng dựa trên mô hình lớn Hunyuan của Tencent và đồng thời có mã nguồn mở vào ngày phát hành. Đồng thời, Tencent cũng ra mắt trí thông minh thể hiện trực tuyến liên tục Apexio, khung gốc TairosAgent được thể hiện và bản nâng cấp toàn diện nền tảng mở Tairos (vít titan), bao gồm toàn bộ liên kết từ sức mạnh điện toán đám mây đến thân robot. Nhận định cốt lõi của giải pháp này là AI thông minh nhất hiện nay thực chất vẫn là một “bộ não trong thùng” - giỏi lý luận và đối thoại, nhưng thiếu một vòng khép kín để tương tác trực tiếp với thế giới vật chất. Dòng Hy-Embed nhắm vào khoảng trống này.
-
Dòng Hy-Embbed được phát triển bởi Phòng thí nghiệm Tencent Robotics X, Phòng thí nghiệm Futian và Tencent Hunyuan. Robot của Tencent Sự phân công lao động định vị giữa ba mẫu máy rất rõ ràng: VLM-1.0 giống như “não phải”, chịu trách nhiệm hiểu hình ảnh, không gian và khung cảnh. Nó gần đạt mức hiệu suất hiểu biết trực quan tương tự trong khi chỉ tiêu thụ khoảng 1/10 sức mạnh tính toán của chiếc điện thoại hàng đầu thế hệ trước; RxBrain-1.0 Giống như một "bộ não" hiện thân, nó đồng thời hoàn thành khả năng suy luận văn bản và trí tưởng tượng mục tiêu trực quan trong một kiến trúc thống nhất - nó không chỉ cho mô hình hành động biết "việc cần làm tiếp theo" mà còn hiển thị "thế giới sẽ trông như thế nào sau khi thực hiện việc đó" dưới dạng hình ảnh; VLA-0.5 giống như cầu nối giữa “tiểu não” và cơ thể, chuyển đổi các mục tiêu nhận thức cấp cao thành các chuỗi hành động thể chất liên tục, có thể sửa lỗi. Bản phát hành này không chỉ đơn giản là một màn trình diễn thành tích học tập. Tencent đồng thời thông báo tại diễn đàn WAIC rằng VLA-0.5 đã vào nhà máy hóa chất hàng ngày để thử nghiệm sản xuất thực tế. Trên dây chuyền sản xuất thực tế có độ trộn cao, lô nhỏ và lặp lại SKU thường xuyên, tỷ lệ vận hành thành công vượt quá 95%, chu trình sản xuất một sản phẩm nhanh hơn 6 giây và thời gian thêm SKU mới là dưới 3 ngày để thu thập dữ liệu và đào tạo sau mô hình.
-
Khả năng cốt lõi của VLM-1.0 là hiểu biết trực quan về thế giới mở. Nó nhận đầu vào hình ảnh nhiều góc nhìn và đầu ra biểu diễn ngữ nghĩa không gian - vị trí đối tượng, khả năng đánh giá khả năng hoạt động, bố cục cảnh, v.v. So với VLM thế hệ trước, nó duy trì hiệu suất gần bằng các tiêu chuẩn hiểu biết không gian như CV-Bench và EmbSpatial trong khi giảm số lượng tính toán khoảng 90%, điều đó có nghĩa là nó phù hợp hơn để triển khai trên các rô-bốt có khả năng tính toán hạn chế. RxBrain-1.0 là phần nổi bật nhất về mặt kỹ thuật của toàn bộ mô hình. Nó áp dụng kiến trúc Mixture-of-Transformers và sử dụng phương thức làm tuyến đường để định tuyến Mã thông báo văn bản, Mã thông báo trực quan đầu vào và Mã thông báo trực quan được tạo tương ứng đến các đường dẫn điện toán chuyên dụng. Mỗi văn bản và hình ảnh hiểu được khoảng 1,5B tham số và việc tạo hình ảnh bổ sung thêm 2,4B FFN Expert, với tổng số tham số khoảng 6,2B. Nó đạt 82,4 điểm trong đánh giá biểu đồ GenEval Vincentian, giống như 82 điểm của mô hình BAGEL dành riêng cho thế hệ, cho thấy kiến trúc hợp nhất không hy sinh chất lượng thế hệ. Về mặt lý luận được thể hiện, điểm lập kế hoạch toàn diện của nó trên RxBrain-Bench là 0,68, vượt xa giải pháp mô-đun - so sánh, Tác nhân bao gồm Qwen3-VL-2B và Qwen-Image-Edit chỉ đạt 0,431. Trong các nhiệm vụ chung như lập kế hoạch nhiều bước và tưởng tượng mục tiêu trực quan, ưu điểm của mô hình hợp nhất là rất rõ ràng: hệ thống mô-đun dễ gặp phải các vấn đề như trùng lặp ngôn ngữ, hình ảnh mục tiêu bị ngắt kết nối khỏi kế hoạch và trạng thái trôi dạt trong quá trình thực hiện nhiều bước. Tuy nhiên, RxBrain luân phiên tạo văn bản nhiệm vụ phụ và hình ảnh mục tiêu trong cùng một ngữ cảnh, đồng thời đưa lại kết quả của vòng tạo trước đó vào kế hoạch tiếp theo. Tính nhất quán tốt hơn nhiều so với sự phối hợp bên ngoài. RxBrain cũng mở rộng hơn nữa nhánh tạo hành động Action MoT. Nó định cấu hình phép chiếu chú ý độc lập và FFN cho mã thông báo hành động trong khi vẫn duy trì các tương tác chú ý chung với các phương thức khác. Các tham số hành động được khởi tạo bởi nhánh hiểu biết trực quan và cơ chế hợp nhất có kiểm soát được giới thiệu - các chuyên gia hành động có thể mượn có chọn lọc các tính năng lập kế hoạch và dự đoán trạng thái thế giới từ các chuyên gia tạo hình ảnh theo kênh. Trong quá trình xác minh máy thực, trên cánh tay robot DOBOT X-Trainer và Ark Infinite A5, tỷ lệ thành công trung bình của ba nhiệm vụ nhiều giai đoạn là đặt bộ đồ ăn, gấp và cất ly cũng như vứt rác đạt 87%, cải thiện đáng kể so với 68% của π0 và 82% của π0.5.VLA-0.5 tập trung vào việc xác minh sự thật. Nó đứng đầu trong bảng xếp hạng mô phỏng tổng thể theo năm khía cạnh đánh giá RoboDojo của bên thứ ba - tính khái quát, bộ nhớ, hoạt động tốt, thực thi tầm xa và hiểu biết ngữ nghĩa mở. Nó cũng đứng đầu trong hai khía cạnh là nhiệm vụ tầm xa và nhiệm vụ trí nhớ. Hơn 10.000 giờ dữ liệu giảng dạy có độ chính xác cao của con người là cơ sở đào tạo của nó. Ở cấp độ đại lý, kiến trúc của Apexio khá khéo léo. Nó bao gồm ba lớp khả năng trực tuyến cùng lúc ở các tần số khác nhau: hệ thống nhận thức lớp trên cùng thức dậy theo yêu cầu để suy nghĩ sâu, hệ thống nhận thức và hành động lớp giữa liên tục nhận thông tin đa phương thức ở khoảng 15Hz và điều chỉnh nhanh chóng, còn hệ thống thực thi lớp dưới cùng chạy ở tần số cao hơn và xử lý ngay lập tức các va chạm và mất cân bằng như phản xạ có điều kiện. Hệ thống được dẫn động đồng thời bởi hai dòng chính: “goal drive” (hoàn thành nhiệm vụ) và “survival drive” (duy trì an toàn, kiểm soát mức tiêu thụ năng lượng). Ngay cả khi không có sự hướng dẫn từ bên ngoài, nó vẫn tiếp tục cảm nhận và chuẩn bị cho hành động tiếp theo. TairosAgent là một khung được xây dựng nguyên bản cho thân robot ngay từ ngày đầu tiên thiết kế, thay vì được sửa đổi từ một khung chung. Nó có thể kết nối với các mô hình robot khác nhau thông qua lớp thích ứng phần cứng thống nhất và giao diện Skill được tiêu chuẩn hóa. Theo Tencent, trong
-
Tất cả các mẫu thuộc dòng Hy-Embbed đều là mã nguồn mở. Trọng lượng mô hình có thể được tải xuống trực tiếp trên GitHub và HuggingFace. VLM-1.0 và VLA-0.5 sử dụng giấy phép MIT và RxBrain-1.0 cũng áp dụng giấy phép mở. Con đường kiếm tiền của Tencent tập trung hơn vào lớp nền tảng và lớp dịch vụ đám mây. Nền tảng Tairos dành cho các nhà phát triển robot và hệ thống, cung cấp các mô hình, tác nhân, công cụ phát triển và dịch vụ một cửa nguồn mở. Tencent Cloud đã xây dựng một hệ thống cơ sở hạ tầng ba lớp từ cơ sở sức mạnh điện toán, dịch vụ mô hình đến tương tác nhận thức và ra mắt EaaS (Embbed-AI-as-a-Service) dựa trên đám mây. Điều này có nghĩa là khách hàng có thể sử dụng các khả năng thông minh hiện có theo yêu cầu mà không cần phải tự mình xây dựng cơ sở hạ tầng hoàn chỉnh. Ngoài ra, Tencent Cloud HAI (sức mạnh điện toán AI hiệu suất cao), tăng tốc tổng hợp đa mạng, TRRO và các dịch vụ khác cũng được liên kết với dòng Hy-Embbed. Khách hàng công nghiệp có thể trực tiếp có được sức mạnh tính toán, khả năng lưu trữ và mạng cần thiết để đào tạo và triển khai thông qua Tencent Cloud.
-
đánh giá tích cực Phản hồi từ cộng đồng bên thứ ba tập trung vào một số điểm: Sự đánh đổi về mặt kỹ thuật của kiến trúc hợp nhất được coi là rất thực dụng. Nhiều người thực hành AI đã đề cập trong khu vực nhận xét HuggingFace rằng cách tiếp cận của RxBrain trong việc nhồi nhét lý luận văn bản và trí tưởng tượng trực quan vào khoảng 6B tham số là "đáng học hơn là chỉ đơn giản là xếp chồng các tham số". Dữ liệu xác minh máy thực được công khai và tương ứng với mô hình nguồn mở 1-1 và cũng đã nhận được nhiều lời khen ngợi. Trong phần r/MachineLearning của Reddit, một người dùng đã nhận xét: "Cuối cùng, một công ty lớn không chỉ xuất bản các bài báo khi nói đến trí thông minh thể hiện." Phản hồi từ cộng đồng người Hoa tập trung hơn vào việc thừa nhận cuộc thảo luận về "não trong thùng". Các câu trả lời được đánh giá cao trên Zhihu thường tin rằng nhận định của Zhang Zhengyou về WAIC "đã chỉ ra những hạn chế cơ bản của mô hình lớn hiện tại" và việc phát hành Hy-Embbed "ít nhất cho thấy rằng Tencent đang đi một con đường khác." phản hồi tiêu cực Những lời chỉ trích tập trung vào khoảng cách của khả năng sẵn có thực tế. Điểm của RxBrain trong kịch bản lập kế hoạch tầm xa 8 bước giảm từ 0,69 xuống 0,55. Xu hướng ngày càng tồi tệ hơn cho thấy việc tích tụ sai sót trong trí tưởng tượng trực quan vẫn là một nút thắt. Một số ý kiến kỹ thuật chỉ ra rằng mặc dù RxBrain đã chứng tỏ được tiềm năng của một "bộ não thống nhất" nhưng "bây giờ không phải là lúc" để nó chạy hàng giờ trên dây chuyền sản xuất của nhà máy mà không mắc lỗi. Ngoài ra còn có một số không hài lòng với giá cả. Mặc dù mô hình này là nguồn mở nhưng chi phí cho sức mạnh tính toán của Tencent Cloud không hề thấp khi vận hành nó trong nhà máy. Một người dùng Zhihu đã tính toán một tài khoản và triển khai giải pháp Hy-Embed hoàn chỉnh. Chỉ riêng chi phí thuê GPU hàng tháng đã lên tới hàng chục nghìn nhân dân tệ. Các dịch vụ cấp doanh nghiệp của nền tảng Tairos cũng không miễn phí. kịch bản sử dụng Ngoài dây chuyền sản xuất công nghiệp, Tencent còn tiết lộ 2 kịch bản triển khai là hướng dẫn mua sắm và dịch vụ chăm sóc người già. Trong kịch bản robot điều hướng trung tâm mua sắm, VLA-0.5 có thể hoàn thành các nhiệm vụ như dẫn đường, giới thiệu sản phẩm và giải đáp thắc mắc dựa trên hướng dẫn bằng ngôn ngữ tự nhiên; trong kịch bản chăm sóc người cao tuổi, mô hình này chủ yếu chịu trách nhiệm cung cấp thuốc, phản hồi phát hiện té ngã và đối thoại đồng hành đơn giản.
-
Đánh giá từ phản ứng của ngành, việc phát hành dòng Hy-Embbed được coi là một tín hiệu quan trọng: các nhà sản xuất lớn của Trung Quốc đang chuyển từ "cạnh tranh lớp mô hình" sang "cạnh tranh lớp ứng dụng". Khác với quan điểm thận trọng của các công ty nước ngoài như Google và Meta trong lĩnh vực robot, lần này Tencent trực tiếp cung cấp giải pháp toàn diện từ mô hình cơ bản đến dịch vụ đám mây cho đến nền tảng mở và nói rõ rằng đây là nguồn mở và có sẵn trên thị trường. Đứng đầu trong bảng xếp hạng toàn diện của RoboDojo đồng nghĩa với việc khả năng toàn diện của VLA-0.5, ít nhất là trong môi trường mô phỏng, đã vượt qua các giải pháp mở phổ thông hiện nay. Tuy nhiên, cũng cần lưu ý rằng vẫn có một khoảng cách giữa mô phỏng và máy thật: một mô hình hoạt động tốt trong RoboDojo có thể hoạt động kém trong thế giới thực do các vấn đề như nhiễu cảm biến, độ trễ và sự khác biệt về phần cứng. Tencent chỉ thử nghiệm ba loại nhiệm vụ (sắp xếp bộ đồ ăn, cất ly và vứt rác) trên điện thoại thật và phạm vi phủ sóng còn hạn chế. Từ góc độ bối cảnh sản phẩm cạnh tranh, con đường tình báo nội địa hiện đã khá đông đúc. ByteDance có dòng GR-2, Huawei có mẫu thân Pangu, còn Xiaomi có CyberOne và nhóm thuật toán kiểm soát lực đằng sau nó. Lợi thế của Tencent nằm ở nguồn mở của tất cả các mô hình, sức mạnh tổng hợp của nhóm mô hình lớn Hunyuan và sự tích lũy sinh thái của nền tảng Tairos. Điểm bất lợi là so với Byte và Xiaomi, cách bố trí phần cứng của Tencent - đặc biệt là robot hình người - tương đối yếu và hiện họ phụ thuộc nhiều hơn vào các đối tác.
-
Một điểm gây tranh cãi đáng chú ý là ý nghĩa thực sự của “nguồn mở”. Mặc dù trọng số và mã suy luận của ba mô hình Hy-Embed là nguồn mở nhưng dữ liệu huấn luyện (hơn 50.000 giờ dữ liệu được nhúng) không mở. Quy mô và chất lượng của dữ liệu huấn luyện trực tiếp xác định giới hạn trên của khả năng khái quát hóa của mô hình. Khi các nhóm khác không thể tái tạo hoặc tùy chỉnh nó, khả năng sử dụng lại thực tế của cái gọi là "nguồn mở" sẽ bị tổn hại. Một rủi ro khác đến từ sự trưởng thành của các ứng dụng trong ngành. Dữ liệu đo thực tế của nhà máy hóa chất hàng ngày trông rất đẹp (tỷ lệ thành công >95%), nhưng đây chỉ là trường hợp SKU thay đổi thường xuyên nhưng thao tác tương đối đơn giản. Không có dữ liệu xác minh công khai về việc liệu khả năng hiện tại của các mô hình trí tuệ hiện thân có đủ để hỗ trợ các ngành công nghiệp như lắp ráp ô tô và sản xuất điện tử chính xác có yêu cầu cao hơn về độ chính xác và khả năng chịu lỗi hay không. Ngoài ra, mặc dù kiến trúc ba lớp của Apexio có sức thuyết phục về mặt kỹ thuật, nhưng từ "trực tuyến đồng thời" ba lớp đến triển khai thực sự ổn định đòi hỏi rất nhiều công việc về kỹ thuật hệ thống và điều chỉnh phần cứng. Như một người trả lời Zhihu có nền tảng về kỹ thuật robot đã nhận xét: "Bản demo được trình chiếu trong phòng thí nghiệm và việc chạy hai ca trên dây chuyền sản xuất mà không gặp bất kỳ vấn đề gì là hai việc hoàn toàn khác nhau."
-
Dòng Hy-Embed phù hợp nhất với hai loại người dùng sau: Loại thứ nhất là nhà phát triển hệ thống robot và máy hoàn chỉnh, những người có thể tải xuống trực tiếp các mô hình nguồn mở để phát triển và điều chỉnh thứ cấp, đồng thời sử dụng chuỗi công cụ của nền tảng Tairos để giảm chi phí phát triển nguyên mẫu. Loại thứ hai là khách hàng công nghiệp, những người có thể nhanh chóng kiểm tra tính khả thi của trí thông minh được tích hợp trong dây chuyền sản xuất thông qua dịch vụ EaaS của Tencent Cloud mà không cần phải xây dựng cơ sở hạ tầng đào tạo và triển khai của riêng mình. Các kịch bản ít phù hợp hơn bao gồm: dây chuyền lắp ráp chính xác yêu cầu độ chính xác định vị cực cao, các ứng dụng quan trọng về an toàn (chẳng hạn như hỗ trợ phẫu thuật y tế) và các kịch bản cần chạy trên các thiết bị có công suất cực thấp ở biên. Trong những trường hợp này, các mô hình hoặc hệ thống quy tắc chuyên dụng hướng đến kỹ năng có thể vẫn là một lựa chọn an toàn hơn ở thời điểm hiện tại.
-
Chuỗi Tencent Hy-Embed là một trong những giải pháp nguồn mở quan trọng nhất trong lĩnh vực trí tuệ nhân tạo vào năm 2026. Đóng góp cốt lõi của nó trong kiến trúc mô hình—hợp nhất lý luận văn bản và trí tưởng tượng trực quan thành một chuỗi nhận thức liên tục—có tác dụng giải quyết vấn đề “não trong thùng”. Nhưng xét khách quan, từ việc “cho robot hiểu thế giới” đến “làm cho robot hoạt động ổn định trong thế giới thực”, dòng Hy-Embbed mới chỉ hoàn thành bước đầu tiên. Toàn bộ giải pháp vẫn còn một chặng đường dài về tính ổn định cho các nhiệm vụ đường dài, tính sẵn có của dữ liệu đào tạo và khả năng thích ứng với các kịch bản công nghiệp phức tạp.
Đánh giá của người dùng
-
STurner_2020—腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。 -
MDiaz1689—RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。 -
Emma_Hernandez—看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。 -
BrandonPowellK87—日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。 -
lazysnake753—Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。 -
AnnaPetersonIII99—腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯? -
TheElisaHidalgo_2024—全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。 -
Jonathan77z—Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。 -
PEbel—RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。 -
MrLillySveum—说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。 -
Bryan_Williams_2021—智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人? -
CClark_X266—VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。 -
beautifulcat979—腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。 -
BeverlyRobinsonSr—RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。 -
SAmen—WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。 -
MMitchellJr86—对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。 -
Heather_Ramos_2024—世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。 -
rtko4f2uts—腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。 -
GloriaMiller_2021—Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。 -
Sharon_Cooper_99_684—腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。