Tencent Hy-Embodied फाउंडेशन मॉडल

Hunyuan पर आधारित Tencent की एम्बॉडीड AI फाउंडेशन मॉडल श्रृंखला, जिसमें दृश्य समझ (VLM-1.0), विश्व संज्ञान (RxBrain-1.0) और दृष्टि-भाषा-क्रिया मॉडल (VLA-0.5) शामिल हैं; WAIC 2026 में जारी और ओपन-सोर्स

विस्तृत रिपोर्ट

  • जुलाई 2026 में, Tencent ने आधिकारिक तौर पर शंघाई में वर्ल्ड आर्टिफिशियल इंटेलिजेंस कॉन्फ्रेंस (WAIC) में सन्निहित बुद्धिमान बेस मॉडल सिस्टम - हाई-एम्बोडीड श्रृंखला - का एक पूरा सेट जारी किया, जिसमें दृश्य समझ मॉडल VLM-1.0, विश्व अनुभूति मॉडल RxBrain-1.0 और संयुक्त दृष्टि-भाषा-क्रिया मॉडल VLA-0.5 शामिल हैं। यह पहली बार है कि Tencent ने व्यवस्थित रूप से "धारणा-अनुभूति-क्रिया" को पूर्ण सन्निहित खुफिया बंद लूप में एकीकृत किया है। सभी तीन मॉडल Tencent के हुनयुआन बड़े मॉडल के आधार पर बनाए गए हैं और रिलीज़ के दिन एक साथ ओपन सोर्स किए गए थे। उसी समय, Tencent ने निरंतर ऑनलाइन सन्निहित इंटेलिजेंस एपेक्सियो, सन्निहित देशी फ्रेमवर्क TairosAgent, और Tairos (टाइटेनियम स्क्रू) ओपन प्लेटफ़ॉर्म का एक व्यापक अपग्रेड भी लॉन्च किया, जो क्लाउड कंप्यूटिंग पावर से लेकर रोबोट बॉडी तक के पूरे लिंक को कवर करता है। इस समाधान का मूल निर्णय यह है कि वर्तमान सबसे बुद्धिमान एआई अभी भी अनिवार्य रूप से "मस्तिष्क एक कुंड में" है - यह तर्क और संवाद में अच्छा है, लेकिन भौतिक दुनिया के साथ सीधे संपर्क के लिए एक बंद लूप का अभाव है। हाई-एम्बॉडीड श्रृंखला इस अंतर को लक्षित करती है।

  • हाई-एम्बॉडीड श्रृंखला को Tencent रोबोटिक्स एक्स लेबोरेटरी, फ़ुटियन लेबोरेटरी और Tencent हुनयुआन द्वारा संयुक्त रूप से विकसित किया गया है। टेनसेंट रोबोटिक्स तीन मॉडलों के बीच श्रम का स्थिति विभाजन बहुत स्पष्ट है: वीएलएम-1.0 "दाएं मस्तिष्क" की तरह है, जो छवियों, स्थानों और दृश्यों को समझने के लिए जिम्मेदार है। पिछली पीढ़ी के फ्लैगशिप की कंप्यूटिंग शक्ति का केवल दसवां हिस्सा उपभोग करते हुए यह दृश्य समझ प्रदर्शन के समान स्तर के करीब है; RxBrain-1.0 एक सन्निहित "मस्तिष्क" की तरह, यह एक साथ एक एकीकृत वास्तुकला में पाठ तर्क और दृश्य लक्ष्य कल्पना को पूरा करता है - यह न केवल एक्शन मॉडल को "आगे क्या करना है" बताता है, बल्कि छवियों के रूप में "इसे करने के बाद दुनिया कैसी दिखनी चाहिए" भी दिखाता है; वीएलए-0.5 "सेरिबैलम" और शरीर के बीच एक पुल की तरह है, जो उच्च-स्तरीय संज्ञानात्मक लक्ष्यों को निरंतर, त्रुटि-सुधार योग्य शारीरिक क्रिया अनुक्रमों में परिवर्तित करता है। यह विज्ञप्ति केवल शैक्षणिक उपलब्धियों का प्रदर्शन नहीं है। Tencent ने WAIC फोरम में एक साथ घोषणा की कि VLA-0.5 ने वास्तविक उत्पादन परीक्षण के लिए दैनिक रासायनिक कारखाने में प्रवेश किया है। उच्च मिश्रण, छोटे बैचों और बार-बार SKU पुनरावृत्तियों के साथ वास्तविक उत्पादन लाइन पर, ऑपरेशन की सफलता दर 95% से अधिक है, एकल-टुकड़ा चक्र 6 सेकंड से अधिक तेज़ है, और डेटा संग्रह और मॉडल पोस्ट-प्रशिक्षण के लिए एक नया SKU जोड़ने का समय 3 दिनों से कम है।

  • वीएलएम-1.0 की मुख्य क्षमता खुली दुनिया की दृश्य समझ है। यह मल्टी-व्यू छवि इनपुट प्राप्त करता है और स्थानिक अर्थ प्रतिनिधित्व आउटपुट करता है - ऑब्जेक्ट स्थिति, संचालन निर्णय, दृश्य लेआउट इत्यादि। पिछली पीढ़ी के वीएलएम की तुलना में, यह सीवी-बेंच और एम्बस्पेशियल जैसे स्थानिक समझ बेंचमार्क पर करीबी प्रदर्शन बनाए रखता है, जबकि गणना की मात्रा को लगभग 90% तक कम करता है, जिसका अर्थ है कि यह सीमित कंप्यूटिंग शक्ति वाले रोबोट पर तैनाती के लिए अधिक उपयुक्त है। RxBrain-1.0 पूरे मॉडल का तकनीकी रूप से सबसे अधिक हाइलाइट किया गया हिस्सा है। यह मिक्सचर-ऑफ-ट्रांसफॉर्मर्स आर्किटेक्चर को अपनाता है और क्रमशः टेक्स्ट टोकन, इनपुट विज़ुअल टोकन और जेनरेट किए गए विज़ुअल टोकन को समर्पित कंप्यूटिंग पथों पर रूट करने के लिए मोडैलिटी का उपयोग करता है। टेक्स्ट और विज़ुअल समझ प्रत्येक खाते में लगभग 1.5B पैरामीटर होते हैं, और विज़ुअल जेनरेशन लगभग 6.2B की कुल पैरामीटर गणना के साथ FFN एक्सपर्ट का अतिरिक्त 2.4B जोड़ता है। जेनएवल विंसेंटियन ग्राफ़ मूल्यांकन में इसने 82.4 अंक प्राप्त किए, जो कि पीढ़ी-विशिष्ट मॉडल BAGEL के 82 अंकों के समान है, जो दर्शाता है कि एकीकृत वास्तुकला पीढ़ी की गुणवत्ता का त्याग नहीं करती है। सन्निहित तर्क के संदर्भ में, RxBrain-Bench पर इसका व्यापक नियोजन स्कोर 0.68 है, जो मॉड्यूलर समाधान से कहीं अधिक है - इसकी तुलना में, Qwen3-VL-2B और Qwen-Image-Edit से बने एजेंट ने केवल 0.431 स्कोर किया। बहु-चरण योजना और दृश्य लक्ष्य कल्पना जैसे संयुक्त कार्यों में, एकीकृत मॉडल के फायदे बहुत स्पष्ट हैं: मॉड्यूलर सिस्टम में भाषा दोहराव, लक्ष्य छवियों को योजना से अलग किया जाना और बहु-चरण निष्पादन के दौरान राज्य बहाव जैसी समस्याओं का खतरा होता है। हालाँकि, RxBrain वैकल्पिक रूप से एक ही संदर्भ में उप-कार्य पाठ और लक्ष्य छवियां उत्पन्न करता है, और पीढ़ी के पिछले दौर के परिणामों को बाद की योजना में फिर से इंजेक्ट करता है। बाहरी ऑर्केस्ट्रेशन की तुलना में स्थिरता कहीं बेहतर है। RxBrain एक्शन जेनरेशन ब्रांच एक्शन MoT का भी विस्तार करता है। यह अन्य तौर-तरीकों के साथ वैश्विक ध्यान बातचीत को बनाए रखते हुए कार्रवाई टोकन के लिए स्वतंत्र ध्यान प्रक्षेपण और एफएफएन को कॉन्फ़िगर करता है। क्रिया मापदंडों को दृश्य समझ शाखा द्वारा प्रारंभ किया जाता है, और एक गेटेड फ़्यूज़न तंत्र पेश किया जाता है - क्रिया विशेषज्ञ चैनल द्वारा दृश्य पीढ़ी विशेषज्ञों से विश्व राज्य की भविष्यवाणी और योजना सुविधाओं को चुनिंदा रूप से उधार ले सकते हैं। वास्तविक मशीन सत्यापन में, DOBOTVLA-0.5 तथ्य सत्यापन पर केंद्रित है। यह तीसरे पक्ष के रोबोडोजो मूल्यांकन के पांच आयामों - सामान्यीकरण, स्मृति, ठीक संचालन, लंबी दूरी के निष्पादन और खुली अर्थ संबंधी समझ में समग्र सिमुलेशन रैंकिंग में पहले स्थान पर है। यह लंबी दूरी के कार्यों और स्मृति कार्यों के दो आयामों में भी पहले स्थान पर है। 10,000 घंटे से अधिक उच्च-सटीक मानव शिक्षण डेटा इसका प्रशिक्षण आधार है। एजेंट स्तर पर, एपेक्सियो की वास्तुकला काफी सरल है। इसमें क्षमताओं की तीन परतें होती हैं जो एक ही समय में अलग-अलग आवृत्तियों पर ऑनलाइन होती हैं: शीर्ष परत संज्ञानात्मक प्रणाली गहरी सोच करने की मांग पर जागती है, मध्य परत धारणा और कार्रवाई प्रणाली लगातार लगभग 15 हर्ट्ज पर मल्टी-मोडल जानकारी प्राप्त करती है और जल्दी से समायोजित होती है, और निचली परत निष्पादन प्रणाली उच्च आवृत्ति पर चलती है और वातानुकूलित प्रतिबिंब जैसे टकराव और असंतुलन को तुरंत संभालती है। सिस्टम एक साथ दो मुख्य लाइनों द्वारा संचालित होता है: "लक्ष्य ड्राइव" (कार्य पूरा करना) और "अस्तित्व ड्राइव" (सुरक्षा बनाए रखना, ऊर्जा खपत को नियंत्रित करना)। बाहरी निर्देशों के बिना भी, यह समझ में आता रहता है और अगली कार्रवाई के लिए तैयारी करता रहता है। TairosAgent एक सामान्य ढांचे से संशोधित होने के बजाय डिजाइन के पहले दिन से रोबोट बॉडी के लिए मूल रूप से बनाया गया एक ढांचा है। यह एकीकृत हार्डवेयर अनुकूलन परत और मानकीकृत कौशल इंटरफ़ेस के माध्यम से रोबोट के विभिन्न मॉडलों से जुड़ सकता है। Tencent के अनुसार, नेविगेशन, स्पष्टीकरण और रुकावट के बाद पुनर्प्राप्ति जैसे विशिष्ट परिदृश्यों में, सामान्य ढांचे में प्रतिक्रिया समय को दसियों सेकंड से घटाकर 2-3 सेकंड कर दिया जाता है।

  • हाई-एम्बॉडीड श्रृंखला के सभी मॉडल खुले स्रोत हैं। मॉडल वेट सीधे GitHub और HuggingFace पर डाउनलोड किया जा सकता है। VLM-1.0 और VLA-0.5 MIT लाइसेंस का उपयोग करते हैं, और RxBrain-1.0 भी एक खुला लाइसेंस अपनाता है। Tencent का मुद्रीकरण पथ प्लेटफ़ॉर्म परत और क्लाउड सेवा परत पर अधिक केंद्रित है। टैरोस प्लेटफ़ॉर्म रोबोट और सिस्टम डेवलपर्स के लिए खुला है, जो ओपन सोर्स मॉडल, एजेंट, विकास उपकरण और वन-स्टॉप सेवाएं प्रदान करता है। टेनसेंट क्लाउड ने कंप्यूटिंग पावर बेस, मॉडल सर्विस से लेकर परसेप्शन इंटरेक्शन तक तीन-परत इंफ्रास्ट्रक्चर सिस्टम बनाया है, और क्लाउड-आधारित ईएएएस (एम्बोडिड-एआई-ए-ए-सर्विस) लॉन्च किया है। इसका मतलब यह है कि ग्राहक स्वयं संपूर्ण बुनियादी ढांचा तैयार किए बिना मांग पर सन्निहित खुफिया क्षमताओं को बुला सकते हैं। इसके अलावा, Tencent क्लाउड HAI (हाई-परफॉर्मेंस AI कंप्यूटिंग पावर), मल्टी-नेटवर्क एग्रीगेशन एक्सेलेरेशन, TRRO और अन्य सेवाएं भी Hy-Embodied श्रृंखला से जुड़ी हुई हैं। औद्योगिक ग्राहक सीधे Tencent क्लाउड के माध्यम से प्रशिक्षण और तैनाती के लिए आवश्यक कंप्यूटिंग शक्ति, भंडारण और नेटवर्क क्षमताओं को प्राप्त कर सकते हैं।

  • सकारात्मक समीक्षा तीसरे पक्ष के समुदाय की प्रतिक्रिया कुछ बिंदुओं पर केंद्रित थी: एकीकृत वास्तुकला के इंजीनियरिंग व्यापार-बंद को बहुत व्यावहारिक माना जाता था। कई एआई चिकित्सकों ने हगिंगफेस टिप्पणी क्षेत्र में उल्लेख किया है कि आरएक्सब्रेन का पाठ्य तर्क और दृश्य कल्पना को लगभग 6बी मापदंडों में समेटने का दृष्टिकोण "सिर्फ मापदंडों को ढेर करने की तुलना में सीखने के अधिक योग्य है।" वास्तविक मशीन सत्यापन डेटा सार्वजनिक है और ओपन सोर्स मॉडल वन-टू-वन से मेल खाता है, और इसे प्रशंसा भी मिली है। Reddit के r/MachineLearning अनुभाग में, एक उपयोगकर्ता ने टिप्पणी की, "आखिरकार जब सन्निहित बुद्धिमत्ता की बात आती है तो एक प्रमुख कंपनी केवल कागजात प्रकाशित नहीं कर रही है।" चीनी समुदाय की प्रतिक्रिया "मस्तिष्क इन ए वात" चर्चा की मान्यता पर अधिक केंद्रित है। झिहू पर अत्यधिक प्रशंसित उत्तर आम तौर पर मानते हैं कि WAIC पर झांग झेंगयौ के फैसले ने "मौजूदा बड़े मॉडल की मूलभूत सीमाओं को इंगित किया" और हाई-एम्बॉडीड की रिलीज "कम से कम दिखाती है कि Tencent एक अलग रास्ता अपना रहा है।" नकारात्मक प्रतिक्रिया आलोचनाएँ वास्तविक उपलब्धता की दूरी पर केंद्रित थीं। 8-चरणीय लंबी दूरी की योजना परिदृश्य में RxBrain का स्कोर 0.69 से गिरकर 0.55 हो गया। कदम दर कदम बदतर होने की प्रवृत्ति से पता चलता है कि दृश्य कल्पना में त्रुटियों का संचय अभी भी एक बाधा है। कुछ तकनीकी टिप्पणियों में बताया गया है कि यद्यपि RxBrain ने "एकीकृत मस्तिष्क" की क्षमता का प्रदर्शन किया है, लेकिन "अब समय नहीं है" कि इसे फ़ैक्टरी उत्पादन लाइन पर बिना किसी त्रुटि के घंटों तक चलाया जा सके। मूल्य निर्धारण को लेकर भी कुछ असंतोष है। हालाँकि मॉडल खुला स्रोत है, लेकिन जब इसे किसी कारखाने में चलाने की बात आती है तो Tencent क्लाउड की कंप्यूटिंग शक्ति की लागत कम नहीं होती है। एक झिहु उपयोगकर्ता ने एक खाते की गणना की और एक पूर्ण हाई-एम्बॉडीड समाधान तैनात किया। अकेले GPU की मासिक किराये की लागत हजारों युआन है। टैरोस प्लेटफ़ॉर्म की एंटरप्राइज़-ग्रेड सेवाएँ भी मुफ़्त नहीं हैं। उपयोग परिदृश्य औद्योगिक उत्पादन लाइनों के अलावा, Tencent ने शॉपिंग गाइड और बुजुर्ग देखभाल सेवाओं के दो कार्यान्वयन परिदृश्यों का भी खुलासा किया। शॉपिंग मॉल नेविगेशन रोबोट परिदृश्य में, VLA-0.5 रास्ता दिखाने, उत्पादों को पेश करने और प्राकृतिक भाषा निर्देशों के आधार पर पूछताछ का जवाब देने जैसे कार्यों को पूरा कर सकता है; बुजुर्ग देखभाल परिदृश्य में, मॉडल मुख्य रूप से दवा वितरण, गिरावट का पता लगाने की प्रतिक्रिया और सरल साथी संवाद के लिए जिम्मेदार है।

  • उद्योग की प्रतिक्रिया को देखते हुए, हाई-एम्बॉडीड श्रृंखला की रिलीज़ को एक महत्वपूर्ण संकेत माना जाता है: प्रमुख चीनी निर्माता "मॉडल लेयर प्रतियोगिता" से "एप्लिकेशन लेयर प्रतियोगिता" की ओर स्थानांतरित हो रहे हैं। रोबोटिक्स के क्षेत्र में Google और मेटा जैसी विदेशी कंपनियों के सतर्क रुख से अलग, Tencent ने इस बार सीधे तौर पर बुनियादी मॉडल से लेकर क्लाउड सेवाओं से लेकर ओपन प्लेटफॉर्म तक पूर्ण-स्टैक समाधान प्रदान किया, और यह स्पष्ट कर दिया कि यह खुला स्रोत और व्यावसायिक रूप से उपलब्ध है। रोबोडोजो की व्यापक रैंकिंग में पहले स्थान पर आने का मतलब है कि वीएलए-0.5 की व्यापक क्षमताएं, कम से कम सिमुलेशन वातावरण में, वर्तमान मुख्यधारा के खुले समाधानों से आगे निकल गई हैं। हालाँकि, यह भी ध्यान दिया जाना चाहिए कि सिमुलेशन और वास्तविक मशीन के बीच अभी भी एक अंतर है: एक मॉडल जो रोबोडोजो में अच्छा प्रदर्शन करता है वह सेंसर शोर, विलंबता और हार्डवेयर अंतर जैसे मुद्दों के कारण भौतिक दुनिया में खराब प्रदर्शन कर सकता है। Tencent ने वास्तविक फोन पर केवल तीन प्रकार के कार्यों (टेबलवेयर की व्यवस्था करना, गिलासों का भंडारण करना और कचरा फेंकना) का परीक्षण किया, और कवरेज सीमित था। प्रतिस्पर्धी उत्पाद परिदृश्य के नजरिए से, घरेलू सन्निहित खुफिया ट्रैक पहले से ही काफी भीड़भाड़ वाला है। बाइटडांस के पास GR-2 श्रृंखला है, Huawei के पास पंगु बॉडी मॉडल है, और Xiaomi के पास साइबरवन और इसके पीछे बल नियंत्रण एल्गोरिदम टीम है। Tencent के फायदे सभी मॉडलों के खुले स्रोत, हुनयुआन बड़े मॉडल परिवार बाल्टी के तालमेल और टैरोस प्लेटफॉर्म के पारिस्थितिक संचय में निहित हैं। नुकसान यह है कि बाइट और श्याओमी की तुलना में, हार्डवेयर-विशेष रूप से ह्यूमनॉइड रोबोट में Tencent का लेआउट अपेक्षाकृत कमजोर है, और यह वर्तमान में भागीदारों पर अधिक निर्भर है।

  • ध्यान देने योग्य विवाद का एक बिंदु "ओपन सोर्स" का वास्तविक अर्थ है। यद्यपि तीन हाई-एम्बॉडीड मॉडल के वजन और अनुमान कोड खुले स्रोत हैं, प्रशिक्षण डेटा (50,000 घंटे से अधिक सन्निहित डेटा) खुला नहीं है। प्रशिक्षण डेटा का पैमाना और गुणवत्ता सीधे मॉडल की सामान्यीकरण क्षमता की ऊपरी सीमा निर्धारित करती है। जब अन्य टीमें इसे पुन: पेश या अनुकूलित नहीं कर सकती हैं, तो तथाकथित "ओपन सोर्स" की वास्तविक पुन: प्रयोज्यता से समझौता किया जाएगा। एक अन्य जोखिम उद्योग अनुप्रयोगों की परिपक्वता से आता है। दैनिक रासायनिक कारखाने का वास्तविक मापा गया डेटा सुंदर दिखता है (>95% सफलता दर), लेकिन यह सिर्फ एक परिदृश्य है जहां SKU बार-बार बदलता है लेकिन ऑपरेशन अपेक्षाकृत सरल है। इस बात पर कोई सार्वजनिक सत्यापन डेटा नहीं है कि क्या सन्निहित इंटेलिजेंस मॉडल की मौजूदा क्षमताएं ऑटोमोटिव असेंबली और सटीक इलेक्ट्रॉनिक्स विनिर्माण जैसे उद्योगों का समर्थन करने के लिए पर्याप्त हैं, जिनकी सटीकता और दोष सहनशीलता के लिए उच्च आवश्यकताएं हैं। इसके अलावा, हालांकि एपेक्सियो की तीन-परत वास्तुकला तकनीकी रूप से विश्वसनीय है, तीन-परत "एक साथ ऑनलाइन" से लेकर वास्तव में स्थिर कार्यान्वयन तक बहुत सारे सिस्टम इंजीनियरिंग और हार्डवेयर अनुकूलन कार्य शामिल हैं। रोबोटिक्स इंजीनियरिंग की पृष्ठभूमि वाले झिहू प्रतिवादी ने टिप्पणी की: "प्रयोगशाला में दिखाया गया डेमो और बिना किसी समस्या के उत्पादन लाइन पर दो शिफ्ट चलाना दो पूरी तरह से अलग चीजें हैं।"

  • हाई-एम्बॉडीड श्रृंखला निम्नलिखित दो प्रकार के उपयोगकर्ताओं के लिए सबसे उपयुक्त है: पहला प्रकार रोबोट सिस्टम और पूर्ण मशीन डेवलपर्स है, जो माध्यमिक विकास और अनुकूलन के लिए सीधे ओपन सोर्स मॉडल डाउनलोड कर सकते हैं, और प्रोटोटाइप विकास लागत को कम करने के लिए टैरोस प्लेटफ़ॉर्म की टूल श्रृंखला का उपयोग कर सकते हैं। दूसरी श्रेणी औद्योगिक ग्राहक हैं, जो अपने स्वयं के प्रशिक्षण और तैनाती के बुनियादी ढांचे का निर्माण किए बिना, Tencent क्लाउड की EaaS सेवा के माध्यम से उत्पादन लाइनों में सन्निहित बुद्धिमत्ता की व्यवहार्यता का शीघ्रता से परीक्षण कर सकते हैं। जो परिदृश्य कम उपयुक्त हैं उनमें शामिल हैं: सटीक असेंबली लाइनें जिनके लिए अत्यधिक उच्च स्थिति सटीकता, सुरक्षा-महत्वपूर्ण अनुप्रयोगों (जैसे चिकित्सा सर्जिकल सहायता) की आवश्यकता होती है, और ऐसे परिदृश्य जिन्हें किनारे पर बेहद कम-शक्ति वाले उपकरणों पर चलाने की आवश्यकता होती है। इन मामलों में, कौशल-उन्मुख समर्पित मॉडल या नियम प्रणालियाँ अभी भी एक सुरक्षित विकल्प हो सकती हैं।

  • Tencent Hy-Embodied श्रृंखला 2026 में सन्निहित बुद्धिमत्ता के क्षेत्र में सबसे महत्वपूर्ण ओपन सोर्स समाधानों में से एक है। मॉडल आर्किटेक्चर में इसका मुख्य योगदान - पाठ्य तर्क और दृश्य कल्पना को एक निरंतर संज्ञानात्मक अनुक्रम में एकीकृत करना - "मस्तिष्क इन ए वैट" समस्या का जवाब देता है। लेकिन वस्तुनिष्ठ होने के लिए, "रोबोटों को दुनिया को समझने देना" से लेकर "रोबोटों को वास्तविक दुनिया में स्थिर रूप से काम करने देना" तक, हाई-एम्बॉडीड श्रृंखला ने केवल पहला चरण पूरा किया है। लंबी दूरी के मिशनों के लिए स्थिरता, प्रशिक्षण डेटा की उपलब्धता और जटिल औद्योगिक परिदृश्यों के अनुकूलता के मामले में संपूर्ण समाधान को अभी भी एक लंबा रास्ता तय करना है।

उपयोगकर्ता समीक्षाएं

  • अवतार
    STurner_2020
    腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。

  • अवतार
    MDiaz1689
    RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。

  • अवतार
    Emma_Hernandez
    看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。

  • अवतार
    BrandonPowellK87
    日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。

  • अवतार
    lazysnake753
    Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。

  • अवतार
    AnnaPetersonIII99
    腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯?

  • अवतार
    TheElisaHidalgo_2024
    全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。

  • अवतार
    Jonathan77z
    Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。

  • अवतार
    PEbel
    RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。

  • अवतार
    MrLillySveum
    说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。

  • अवतार
    Bryan_Williams_2021
    智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人?

  • अवतार
    CClark_X266
    VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。

  • अवतार
    beautifulcat979
    腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。

  • अवतार
    BeverlyRobinsonSr
    RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。

  • अवतार
    SAmen
    WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。

  • अवतार
    MMitchellJr86
    对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。

  • अवतार
    Heather_Ramos_2024
    世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。

  • अवतार
    rtko4f2uts
    腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。

  • अवतार
    GloriaMiller_2021
    Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。

  • अवतार
    Sharon_Cooper_99_684
    腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。