نماذج Tencent Hy-Embodied الأساسية

سلسلة نماذج أساس للذكاء الاصطناعي المتجسد من Tencent مبنية على Hunyuan، تشمل الفهم البصري (VLM-1.0) والإدراك العالمي (RxBrain-1.0) ونموذج الرؤية-اللغة-الفعل (VLA-0.5)، أُطلقت ومفتوحة المصدر في WAIC 2026

تقرير معمّق

  • في يوليو 2026، أصدرت Tencent رسميًا مجموعة كاملة من أنظمة النماذج الأساسية الذكية المجسدة - سلسلة Hy-Embodied - في المؤتمر العالمي للذكاء الاصطناعي (WAIC) في شنغهاي، بما في ذلك نموذج الفهم البصري VLM-1.0، ونموذج الإدراك العالمي RxBrain-1.0، ونموذج الرؤية واللغة والعمل المشترك VLA-0.5. هذه هي المرة الأولى التي تقوم فيها Tencent بدمج "الإدراك والإدراك والفعل" بشكل منهجي في حلقة مغلقة كاملة من الذكاء المتجسد. تم تصميم جميع النماذج الثلاثة بناءً على نموذج Hunyuan الكبير من Tencent وكانت مفتوحة المصدر في وقت واحد في يوم الإصدار. في الوقت نفسه، أطلقت Tencent أيضًا الذكاء المتجسد المستمر عبر الإنترنت Apexio، والإطار الأصلي المتجسد TairosAgent، وترقية شاملة لمنصة Tairos (برغي التيتانيوم) المفتوحة، والتي تغطي الرابط بالكامل من قوة الحوسبة السحابية إلى جسم الروبوت. الحكم الأساسي لهذا الحل هو أن الذكاء الاصطناعي الأكثر ذكاءً حاليًا لا يزال في الأساس "دماغًا في وعاء" - فهو جيد في التفكير والحوار، لكنه يفتقر إلى حلقة مغلقة للتفاعل المباشر مع العالم المادي. تستهدف سلسلة Hy-Embodied هذه الفجوة.

  • تم تطوير سلسلة Hy-Embodied بشكل مشترك بواسطة مختبر Tencent Robotics X ومختبر Futian وTencent Hunyuan. تينسنت الروبوتات إن تقسيم العمل بين النماذج الثلاثة واضح جدًا: VLM-1.0 يشبه "الدماغ الأيمن"، المسؤول عن فهم الصور والمساحات والمشاهد. إنه قريب من نفس المستوى من أداء الفهم البصري بينما يستهلك فقط حوالي عُشر قوة الحوسبة للجيل السابق الرائد؛ RxBrain-1.0 مثل "الدماغ" المتجسد، فهو يكمل في نفس الوقت تفكير النص وخيال الهدف البصري في بنية موحدة - فهو لا يخبر نموذج العمل "ما يجب فعله بعد ذلك" فحسب، بل يُظهر أيضًا "كيف يجب أن يبدو العالم بعد القيام بذلك" في شكل صور؛ يشبه VLA-0.5 الجسر بين "المخيخ" والجسم، حيث يحول الأهداف المعرفية عالية المستوى إلى تسلسلات عمل جسدية مستمرة وقابلة لتصحيح الأخطاء. هذا الإصدار ليس مجرد عرض للإنجازات الأكاديمية. أعلنت Tencent في نفس الوقت في منتدى WAIC أن VLA-0.5 قد دخل إلى مصنع كيميائي يومي لاختبار الإنتاج الفعلي. على خط إنتاج حقيقي يتميز بخلط عالي، ودفعات صغيرة، وتكرارات SKU متكررة، يتجاوز معدل نجاح التشغيل 95%، وتكون دورة القطعة الواحدة أسرع من 6 ثوانٍ، ووقت إضافة SKU جديد أقل من 3 أيام لجمع البيانات والنموذج بعد التدريب.

  • القدرة الأساسية لـ VLM-1.0 هي الفهم البصري للعالم المفتوح. وهو يتلقى مدخلات ومخرجات صور متعددة العرض تمثيلاً دلاليًا مكانيًا - موضع الكائن، وحكم قابلية التشغيل، وتخطيط المشهد، وما إلى ذلك. بالمقارنة مع الجيل السابق من VLM، فهو يحافظ على أداء قريب من معايير الفهم المكاني مثل CV-Bench وEmbSpatial مع تقليل كمية العمليات الحسابية بحوالي 90%، مما يعني أنه أكثر ملاءمة للنشر على الروبوتات ذات القدرة الحاسوبية المحدودة. يعد RxBrain-1.0 الجزء الأكثر تميزًا من الناحية الفنية في النموذج بأكمله. وهو يعتمد بنية Mixture-of-Transformers ويستخدم الطريقة كطريق لتوجيه رمز النص وإدخال الرمز المرئي والرمز المرئي الذي تم إنشاؤه إلى مسارات الحوسبة المخصصة على التوالي. يمثل كل فهم نصي ومرئي حوالي 1.5 مليار معلمة، ويضيف الجيل المرئي 2.4 مليار إضافية من FFN Expert، مع إجمالي عدد المعلمات حوالي 6.2 مليار. وسجلت 82.4 نقطة في تقييم الرسم البياني GenEval Vincentian، وهو نفس 82 نقطة لنموذج BAGEL الخاص بالجيل، مما يشير إلى أن البنية الموحدة لا تضحي بجودة الجيل. فيما يتعلق بالاستدلال المتجسد، فإن درجة التخطيط الشامل الخاصة به على RxBrain-Bench هي 0.68، وهو ما يتجاوز بكثير الحل المعياري - بالمقارنة، سجل العميل المكون من Qwen3-VL-2B وQwen-Image-Edit 0.431 فقط. في المهام المشتركة مثل التخطيط متعدد الخطوات والتخيل البصري للهدف، تكون مزايا النموذج الموحد واضحة للغاية: الأنظمة المعيارية عرضة لمشاكل مثل تكرار اللغة، وفصل الصور المستهدفة عن الخطة، وانجراف الحالة أثناء التنفيذ متعدد الخطوات. ومع ذلك، يقوم RxBrain بإنشاء نص المهمة الفرعية والصور المستهدفة بالتناوب في نفس السياق، ويعيد إدخال الجولة السابقة من نتائج الإنشاء في التخطيط اللاحق. الاتساق أفضل بكثير من التنسيق الخارجي. يقوم RxBrain أيضًا بتوسيع فرع إنشاء الإجراء Action MoT. فهو يقوم بتكوين إسقاط الاهتمام المستقل وFFN لرموز العمل مع الاحتفاظ بتفاعلات الاهتمام العالمي مع الطرائق الأخرى. تتم تهيئة معلمات الإجراء بواسطة فرع الفهم المرئي، ويتم تقديم آلية دمج مسورة - يمكن لخبراء الإجراء استعارة ميزات التنبؤ والتخطيط للحالة العالمية بشكل انتقائي من خبراء توليد المرئيات حسب القناة. في التحقق الحقيقي من الآلة، على الأذرع الروبوتية DOBOT X-Trainer وArk Infinite A5، وصل متوسط ​​معدل النجاح للمهام الثلاث متعددة المراحل المتمثلة في وضع أدوات المائدة وطي النظارات وتخزينها والتخلص من القمامة إلى 87%، وهو ما تم تحسينه بشكل ملحوظ مقارنة بـ π0's 68% وπ0.5's 82%.يركز VLA-0.5 على التحقق من الحقائق. لقد احتلت المرتبة الأولى في تصنيف المحاكاة الشامل في الأبعاد الخمسة لتقييم RoboDojo من طرف ثالث - التعميم، والذاكرة، والتشغيل الدقيق، والتنفيذ بعيد المدى، والفهم الدلالي المفتوح. كما احتلت المرتبة الأولى في بعدي المهام بعيدة المدى ومهام الذاكرة. أكثر من 10000 ساعة من بيانات التدريس البشري عالية الدقة هي أساس التدريب. على مستوى الوكيل، تعتبر بنية Apexio بارعة جدًا. وهو يتألف من ثلاث طبقات من القدرات المتصلة في نفس الوقت بترددات مختلفة: يستيقظ النظام المعرفي للطبقة العليا عند الطلب للقيام بالتفكير العميق، ويتلقى نظام الإدراك والعمل للطبقة الوسطى باستمرار معلومات متعددة الوسائط عند حوالي 15 هرتز ويتكيف بسرعة، ويعمل نظام التنفيذ للطبقة السفلية بتردد أعلى ويتعامل على الفور مع الاصطدامات والاختلالات مثل ردود الفعل المشروطة. يتم تشغيل النظام في نفس الوقت بخطين رئيسيين: "محرك الهدف" (إكمال المهام) و"محرك البقاء" (الحفاظ على السلامة، والتحكم في استهلاك الطاقة). وحتى بدون تعليمات خارجية، فإنه يستمر في الإحساس والاستعداد للإجراء التالي. TairosAgent هو إطار عمل تم تصميمه محليًا لجسم الروبوت منذ اليوم الأول للتصميم، بدلاً من تعديله من إطار عمل عام. يمكنه الاتصال بنماذج مختلفة من الروبوتات من خلال طبقة تكيف موحدة للأجهزة وواجهة مهارات موحدة. وفقًا لـ Tencent، في السيناريوهات النموذجية مثل التنقل والشرح والاسترداد بعد الانقطاع، يتم تقليل وقت الاستجابة من عشرات الثواني في الإطار العام إلى 2-3 ثوانٍ.

  • جميع نماذج سلسلة Hy-Embodied مفتوحة المصدر. يمكن تنزيل أوزان النماذج مباشرة على GitHub وHuggingFace. يستخدم VLM-1.0 وVLA-0.5 ترخيص MIT، ويعتمد RxBrain-1.0 أيضًا ترخيصًا مفتوحًا. يركز مسار تحقيق الدخل في Tencent بشكل أكبر على طبقة النظام الأساسي وطبقة الخدمة السحابية. منصة Tairos مفتوحة لمطوري الروبوتات والأنظمة، وتوفر نماذج مفتوحة المصدر ووكلاء وأدوات تطوير وخدمات متكاملة. قامت Tencent Cloud ببناء نظام بنية تحتية ثلاثي الطبقات بدءًا من قاعدة الطاقة الحاسوبية، والخدمة النموذجية وحتى تفاعل الإدراك، وأطلقت EaaS (EaS) المستندة إلى السحابة (Embodied-AI-as-a-Service). وهذا يعني أنه يمكن للعملاء الاستعانة بقدرات الذكاء المجسدة عند الطلب دون الحاجة إلى إنشاء بنية تحتية كاملة بأنفسهم. بالإضافة إلى ذلك، ترتبط Tencent Cloud HAI (قوة حوسبة الذكاء الاصطناعي عالية الأداء)، وتسريع تجميع الشبكات المتعددة، وTRRO وغيرها من الخدمات أيضًا بسلسلة Hy-Embodied. يمكن للعملاء الصناعيين الحصول مباشرة على قوة الحوسبة والتخزين وقدرات الشبكة اللازمة للتدريب والنشر من خلال Tencent Cloud.

  • مراجعة إيجابية ركزت التعليقات الواردة من مجتمع الطرف الثالث على بضع نقاط: اعتبرت المفاضلات الهندسية للبنية الموحدة عملية للغاية. ذكر العديد من ممارسي الذكاء الاصطناعي في منطقة تعليق HuggingFace أن نهج RxBrain المتمثل في حشر الاستدلال النصي والخيال البصري في حوالي 6B من المعلمات "يستحق التعلم أكثر من مجرد تكديس المعلمات". بيانات التحقق من الآلة الحقيقية عامة وتتوافق مع نموذج مفتوح المصدر واحد لواحد، وقد حظيت أيضًا بالثناء. في قسم r/MachineLearning في Reddit، علق أحد المستخدمين قائلاً: "أخيرًا، لا تقوم إحدى الشركات الكبرى بنشر الأبحاث فقط عندما يتعلق الأمر بالذكاء المتجسد." تركز ردود الفعل الواردة من المجتمع الصيني بشكل أكبر على التعرف على مناقشة "الدماغ في وعاء". تعتقد الإجابات التي نالت استحسانًا كبيرًا على Zhihu بشكل عام أن حكم Zhang Zhengyou على WAIC "أشار إلى القيود الأساسية للنموذج الكبير الحالي" وأن إصدار Hy-Embodied "يُظهر على الأقل أن Tencent تتخذ مسارًا مختلفًا". ردود فعل سلبية ركزت الانتقادات على مسافة التوفر الفعلي. انخفضت درجة RxBrain في سيناريو التخطيط طويل المدى المكون من 8 خطوات من 0.69 إلى 0.55. إن الاتجاه نحو التفاقم خطوة بخطوة يدل على أن تراكم الأخطاء في الخيال البصري لا يزال يمثل عنق الزجاجة. أشارت بعض التعليقات الفنية إلى أنه على الرغم من أن RxBrain أظهر إمكانات "العقل الموحد"، إلا أن "الآن ليس الوقت المناسب" لتشغيله على خط إنتاج المصنع لساعات دون أخطاء. هناك أيضًا بعض الاستياء من الأسعار. على الرغم من أن النموذج مفتوح المصدر، إلا أن تكلفة الطاقة الحاسوبية لـ Tencent Cloud ليست منخفضة عندما يتعلق الأمر بتشغيله في المصنع. قام أحد مستخدمي Zhihu بحساب حساب ونشر حل Hy-Embodied الكامل. تبلغ تكلفة استئجار وحدة معالجة الرسومات الشهرية وحدها عشرات الآلاف من اليوانات. الخدمات على مستوى المؤسسات في منصة Tairos ليست مجانية أيضًا. سيناريوهات الاستخدام وبالإضافة إلى خطوط الإنتاج الصناعي، كشفت تينسنت أيضًا عن سيناريوهين لتنفيذ أدلة التسوق وخدمات رعاية المسنين. في سيناريو روبوت الملاحة في مراكز التسوق، يمكن لـ VLA-0.5 إكمال مهام مثل قيادة الطريق، وتقديم المنتجات، والإجابة على الاستفسارات بناءً على تعليمات اللغة الطبيعية؛ في سيناريو رعاية المسنين، يكون النموذج مسؤولاً بشكل أساسي عن توصيل الأدوية، والاستجابة للكشف عن السقوط، والحوار المصاحب البسيط.

  • انطلاقًا من رد فعل الصناعة، يعتبر إصدار سلسلة Hy-Embodied بمثابة إشارة مهمة: تتحول الشركات المصنعة الصينية الكبرى من "المنافسة على طبقة النماذج" إلى "المنافسة على طبقة التطبيقات". وخلافًا للموقف الحذر للشركات الخارجية مثل جوجل وميتا في مجال الروبوتات، قدمت Tencent بشكل مباشر حلاً متكاملاً بدءًا من النماذج الأساسية إلى الخدمات السحابية وحتى المنصات المفتوحة هذه المرة، وأوضحت أنها مفتوحة المصدر ومتوفرة تجاريًا. إن احتلال المركز الأول في تصنيف RoboDojo الشامل يعني أن القدرات الشاملة لـ VLA-0.5، على الأقل في بيئة المحاكاة، قد تجاوزت الحلول المفتوحة السائدة حاليًا. ومع ذلك، تجدر الإشارة أيضًا إلى أنه لا تزال هناك فجوة بين المحاكاة والآلة الحقيقية: النموذج الذي يعمل بشكل جيد في RoboDojo قد يكون أداؤه ضعيفًا في العالم المادي بسبب مشكلات مثل ضوضاء المستشعر، وزمن الوصول، والاختلافات في الأجهزة. اختبرت تينسنت ثلاثة أنواع فقط من المهام (ترتيب أدوات المائدة، وتخزين النظارات، والتخلص من القمامة) على هواتف حقيقية، وكانت التغطية محدودة. من منظور مشهد المنتجات التنافسية، فإن مسار الذكاء المحلي المتجسد مزدحم للغاية بالفعل. لدى ByteDance سلسلة GR-2، ولدى Huawei نموذج جسم Pangu، وXiaomi لديها CyberOne وفريق خوارزمية التحكم في القوة الذي يقف وراءه. تكمن مزايا Tencent في المصدر المفتوح لجميع النماذج، والتآزر بين مجموعة نماذج Hunyuan الكبيرة، والتراكم البيئي لمنصة Tairos. العيب هو أنه بالمقارنة مع Byte وXiaomi، فإن تخطيط Tencent للأجهزة - وخاصة الروبوتات البشرية - ضعيف نسبيًا، ويعتمد حاليًا بشكل أكبر على الشركاء.

  • إحدى نقاط الجدل الجديرة بالملاحظة هي المعنى الفعلي لـ "المصدر المفتوح". على الرغم من أن الأوزان وأكواد الاستدلال لنماذج Hy-Embodied الثلاثة مفتوحة المصدر، إلا أن بيانات التدريب (أكثر من 50000 ساعة من البيانات المتجسدة) ليست مفتوحة. يحدد حجم وجودة بيانات التدريب بشكل مباشر الحد الأعلى لقدرة تعميم النموذج. عندما لا تتمكن الفرق الأخرى من إعادة إنتاجه أو تخصيصه، فإن إمكانية إعادة الاستخدام الفعلية لما يسمى "المصدر المفتوح" سوف تتعرض للخطر. وهناك خطر آخر يأتي من نضج تطبيقات الصناعة. تبدو البيانات المقاسة الفعلية لمصنع المواد الكيميائية اليومي جميلة (> معدل نجاح 95%)، ولكن هذا مجرد سيناريو حيث يتغير SKU بشكل متكرر ولكن العملية بسيطة نسبيًا. لا توجد بيانات تحقق عامة حول ما إذا كانت القدرات الحالية لنماذج الذكاء المتجسد كافية لدعم صناعات مثل تجميع السيارات وتصنيع الإلكترونيات الدقيقة التي تتطلب متطلبات أعلى للدقة والتسامح مع الأخطاء. بالإضافة إلى ذلك، على الرغم من أن بنية Apexio ثلاثية الطبقات مقنعة تقنيًا، إلا أن التحول من الثلاث طبقات "المتزامنة عبر الإنترنت" إلى التنفيذ المستقر حقًا يتطلب الكثير من أعمال هندسة النظام وتكييف الأجهزة. وكما علق أحد المشاركين في Zhihu الذي يتمتع بخلفية في هندسة الروبوتات: "إن العرض التوضيحي الموضح في المختبر وتشغيل نوبتين على خط الإنتاج دون أي مشاكل هما شيئان مختلفان تمامًا."

  • تعتبر سلسلة Hy-Embodied أكثر ملاءمة للنوعين التاليين من المستخدمين: النوع الأول هو نظام الروبوت ومطوري الآلات الكاملة، الذين يمكنهم تنزيل نماذج مفتوحة المصدر مباشرة للتطوير والتكيف الثانوي، واستخدام سلسلة الأدوات الخاصة بمنصة Tairos لتقليل تكاليف تطوير النموذج الأولي. أما الفئة الثانية فهي العملاء الصناعيون، الذين يمكنهم بسرعة اختبار جدوى الذكاء المتجسد في خطوط الإنتاج من خلال خدمة EaaS الخاصة بشركة Tencent Cloud دون الاضطرار إلى بناء البنية التحتية الخاصة بهم للتدريب والنشر. تشمل السيناريوهات الأقل ملاءمة ما يلي: خطوط التجميع الدقيقة التي تتطلب دقة عالية للغاية في تحديد المواقع، والتطبيقات الحيوية للسلامة (مثل المساعدة الجراحية الطبية)، والسيناريوهات التي تحتاج إلى التشغيل على أجهزة منخفضة الطاقة للغاية عند الحافة. في هذه الحالات، قد تظل النماذج المخصصة أو أنظمة القواعد الموجهة نحو المهارات خيارًا أكثر أمانًا في الوقت الحالي.

  • تعد سلسلة Tencent Hy-Embodied واحدة من أهم الحلول مفتوحة المصدر في مجال الذكاء المتجسد في عام 2026. إن مساهمتها الأساسية في هندسة النماذج - توحيد التفكير النصي والخيال البصري في تسلسل معرفي مستمر - تستجيب لمشكلة "الدماغ في وعاء". ولكن لكي نكون موضوعيين، من "السماح للروبوتات بفهم العالم" إلى "جعل الروبوتات تعمل بثبات في العالم الحقيقي"، فإن سلسلة Hy-Embodied لم تكمل سوى الخطوة الأولى. لا يزال أمام الحل برمته طريق طويل ليقطعه من حيث الاستقرار للمهام البعيدة، وتوافر بيانات التدريب، والقدرة على التكيف مع السيناريوهات الصناعية المعقدة.

مراجعات المستخدمين

  • الصورة الرمزية
    STurner_2020
    腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。

  • الصورة الرمزية
    MDiaz1689
    RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。

  • الصورة الرمزية
    Emma_Hernandez
    看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。

  • الصورة الرمزية
    BrandonPowellK87
    日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。

  • الصورة الرمزية
    lazysnake753
    Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。

  • الصورة الرمزية
    AnnaPetersonIII99
    腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯?

  • الصورة الرمزية
    TheElisaHidalgo_2024
    全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。

  • الصورة الرمزية
    Jonathan77z
    Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。

  • الصورة الرمزية
    PEbel
    RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。

  • الصورة الرمزية
    MrLillySveum
    说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。

  • الصورة الرمزية
    Bryan_Williams_2021
    智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人?

  • الصورة الرمزية
    CClark_X266
    VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。

  • الصورة الرمزية
    beautifulcat979
    腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。

  • الصورة الرمزية
    BeverlyRobinsonSr
    RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。

  • الصورة الرمزية
    SAmen
    WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。

  • الصورة الرمزية
    MMitchellJr86
    对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。

  • الصورة الرمزية
    Heather_Ramos_2024
    世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。

  • الصورة الرمزية
    rtko4f2uts
    腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。

  • الصورة الرمزية
    GloriaMiller_2021
    Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。

  • الصورة الرمزية
    Sharon_Cooper_99_684
    腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。