โมเดลพื้นฐาน Hy-Embodied ของ Tencent

ซีรีส์โมเดลพื้นฐาน AI เชิงกายภาพของ Tencent สร้างบน Hunyuan ครอบคลุมการเข้าใจภาพ (VLM-1.0) การรับรู้โลก (RxBrain-1.0) และโมเดลภาพ-ภาษา-การกระทำ (VLA-0.5) เปิดตัวและโอเพนซอร์สที่ WAIC 2026

รายงานเชิงลึก

  • ในเดือนกรกฎาคม 2569 Tencent ได้เปิดตัวชุดระบบโมเดลฐานอัจฉริยะที่รวบรวมไว้อย่างเป็นทางการ - ซีรีส์ Hy-Embodied - ที่การประชุมปัญญาประดิษฐ์โลก (WAIC) ในเซี่ยงไฮ้ ซึ่งรวมถึงโมเดลการทำความเข้าใจด้วยภาพ VLM-1.0, โมเดลการรับรู้ของโลก RxBrain-1.0 และโมเดลการมองเห็น ภาษา และการกระทำร่วม VLA-0.5 นี่เป็นครั้งแรกที่ Tencent บูรณาการ "การรับรู้-การรับรู้-การกระทำ" อย่างเป็นระบบเข้ากับวงปิดอัจฉริยะที่รวบรวมไว้อย่างสมบูรณ์ ทั้งสามรุ่นสร้างขึ้นจากโมเดลขนาดใหญ่ Hunyuan ของ Tencent และเป็นโอเพ่นซอร์สพร้อมกันในวันที่วางจำหน่าย ในเวลาเดียวกัน Tencent ยังได้เปิดตัว Apexio ซึ่งเป็นระบบอัจฉริยะที่รวบรวมไว้ทางออนไลน์อย่างต่อเนื่อง TairosAgent เฟรมเวิร์กดั้งเดิมที่รวบรวมไว้ และการอัพเกรดแพลตฟอร์มแบบเปิด Tairos (สกรูไทเทเนียม) อย่างครอบคลุม ซึ่งครอบคลุมการเชื่อมโยงทั้งหมดตั้งแต่พลังการประมวลผลแบบคลาวด์ไปจนถึงตัวหุ่นยนต์ คำตัดสินหลักของโซลูชันนี้คือ AI ที่ชาญฉลาดที่สุดในปัจจุบันยังคงเป็น "สมองในถัง" โดยพื้นฐานแล้ว สามารถให้เหตุผลและพูดคุยได้ดี แต่ไม่มีวงปิดสำหรับการโต้ตอบโดยตรงกับโลกทางกายภาพ ซีรีส์ Hy-Ebodied มุ่งเป้าไปที่ช่องว่างนี้

  • ซีรีส์ Hy-Embodied ได้รับการพัฒนาร่วมกันโดย Tencent Robotics X Laboratory, Futian Laboratory และ Tencent Hunyuan เทนเซ็นต์ โรโบติกส์ การแบ่งตำแหน่งการทำงานระหว่างทั้งสามรุ่นมีความชัดเจนมาก: VLM-1.0 เปรียบเสมือน "สมองซีกขวา" มีหน้าที่ในการทำความเข้าใจภาพ พื้นที่ และฉาก ใกล้เคียงกับประสิทธิภาพการทำความเข้าใจด้วยภาพในระดับเดียวกัน ในขณะที่ใช้พลังงานการประมวลผลเพียงประมาณหนึ่งในสิบของพลังการประมวลผลของเรือธงรุ่นก่อนหน้า RxBrain-1.0 เช่นเดียวกับ "สมอง" ที่เป็นตัวเป็นตน มันจะช่วยเติมเต็มการให้เหตุผลด้วยข้อความและจินตนาการของเป้าหมายด้วยภาพในสถาปัตยกรรมแบบครบวงจร ซึ่งไม่เพียงแต่บอกโมเดลการดำเนินการว่า "จะทำอย่างไรต่อไป" เท่านั้น แต่ยังแสดงให้เห็นว่า "โลกควรมีลักษณะอย่างไรหลังจากทำมัน" ในรูปแบบของรูปภาพ; VLA-0.5 เปรียบเสมือนสะพานเชื่อมระหว่าง "สมองน้อย" และร่างกาย โดยเปลี่ยนเป้าหมายการรับรู้ระดับสูงให้เป็นลำดับการกระทำทางกายภาพที่ต่อเนื่องและแก้ไขข้อผิดพลาดได้ ข่าวประชาสัมพันธ์ฉบับนี้ไม่ได้เป็นเพียงการแสดงความสำเร็จทางวิชาการเท่านั้น Tencent ประกาศพร้อมกันที่ฟอรัม WAIC ว่า VLA-0.5 ได้เข้าสู่โรงงานเคมีรายวันเพื่อทดสอบการผลิตจริง ในสายการผลิตจริงที่มีการผสมสูง ในปริมาณน้อย และทำซ้ำ SKU บ่อยครั้ง อัตราความสำเร็จในการดำเนินงานเกิน 95% รอบการผลิตแบบชิ้นเดียวเร็วกว่า 6 วินาที และเวลาในการเพิ่ม SKU ใหม่คือน้อยกว่า 3 วันสำหรับการรวบรวมข้อมูลและโมเดลหลังการฝึกอบรม

  • ความสามารถหลักของ VLM-1.0 คือการทำความเข้าใจด้วยภาพในโลกที่เปิดกว้าง โดยรับอินพุตรูปภาพหลายมุมมองและเอาต์พุตการแสดงความหมายเชิงพื้นที่ - ตำแหน่งวัตถุ การพิจารณาความสามารถในการปฏิบัติงาน เค้าโครงฉาก ฯลฯ เมื่อเปรียบเทียบกับ VLM รุ่นก่อนหน้า จะรักษาประสิทธิภาพที่ใกล้เคียงบนเกณฑ์มาตรฐานความเข้าใจเชิงพื้นที่ เช่น CV-Bench และ EmbSpatial ในขณะที่ลดปริมาณการคำนวณลงประมาณ 90% ซึ่งหมายความว่า เหมาะสำหรับการปรับใช้บนหุ่นยนต์ที่มีพลังการประมวลผลจำกัดมากกว่า RxBrain-1.0 เป็นส่วนที่เน้นทางเทคนิคมากที่สุดของโมเดลทั้งหมด ใช้สถาปัตยกรรม Mixture-of-Transformers และใช้ modality เป็นเส้นทางในการกำหนดเส้นทางโทเค็นข้อความ อินพุตโทเค็นภาพ และสร้างโทเค็นภาพไปยังเส้นทางการประมวลผลเฉพาะตามลำดับ การทำความเข้าใจข้อความและภาพแต่ละบัญชีสำหรับพารามิเตอร์ประมาณ 1.5B และการสร้างภาพจะเพิ่ม FFN Expert อีก 2.4B โดยมีจำนวนพารามิเตอร์ทั้งหมดประมาณ 6.2B โดยได้คะแนน 82.4 คะแนนในการประเมินกราฟ GenEval Vincentian ซึ่งเท่ากับ 82 คะแนนของ BAGEL รุ่นเฉพาะรุ่น ซึ่งบ่งชี้ว่าสถาปัตยกรรมแบบครบวงจรไม่ทำให้คุณภาพการสร้างลดลง ในแง่ของการใช้เหตุผลแบบรวม คะแนนการวางแผนที่ครอบคลุมบน RxBrain-Bench อยู่ที่ 0.68 ซึ่งสูงกว่าโซลูชันแบบโมดูลาร์มาก เมื่อเปรียบเทียบกัน Agent ที่ประกอบด้วย Qwen3-VL-2B และ Qwen-Image-Edit ได้คะแนนเพียง 0.431 เท่านั้น ในงานร่วมกัน เช่น การวางแผนแบบหลายขั้นตอนและการจินตนาการถึงเป้าหมายด้วยภาพ ข้อดีของโมเดลแบบครบวงจรนั้นชัดเจนมาก: ระบบโมดูลาร์มีแนวโน้มที่จะเกิดปัญหา เช่น การทำสำเนาภาษา รูปภาพเป้าหมายถูกตัดการเชื่อมต่อจากแผน และการเลื่อนสถานะระหว่างการดำเนินการหลายขั้นตอน อย่างไรก็ตาม RxBrain สลับกันสร้างข้อความงานย่อยและรูปภาพเป้าหมายในบริบทเดียวกัน และแทรกผลลัพธ์รอบก่อนหน้าอีกครั้งในการวางแผนครั้งต่อไป ความสม่ำเสมอนั้นดีกว่าการเรียบเรียงภายนอกมาก RxBrain ยังขยายสาขา Action Generation Action MoT อีกด้วย โดยจะกำหนดค่าการฉายภาพความสนใจอย่างอิสระและ FFN สำหรับโทเค็นการดำเนินการ ในขณะที่ยังคงรักษาการโต้ตอบความสนใจทั่วโลกด้วยวิธีอื่นๆ พารามิเตอร์การดำเนินการเริ่มต้นได้โดยสาขาการทำความเข้าใจด้วยภาพ และมีการใช้กลไกการรวมแบบมีรั้วรอบขอบชิด - ผู้เชี่ยวชาญด้านการดำเนินการสามารถเลือกยืมคุณสมบัติการคาดการณ์และการวางแผนสถานะโลกจากผู้เชี่ยวชาญด้านการสร้างภาพตามช่องทาง ในการตรวจสอบเครื่องจักรจริง บนแขนหุ่นยนต์ DOBOT X-Trainer และ Ark Infinite A5 อัตราความสำเร็จโดยเฉลี่ยของงานสามขั้นตอนแบบหลายขั้นตอน ได้แก่ การวางภาชนะบนโต๊ะอาหาร การพับ และการจัดเก็บแก้ว และการทิ้งขยะสูงถึง 87% ซึ่งได้รับการปรับปรุงอย่างมีนัยสำคัญ เมื่อเทียบกับ π0 68% และ π0.5 82%VLA-0.5 มุ่งเน้นไปที่การตรวจสอบข้อเท็จจริง ได้รับการจัดอันดับเป็นที่หนึ่งในการจัดอันดับการจำลองโดยรวมในห้ามิติของการประเมิน RoboDojo ของบุคคลที่สาม - ภาพรวม หน่วยความจำ การดำเนินการที่ดี การดำเนินการระยะไกล และความเข้าใจความหมายแบบเปิด นอกจากนี้ยังได้รับการจัดอันดับเป็นอันดับแรกในสองมิติของงานระยะไกลและงานหน่วยความจำ ข้อมูลการสอนของมนุษย์ที่มีความแม่นยำสูงมากกว่า 10,000 ชั่วโมงเป็นพื้นฐานในการฝึกอบรม ในระดับตัวแทน สถาปัตยกรรมของ Apexio ค่อนข้างชาญฉลาด ประกอบด้วยความสามารถสามชั้นที่ออนไลน์ในเวลาเดียวกันที่ความถี่ต่างกัน: ระบบการรับรู้ชั้นบนสุดตื่นขึ้นตามความต้องการในการคิดเชิงลึก ระบบการรับรู้และการกระทำของชั้นกลางจะได้รับข้อมูลหลายรูปแบบอย่างต่อเนื่องที่ประมาณ 15Hz และปรับอย่างรวดเร็ว และระบบการดำเนินการชั้นล่างสุดจะทำงานที่ความถี่สูงกว่า และจัดการกับการชนและความไม่สมดุลในทันที เช่น การตอบสนองแบบมีเงื่อนไข ระบบขับเคลื่อนไปพร้อมๆ กันด้วยสองสายหลัก: "การขับเคลื่อนตามเป้าหมาย" (การทำงานให้เสร็จสิ้น) และ "การขับเคลื่อนเพื่อความอยู่รอด" (การรักษาความปลอดภัย การควบคุมการใช้พลังงาน) แม้ว่าจะไม่มีคำสั่งจากภายนอก แต่ก็ยังคงรับรู้และเตรียมพร้อมสำหรับการดำเนินการต่อไป TairosAgent เป็นเฟรมเวิร์กที่สร้างขึ้นโดยเฉพาะสำหรับตัวหุ่นยนต์ตั้งแต่วันแรกของการออกแบบ แทนที่จะได้รับการแก้ไขจากเฟรมเวิร์กทั่วไป สามารถเชื่อมต่อกับหุ่นยนต์รุ่นต่างๆ ผ่านเลเยอร์การปรับฮาร์ดแวร์แบบรวมและอินเทอร์เฟซทักษะมาตรฐาน จากข้อมูลของ Tencent ในสถานการณ์ทั่วไป เช่น การนำทาง คำอธิบาย และการกู้คืนหลังจากการหยุดชะงัก เวลาตอบสนองจะลดลงจากสิบวินาทีในกรอบงานทั่วไปเหลือ 2-3 วินาที

  • โมเดลซีรีย์ Hy-Ebodied ทั้งหมดเป็นโอเพ่นซอร์ส สามารถดาวน์โหลดตุ้มน้ำหนักโมเดลได้โดยตรงบน GitHub และ HuggingFace VLM-1.0 และ VLA-0.5 ใช้ใบอนุญาต MIT และ RxBrain-1.0 ก็ใช้ใบอนุญาตแบบเปิดเช่นกัน เส้นทางการสร้างรายได้ของ Tencent มุ่งเน้นไปที่เลเยอร์แพลตฟอร์มและเลเยอร์บริการคลาวด์มากกว่า แพลตฟอร์ม Tairos เปิดให้นักพัฒนาหุ่นยนต์และระบบ โดยให้บริการโมเดลโอเพ่นซอร์ส เอเจนต์ เครื่องมือการพัฒนา และบริการแบบครบวงจร Tencent Cloud ได้สร้างระบบโครงสร้างพื้นฐานสามชั้นตั้งแต่ฐานพลังการประมวลผล บริการจำลองไปจนถึงการโต้ตอบการรับรู้ และเปิดตัว EaaS บนคลาวด์ (Embodied-AI-as-a-Service) ซึ่งหมายความว่าลูกค้าสามารถเรียกใช้ความสามารถด้านข่าวกรองที่รวบรวมไว้ได้ตามความต้องการ โดยไม่ต้องสร้างโครงสร้างพื้นฐานที่สมบูรณ์ด้วยตนเอง นอกจากนี้ Tencent Cloud HAI (พลังการประมวลผล AI ประสิทธิภาพสูง), การเร่งความเร็วการรวมกลุ่มหลายเครือข่าย, TRRO และบริการอื่น ๆ ยังเชื่อมโยงกับซีรี่ส์ Hy-Embodied ลูกค้าอุตสาหกรรมสามารถรับพลังการประมวลผล พื้นที่เก็บข้อมูล และความสามารถด้านเครือข่ายที่จำเป็นสำหรับการฝึกอบรมและการใช้งานผ่าน Tencent Cloud ได้โดยตรง

  • บทวิจารณ์เชิงบวก ผลตอบรับจากชุมชนบุคคลที่สามมุ่งเน้นไปที่บางประเด็น: ข้อเสียทางวิศวกรรมของสถาปัตยกรรมแบบครบวงจรนั้นถือว่าเป็นเรื่องที่ปฏิบัติได้จริงมาก ผู้ปฏิบัติงานด้าน AI หลายคนกล่าวถึงในพื้นที่แสดงความคิดเห็นของ HuggingFace ว่าแนวทางของ RxBrain ในการอัดการให้เหตุผลเชิงข้อความและจินตนาการเชิงภาพลงในพารามิเตอร์ประมาณ 6B นั้น "คุ้มค่ากับการเรียนรู้มากกว่าเพียงแค่การซ้อนพารามิเตอร์" ข้อมูลการตรวจสอบเครื่องจริงเป็นแบบสาธารณะและสอดคล้องกับโมเดลโอเพ่นซอร์สแบบตัวต่อตัว และยังได้รับการยกย่องอีกด้วย ในส่วน r/MachineLearning ของ Reddit ผู้ใช้แสดงความคิดเห็นว่า "ท้ายที่สุดแล้ว บริษัทใหญ่ๆ ไม่ได้เป็นเพียงการเผยแพร่เอกสารที่เกี่ยวข้องกับความฉลาดที่เป็นตัวเป็นตนเท่านั้น" ผลตอบรับจากชุมชนชาวจีนมุ่งเน้นไปที่การยอมรับการอภิปราย "brain in a vat" มากกว่า คำตอบที่ได้รับการยกย่องอย่างสูงเกี่ยวกับ Zhihu โดยทั่วไปเชื่อว่าคำตัดสินของ Zhang Zhengyou เกี่ยวกับ WAIC "ชี้ให้เห็นถึงข้อจำกัดพื้นฐานของโมเดลขนาดใหญ่ในปัจจุบัน" และการเปิดตัว Hy-Embodied "อย่างน้อยก็แสดงให้เห็นว่า Tencent กำลังใช้เส้นทางที่แตกต่างออกไป" ข้อเสนอแนะเชิงลบ การวิพากษ์วิจารณ์มุ่งเน้นไปที่ระยะห่างของความพร้อมที่แท้จริง คะแนนของ RxBrain ในสถานการณ์การวางแผนระยะยาว 8 ขั้นตอนลดลงจาก 0.69 เป็น 0.55 แนวโน้มที่จะแย่ลงทีละขั้นแสดงให้เห็นว่าการสะสมของข้อผิดพลาดในจินตนาการด้านการมองเห็นยังคงเป็นปัญหาคอขวด ความคิดเห็นทางเทคนิคบางส่วนชี้ให้เห็นว่าแม้ว่า RxBrain ได้แสดงให้เห็นถึงศักยภาพของ "สมองที่เป็นหนึ่งเดียว" แต่ "ตอนนี้ยังไม่ใช่เวลา" ที่จะทำงานในสายการผลิตของโรงงานเป็นเวลาหลายชั่วโมงโดยไม่มีข้อผิดพลาด นอกจากนี้ยังมีความไม่พอใจกับราคาอีกด้วย แม้ว่าโมเดลดังกล่าวจะเป็นโอเพ่นซอร์ส แต่ต้นทุนของพลังการประมวลผลของ Tencent Cloud ก็ไม่ต่ำเมื่อใช้งานในโรงงาน ผู้ใช้ Zhihu คำนวณบัญชีและปรับใช้โซลูชัน Hy-Ebodied ที่สมบูรณ์ ค่าเช่า GPU ต่อเดือนเพียงอย่างเดียวอยู่ที่หลายหมื่นหยวน บริการระดับองค์กรของแพลตฟอร์ม Tairos ก็ไม่ฟรีเช่นกัน สถานการณ์การใช้งาน นอกเหนือจากสายการผลิตทางอุตสาหกรรมแล้ว Tencent ยังเปิดเผยสถานการณ์การใช้งาน 2 รูปแบบ ได้แก่ คู่มือช้อปปิ้งและบริการดูแลผู้สูงอายุ ในสถานการณ์หุ่นยนต์นำทางในห้างสรรพสินค้า VLA-0.5 สามารถทำงานให้เสร็จสิ้นได้ เช่น การนำทาง การแนะนำผลิตภัณฑ์ และการตอบคำถามตามคำแนะนำที่เป็นภาษาธรรมชาติ ในสถานการณ์การดูแลผู้สูงอายุ โมเดลนี้มีหน้าที่หลักในการจ่ายยา การตอบสนองต่อการตรวจจับการล้ม และบทสนทนาง่ายๆ ร่วมกับเพื่อน

  • เมื่อพิจารณาจากปฏิกิริยาของอุตสาหกรรม การเปิดตัวซีรีส์ Hy-Embodied ถือเป็นสัญญาณสำคัญ: ผู้ผลิตรายใหญ่ในจีนกำลังเปลี่ยนจาก "การแข่งขันเลเยอร์โมเดล" มาเป็น "การแข่งขันเลเยอร์แอปพลิเคชัน" แตกต่างจากจุดยืนที่ระมัดระวังของบริษัทในต่างประเทศ เช่น Google และ Meta ในด้านวิทยาการหุ่นยนต์ Tencent มอบโซลูชันแบบฟูลสแตกโดยตรงตั้งแต่โมเดลพื้นฐานไปจนถึงบริการคลาวด์ไปจนถึงแพลตฟอร์มแบบเปิดในครั้งนี้ และทำให้ชัดเจนว่าเป็นโอเพ่นซอร์สและมีจำหน่ายในเชิงพาณิชย์ การได้รับอันดับหนึ่งในการจัดอันดับที่ครอบคลุมของ RoboDojo หมายความว่าความสามารถที่ครอบคลุมของ VLA-0.5 อย่างน้อยก็ในสภาพแวดล้อมการจำลอง ได้เหนือกว่าโซลูชันแบบเปิดกระแสหลักในปัจจุบัน อย่างไรก็ตาม ควรสังเกตด้วยว่ายังคงมีช่องว่างระหว่างการจำลองและเครื่องจริง: แบบจำลองที่ทำงานได้ดีใน RoboDojo อาจทำงานได้ไม่ดีในโลกทางกายภาพเนื่องจากปัญหาต่างๆ เช่น สัญญาณรบกวนของเซ็นเซอร์ เวลาแฝง และความแตกต่างของฮาร์ดแวร์ Tencent ทดสอบงานเพียงสามประเภทเท่านั้น (การจัดบนโต๊ะอาหาร การจัดเก็บแก้ว และการทิ้งขยะ) บนโทรศัพท์จริง และความครอบคลุมมีจำกัด จากมุมมองของภูมิทัศน์ผลิตภัณฑ์ที่มีการแข่งขัน เส้นทางข่าวกรองในประเทศที่รวบรวมไว้ค่อนข้างหนาแน่นอยู่แล้ว ByteDance มีซีรีส์ GR-2, Huawei มีโมเดลตัวเครื่อง Pangu และ Xiaomi มี CyberOne และทีมอัลกอริธึมควบคุมแรงอยู่เบื้องหลัง ข้อดีของ Tencent อยู่ที่โอเพ่นซอร์สของทุกรุ่น การทำงานร่วมกันของบัคเก็ตตระกูลโมเดลขนาดใหญ่ Hunyuan และการสะสมทางนิเวศวิทยาของแพลตฟอร์ม Tairos ข้อเสียคือเมื่อเปรียบเทียบกับ Byte และ Xiaomi เลย์เอาต์ของ Tencent ในฮาร์ดแวร์ โดยเฉพาะหุ่นยนต์ฮิวแมนนอยด์ นั้นค่อนข้างอ่อนแอ และปัจจุบันต้องอาศัยพันธมิตรมากกว่า

  • ประเด็นหนึ่งของข้อโต้แย้งที่น่าสังเกตคือความหมายที่แท้จริงของ "โอเพ่นซอร์ส" แม้ว่าน้ำหนักและรหัสการอนุมานของแบบจำลอง Hy-Embodied ทั้งสามแบบจะเป็นโอเพ่นซอร์ส แต่ข้อมูลการฝึกอบรม (ข้อมูลที่รวบรวมมากกว่า 50,000 ชั่วโมง) จะไม่เปิด ขนาดและคุณภาพของข้อมูลการฝึกอบรมจะกำหนดขีดจำกัดสูงสุดของความสามารถในการวางลักษณะทั่วไปของโมเดลโดยตรง เมื่อทีมอื่นไม่สามารถทำซ้ำหรือปรับแต่งได้ การนำสิ่งที่เรียกว่า "โอเพ่นซอร์ส" มาใช้ซ้ำได้จริงจะลดลง ความเสี่ยงอีกประการหนึ่งมาจากความสมบูรณ์ของการใช้งานในอุตสาหกรรม ข้อมูลที่วัดได้จริงของโรงงานเคมีรายวันดูสวยงาม (อัตราความสำเร็จ>95%) แต่นี่เป็นเพียงสถานการณ์ที่ SKU เปลี่ยนแปลงบ่อยครั้ง แต่การดำเนินการค่อนข้างง่าย ไม่มีข้อมูลการตรวจสอบสาธารณะว่าความสามารถในปัจจุบันของโมเดลอัจฉริยะที่รวมอยู่ในตัวนั้นเพียงพอที่จะสนับสนุนอุตสาหกรรมต่างๆ เช่น การประกอบยานยนต์และการผลิตอุปกรณ์อิเล็กทรอนิกส์ที่มีความแม่นยำ ซึ่งมีข้อกำหนดที่สูงขึ้นในด้านความแม่นยำและความทนทานต่อข้อผิดพลาดหรือไม่ นอกจากนี้ แม้ว่าสถาปัตยกรรมสามเลเยอร์ของ Apexio จะน่าเชื่อถือในทางเทคนิค แต่ตั้งแต่สามเลเยอร์ "ออนไลน์พร้อมกัน" ไปจนถึงการใช้งานที่เสถียรอย่างแท้จริงนั้น เกี่ยวข้องกับงานด้านวิศวกรรมระบบและการปรับฮาร์ดแวร์จำนวนมาก ผู้ตอบแบบสอบถามของ Zhihu ซึ่งมีพื้นฐานด้านวิศวกรรมหุ่นยนต์ให้ความเห็นว่า "การสาธิตที่แสดงในห้องปฏิบัติการและการทำงาน 2 กะในสายการผลิตโดยไม่มีปัญหาใดๆ เป็นสองสิ่งที่แตกต่างกันโดยสิ้นเชิง"

  • ซีรีส์ Hy-Embodied เหมาะที่สุดสำหรับผู้ใช้สองประเภทต่อไปนี้: ประเภทแรกคือระบบหุ่นยนต์และนักพัฒนาเครื่องจักรที่สมบูรณ์ ซึ่งสามารถดาวน์โหลดโมเดลโอเพ่นซอร์สได้โดยตรงสำหรับการพัฒนาและการปรับตัวขั้นที่สอง และใช้ห่วงโซ่เครื่องมือของแพลตฟอร์ม Tairos เพื่อลดต้นทุนการพัฒนาต้นแบบ ประเภทที่สองคือลูกค้าอุตสาหกรรมที่สามารถทดสอบความเป็นไปได้ของข้อมูลอัจฉริยะที่รวมอยู่ในสายการผลิตได้อย่างรวดเร็ว ผ่านบริการ EaaS ของ Tencent Cloud โดยไม่ต้องสร้างโครงสร้างพื้นฐานการฝึกอบรมและการใช้งานของตนเอง สถานการณ์ที่ไม่เหมาะสมได้แก่: สายการประกอบที่มีความแม่นยำซึ่งต้องการความแม่นยำในการวางตำแหน่งที่สูงมาก การใช้งานที่มีความสำคัญด้านความปลอดภัย (เช่น การให้ความช่วยเหลือด้านการผ่าตัดทางการแพทย์) และสถานการณ์ที่จำเป็นต้องทำงานบนอุปกรณ์ที่ใช้พลังงานต่ำมากที่ขอบ ในกรณีเหล่านี้ โมเดลหรือระบบกฎเฉพาะด้านทักษะอาจยังคงเป็นตัวเลือกที่ปลอดภัยกว่าในตอนนี้

  • ซีรีส์ Tencent Hy-Embodied เป็นหนึ่งในโซลูชันโอเพ่นซอร์สที่สำคัญที่สุดในสาขาความฉลาดที่เป็นตัวเป็นตนในปี 2026 การมีส่วนร่วมหลักในสถาปัตยกรรมแบบจำลอง - การรวมการใช้เหตุผลเชิงข้อความและจินตนาการด้วยภาพเป็นลำดับการรับรู้ที่ต่อเนื่อง - ตอบสนองต่อปัญหา "สมองในถัง" แต่เพื่อให้เป็นไปตามวัตถุประสงค์ ตั้งแต่ "การให้หุ่นยนต์เข้าใจโลก" ไปจนถึง "การทำให้หุ่นยนต์ทำงานได้อย่างเสถียรในโลกแห่งความเป็นจริง" ซีรีส์ Hy-Ebodied เพิ่งเสร็จสิ้นขั้นตอนแรกเท่านั้น โซลูชันทั้งหมดยังมีหนทางอีกยาวไกลในแง่ของความเสถียรสำหรับภารกิจทางไกล ความพร้อมใช้งานของข้อมูลการฝึกอบรม และความสามารถในการปรับตัวให้เข้ากับสถานการณ์ทางอุตสาหกรรมที่ซับซ้อน

รีวิวจากผู้ใช้

  • อวาตาร์
    STurner_2020
    腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。

  • อวาตาร์
    MDiaz1689
    RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。

  • อวาตาร์
    Emma_Hernandez
    看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。

  • อวาตาร์
    BrandonPowellK87
    日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。

  • อวาตาร์
    lazysnake753
    Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。

  • อวาตาร์
    AnnaPetersonIII99
    腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯?

  • อวาตาร์
    TheElisaHidalgo_2024
    全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。

  • อวาตาร์
    Jonathan77z
    Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。

  • อวาตาร์
    PEbel
    RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。

  • อวาตาร์
    MrLillySveum
    说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。

  • อวาตาร์
    Bryan_Williams_2021
    智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人?

  • อวาตาร์
    CClark_X266
    VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。

  • อวาตาร์
    beautifulcat979
    腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。

  • อวาตาร์
    BeverlyRobinsonSr
    RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。

  • อวาตาร์
    SAmen
    WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。

  • อวาตาร์
    MMitchellJr86
    对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。

  • อวาตาร์
    Heather_Ramos_2024
    世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。

  • อวาตาร์
    rtko4f2uts
    腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。

  • อวาตาร์
    GloriaMiller_2021
    Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。

  • อวาตาร์
    Sharon_Cooper_99_684
    腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。