텐센트 Hy-Embodied 임바디드 파운데이션 모델

텐센트가 훈위안 대형 모델 기반으로 만든 임바디드 AI 파운데이션 모델 시리즈로, 시각 이해(VLM-1.0)·세계 인지(RxBrain-1.0)·시각-언어-행동 통합 모델(VLA-0.5)을 아우르며 WAIC 2026에서 발표·오픈소스화

심층 리포트

  • 2026년 7월, Tencent는 상하이에서 열린 세계 인공 지능 회의(WAIC)에서 시각적 이해 모델 VLM-1.0, 세계 인지 모델 RxBrain-1.0 및 공동 비전-언어-행동 모델 VLA-0.5를 포함하여 완전한 구현 지능형 기본 모델 시스템 세트인 Hy-Embodied 시리즈를 공식 출시했습니다. Tencent가 "지각-인지-행동"을 완전한 구현 지능 폐쇄 루프에 체계적으로 통합한 것은 이번이 처음입니다. 세 가지 모델 모두 Tencent의 Hunyuan 대형 모델을 기반으로 제작되었으며 출시 당일 동시에 오픈소스로 공개되었습니다. 동시에 Tencent는 지속적인 온라인 구현 인텔리전스 Apexio, 구현된 기본 프레임워크 TairosAgent 및 Tairos(티타늄 나사) 개방형 플랫폼의 포괄적인 업그레이드를 출시하여 클라우드 컴퓨팅 성능에서 로봇 본체까지의 전체 링크를 포괄합니다. 이 솔루션의 핵심 판단은 현재 가장 지능적인 AI가 여전히 본질적으로 "통 속의 두뇌"라는 것입니다. 즉, 추론과 대화에는 능숙하지만 물리적 세계와 직접적인 상호 작용을 위한 폐쇄 루프가 부족합니다. Hy-Embodied 시리즈는 바로 이러한 격차를 겨냥한 것입니다.

  • Hy-Embodied 시리즈는 Tencent Robotics X Laboratory, Futian Laboratory 및 Tencent Hunyuan이 공동으로 개발했습니다. 텐센트 로보틱스 세 가지 모델 간의 포지셔닝 작업 분할은 매우 명확합니다. VLM-1.0은 이미지, 공간 및 장면 이해를 담당하는 "우뇌"와 같습니다. 이전 세대 플래그십 대비 컴퓨팅 성능을 10분의 1 정도만 소모하면서도 시각적 이해 성능은 거의 동일한 수준에 가깝습니다. RxBrain-1.0 구체화된 "뇌"처럼 통합 아키텍처에서 텍스트 추론과 시각적 대상 상상력을 동시에 완성합니다. 액션 모델에게 "다음에 무엇을 해야 할지" 알려줄 뿐만 아니라 "그 일을 한 후 세상이 어떤 모습이어야 하는지"를 이미지 형태로 보여줍니다. VLA-0.5는 "소뇌"와 신체 사이의 다리와 같으며, 높은 수준의 인지 목표를 연속적이고 오류 수정이 가능한 신체 활동 시퀀스로 변환합니다. 이번 릴리스는 단순히 학문적 성과를 보여주는 것이 아닙니다. Tencent는 WAIC 포럼에서 VLA-0.5가 실제 생산 테스트를 위해 일일 화학 공장에 들어갔다고 동시에 발표했습니다. 높은 혼합, 소규모 배치 및 빈번한 SKU 반복이 있는 실제 생산 라인에서 작업 성공률은 95%를 초과하고, 단일 부품 주기는 6초보다 빠르며, 데이터 수집 및 모델 사후 교육을 위해 새 SKU를 추가하는 데 걸리는 시간은 3일 미만입니다.

  • VLM-1.0의 핵심 기능은 개방형 시각적 이해입니다. 다시점 이미지 입력을 받아 공간 의미 표현(객체 위치, 조작성 판단, 장면 레이아웃 등)을 출력합니다. 이전 세대 VLM과 비교하여 CV-Bench 및 EmbSpatial과 같은 공간 이해 벤치마크에서 가까운 성능을 유지하면서 계산량을 약 90% 줄였습니다. 이는 컴퓨팅 능력이 제한된 로봇에 배포하는 데 더 적합하다는 것을 의미합니다. RxBrain-1.0은 전체 모델에서 기술적으로 가장 강조되는 부분입니다. Mixture-of-Transformers 아키텍처를 채택하고 양식을 텍스트 토큰 라우팅, 시각적 토큰 입력 및 생성된 시각적 토큰을 각각 전용 컴퓨팅 경로로 라우팅하는 경로로 사용합니다. 텍스트 및 시각적 이해는 각각 약 1.5B 매개변수를 차지하며, 시각적 생성은 FFN Expert에 2.4B를 추가하여 총 매개변수 수는 약 6.2B입니다. GenEval Vincentian 그래프 평가에서는 82.4점을 기록했는데, 이는 세대별 모델 BAGEL의 82점과 동일하여 통합 아키텍처가 발전 품질을 희생하지 않음을 나타냅니다. 구체화된 추론 측면에서 RxBrain-Bench의 종합 계획 점수는 0.68로 모듈식 솔루션을 훨씬 능가합니다. 이에 비해 Qwen3-VL-2B 및 Qwen-Image-Edit으로 구성된 에이전트는 0.431에 불과합니다. 다단계 계획 및 시각적 대상 상상과 같은 공동 작업에서 통합 모델의 장점은 매우 분명합니다. 모듈식 시스템은 언어 중복, 계획에서 연결이 끊어지는 대상 이미지, 다단계 실행 중 상태 드리프트와 같은 문제가 발생하기 쉽습니다. 그러나 RxBrain은 동일한 맥락에서 하위 작업 텍스트와 대상 이미지를 교대로 생성하고 이전 라운드의 생성 결과를 후속 계획에 다시 주입합니다. 일관성은 외부 오케스트레이션보다 훨씬 낫습니다. RxBrain은 또한 액션 생성 분기인 Action MoT를 더욱 확장합니다. 다른 양식과의 글로벌 주의 상호 작용을 유지하면서 작업 토큰에 대한 독립적인 주의 투영 및 FFN을 구성합니다. 동작 매개변수는 시각적 이해 분기에 의해 초기화되고 게이트 융합 메커니즘이 도입됩니다. 동작 전문가는 채널별로 시각적 생성 전문가로부터 세계 상태 예측 및 계획 기능을 선택적으로 빌릴 수 있습니다. 실제 기계 검증에서는 DOBOT X-Trainer와 Ark Infinite A5 로봇팔에서 식기 놓기, 유리잔 접기 및 보관, 쓰레기 버리기 등 3가지 다단계 작업의 평균 성공률이 87%에 달해 π0의 68%, π0.5의 82%에 비해 크게 향상됐다.VLA-0.5는 사실 검증에 중점을 둡니다. 타사 RoboDojo 평가의 5가지 차원(일반화, 메모리, 정밀 작업, 장거리 실행, 개방형 의미 이해)에서 전체 시뮬레이션 순위 1위를 차지했습니다. 또한 장거리 작업과 기억 작업의 두 가지 차원에서도 1위를 차지했습니다. 10,000시간 이상의 고정밀 인간 교육 데이터가 교육 기반입니다. 에이전트 수준에서 Apexio의 아키텍처는 매우 독창적입니다. 이는 서로 다른 주파수에서 동시에 온라인 상태인 세 가지 기능 계층으로 구성됩니다. 최상위 계층 인지 시스템은 필요할 때 깨어나 깊은 사고를 수행하고, 중간 계층 인식 및 행동 시스템은 약 15Hz에서 지속적으로 다중 모드 정보를 수신하여 빠르게 조정하며, 하위 계층 실행 시스템은 더 높은 주파수에서 실행되어 조건 반사와 같은 충돌 및 불균형을 즉시 처리합니다. 이 시스템은 "목표 추진력"(작업 완료)과 "생존 추진력"(안전 유지, 에너지 소비 제어)이라는 두 가지 주요 라인에 의해 동시에 구동됩니다. 외부 지시가 없어도 계속해서 다음 행동을 감지하고 준비합니다. TairosAgent는 일반적인 프레임워크를 수정하는 것이 아니라 설계 첫날부터 로봇 본체에 맞게 기본적으로 구축된 프레임워크입니다. 통합된 하드웨어 적응 계층과 표준화된 스킬 인터페이스를 통해 다양한 로봇 모델에 연결할 수 있습니다. Tencent에 따르면 탐색, 설명, 중단 후 복구 등 일반적인 시나리오에서 응답 시간은 일반 프레임워크의 수십 초에서 2~3초로 단축됩니다.

  • 모든 Hy-Embodied 시리즈 모델은 오픈 소스입니다. 모델 가중치는 GitHub 및 HuggingFace에서 직접 다운로드할 수 있습니다. VLM-1.0과 VLA-0.5는 MIT 라이선스를 사용하고, RxBrain-1.0도 오픈 라이선스를 채택하고 있습니다. Tencent의 수익화 경로는 플랫폼 계층과 클라우드 서비스 계층에 더 중점을 두고 있습니다. Tairos 플랫폼은 로봇 및 시스템 개발자에게 개방되어 있으며 오픈 소스 모델, 에이전트, 개발 도구 및 원스톱 서비스를 제공합니다. Tencent Cloud는 컴퓨팅 파워 기반, 모델 서비스, 인식 상호 작용까지 3계층 인프라 시스템을 구축하고 클라우드 기반 EaaS(Embodied-AI-as-a-Service)를 출시했습니다. 이는 고객이 완전한 인프라를 직접 구축하지 않고도 필요에 따라 구현된 인텔리전스 기능을 요청할 수 있음을 의미합니다. 또한 Tencent Cloud HAI(고성능 AI 컴퓨팅 성능), 다중 네트워크 집계 가속, TRRO 및 기타 서비스도 Hy-Embodied 시리즈와 연결됩니다. 산업 고객은 Tencent Cloud를 통해 교육 및 배포에 필요한 컴퓨팅 성능, 스토리지, 네트워크 기능을 직접 얻을 수 있습니다.

  • 긍정적인 평가 타사 커뮤니티의 피드백은 몇 가지 사항에 중점을 두었습니다. 통합 아키텍처의 엔지니어링 절충안은 매우 실용적인 것으로 간주되었습니다. HuggingFace 댓글 영역에서 많은 AI 실무자들은 텍스트 추론과 시각적 상상력을 약 6B 매개변수에 밀어넣는 RxBrain의 접근 방식이 "단순히 매개변수를 쌓는 것보다 학습할 가치가 더 높다"고 언급했습니다. 실제 머신 검증 데이터는 공개돼 오픈소스 모델과 1:1로 대응해 호평을 받기도 했다. Reddit의 r/MachineLearning 섹션에서 한 사용자는 "결국 대형 회사는 구현된 지능에 관한 논문을 출판하는 데 그치지 않습니다."라고 말했습니다. 중국 커뮤니티의 피드백은 '통 속의 뇌' 논의에 대한 인식에 더 초점이 맞춰져 있습니다. Zhihu에 대한 높은 평가를 받은 답변은 일반적으로 WAIC에 대한 Zhang Zhengyou의 판단이 "현재 대형 모델의 근본적인 한계를 지적"했으며 Hy-Embodied의 출시는 "적어도 Tencent가 다른 길을 가고 있음을 보여준다"고 믿습니다. 부정적인 피드백 실제 가용성의 거리에 대한 비판이 집중되었습니다. 8단계 장기 계획 시나리오에서 RxBrain의 점수는 0.69에서 0.55로 떨어졌습니다. 단계적으로 악화되는 추세는 시각적 상상력의 오류 축적이 여전히 병목 현상임을 보여줍니다. 일부 기술적 논평에서는 RxBrain이 "통일된 두뇌"의 잠재력을 입증했지만 "지금은 공장 생산 라인에서 오류 없이 몇 시간 동안 실행될 때가 아니다"라고 지적했습니다. 가격에 대한 불만도 있다. 모델은 오픈 소스이지만 공장에서 실행하는 경우 Tencent Cloud의 컴퓨팅 성능 비용은 낮지 않습니다. Zhihu 사용자는 계정을 계산하고 완전한 Hy-Embodied 솔루션을 배포했습니다. 월별 GPU 임대 비용만 수만 위안입니다. Tairos 플랫폼의 엔터프라이즈급 서비스도 무료가 아닙니다. 사용 시나리오 Tencent는 산업 생산 라인 외에도 쇼핑 가이드와 노인 돌봄 서비스의 두 가지 구현 시나리오도 공개했습니다. 쇼핑몰 내비게이션 로봇 시나리오에서 VLA-0.5는 자연어 지침을 기반으로 길 안내, 제품 소개, 문의 답변 등의 작업을 완료할 수 있습니다. 노인 간호 시나리오에서 모델은 주로 약물 전달, 넘어짐 감지 반응 및 간단한 동반자 대화를 담당합니다.

  • 업계 반응으로 볼 때, Hy-Embodied 시리즈 출시는 중요한 신호로 간주됩니다. 중국 주요 제조업체가 '모델 레이어 경쟁'에서 '애플리케이션 레이어 경쟁'으로 전환하고 있습니다. 로봇 분야에서 구글, 메타 등 해외 기업들의 조심스러운 입장과 달리 텐센트는 이번에 기본 모델부터 클라우드 서비스, 오픈 플랫폼까지 풀스택 솔루션을 직접 제공하며 오픈소스이자 상용화 가능함을 분명히 했다. RoboDojo의 종합 순위에서 1위를 차지했다는 것은 적어도 시뮬레이션 환경에서 VLA-0.5의 포괄적인 기능이 현재의 주류 개방형 솔루션을 능가했다는 것을 의미합니다. 그러나 시뮬레이션과 실제 기계 사이에는 여전히 격차가 있다는 점에도 유의해야 합니다. RoboDojo에서 잘 작동하는 모델이 센서 소음, 지연 시간, 하드웨어 차이 등의 문제로 인해 물리적 세계에서는 제대로 작동하지 않을 수도 있습니다. 텐센트는 실제 휴대폰에서 3가지 유형의 작업(식기 정리, 잔 보관, 쓰레기 버리기)만 테스트해 적용 범위가 제한적이었다. 경쟁 제품 환경의 관점에서 볼 때 국내 구현 지능 트랙은 이미 상당히 혼잡합니다. ByteDance에는 GR-2 시리즈가 있고, Huawei에는 Pangu 본체 모델이 있으며, Xiaomi에는 CyberOne과 그 뒤에 있는 힘 제어 알고리즘 팀이 있습니다. Tencent의 장점은 모든 모델의 오픈 소스, Hunyuan 대형 모델 제품군 버킷의 시너지 효과, Tairos 플랫폼의 생태 축적에 있습니다. 단점은 Byte와 Xiaomi에 비해 Tencent의 하드웨어, 특히 휴머노이드 로봇 레이아웃이 상대적으로 약하고 현재 파트너에 더 많이 의존한다는 점입니다.

  • 주목할 만한 논쟁점 중 하나는 '오픈 소스'의 실제 의미입니다. 세 가지 Hy-Embodied 모델의 가중치와 추론 코드는 오픈 소스이지만 훈련 데이터(50,000시간 이상의 구체화된 데이터)는 공개되어 있지 않습니다. 훈련 데이터의 규모와 품질은 모델의 일반화 능력의 상한을 직접적으로 결정합니다. 다른 팀이 이를 재현하거나 사용자 정의할 수 없으면 소위 "오픈 소스"의 실제 재사용성이 손상됩니다. 또 다른 위험은 산업 애플리케이션의 성숙도에서 비롯됩니다. 생활화학공장의 실제 측정 데이터는 아름다워 보이지만(성공률 95% 이상) 이는 SKU가 자주 변경되는 시나리오일 뿐이고 운영은 상대적으로 간단합니다. 구현된 지능 모델의 현재 기능이 정확성과 내결함성에 대한 요구 사항이 더 높은 자동차 조립 및 정밀 전자 제조와 같은 산업을 지원하기에 충분한지 여부에 대한 공개 검증 데이터는 없습니다. 또한 Apexio의 3계층 아키텍처는 기술적으로는 설득력이 있지만 3계층 "동시 온라인"부터 진정으로 안정적인 구현까지 많은 시스템 엔지니어링 및 하드웨어 적응 작업이 필요합니다. 로봇 공학에 대한 배경 지식이 있는 Zhihu 응답자는 다음과 같이 말했습니다. "실험실에서 보여지는 데모와 생산 라인에서 2교대 근무를 문제 없이 실행하는 것은 완전히 다른 두 가지입니다."

  • Hy-Embodied 시리즈는 다음 두 가지 유형의 사용자에게 가장 적합합니다. 첫 번째 유형은 2차 개발 및 적용을 위해 오픈 소스 모델을 직접 다운로드할 수 있고 프로토타입 개발 비용을 줄이기 위해 Tairos 플랫폼의 툴 체인을 사용할 수 있는 로봇 시스템 및 완전한 기계 개발자입니다. 두 번째 범주는 자체 교육 및 배포 인프라를 구축하지 않고도 Tencent Cloud의 EaaS 서비스를 통해 생산 라인에서 구현된 지능의 타당성을 신속하게 테스트할 수 있는 산업 고객입니다. 적합하지 않은 시나리오로는 극도로 높은 위치 정확도가 필요한 정밀 조립 라인, 안전이 중요한 애플리케이션(의료 수술 지원 등), 엣지의 극히 저전력 장치에서 실행해야 하는 시나리오 등이 있습니다. 이러한 경우 기술 중심의 전용 모델이나 규칙 시스템이 현재로서는 여전히 더 안전한 옵션일 수 있습니다.

  • Tencent Hy-Embodied 시리즈는 2026년 구현 지능 분야에서 가장 중요한 오픈 소스 솔루션 중 하나입니다. 텍스트 추론과 시각적 상상을 연속적인 인지 순서로 통합하는 모델 아키텍처의 핵심 기여는 "통 속의 두뇌" 문제에 대응합니다. 하지만 객관적으로 말하자면 '로봇이 세상을 이해하게 하는 것'부터 '로봇이 현실 세계에서 안정적으로 작동하도록 만드는 것'까지, Hy-Embodied 시리즈는 이제 첫 단계를 마쳤을 뿐입니다. 장거리 임무를 위한 안정성, 훈련 데이터의 가용성, 복잡한 산업 시나리오에 대한 적응성 측면에서 전체 솔루션은 아직 갈 길이 멀습니다.

사용자 리뷰

  • 아바타
    STurner_2020
    腾讯这波发得挺猛的,VLM、RxBrain、VLA 三件套一口气全开源了,关键是真有工厂落地数据,不是只发论文。

  • 아바타
    MDiaz1689
    RxBrain 那个统一文本推理和视觉想象的思路有点意思,比单纯的 VLM+World Model 拼起来更优雅。

  • 아바타
    Emma_Hernandez
    看了张正友关于「缸中之脑」的访谈,说得挺透的。现在大模型确实像关在缸里的大脑,知识很丰富但没有身体去验证。

  • 아바타
    BrandonPowellK87
    日化品工厂那个落地案例有点说服力,95% 成功率、6 秒/件的节拍、新增 SKU 只要 3 天适配,这数据在 WAIC 上算很能打的了。

  • 아바타
    lazysnake753
    Hy-Embodied-VLM-1.0 用 A3B 的规模做到接近上代 A32B 的效果,这个效率提升是真的香,机器人端部署不用背那么重的计算包袱了。

  • 아바타
    AnnaPetersonIII99
    腾讯坚持不做机器人硬件本体,这点倒是挺清醒的。做平台和大脑的逻辑对,但问题在于——机器人厂商愿不愿意把「大脑」外包给腾讯?

  • 아바타
    TheElisaHidalgo_2024
    全栈都开源了,Apache-2.0 协议,这点比字节和小米厚道不少。不过训练数据没开源,5 万小时的数据不放出来,别人想复现定制还是难。

  • 아바타
    Jonathan77z
    Apexio 那个三层架构——认知、感知行动、执行——频率从低到高分三层,挺像人脑的分层设计。说响应时间从几十秒缩短到 2-3 秒,这个提升确实大。

  • 아바타
    PEbel
    RoboDojo 仿真综合第一确实好看,但仿真和真机之间的差距懂的都懂。腾讯自己也不敢多吹仿真,重点在讲工厂实测。

  • 아바타
    MrLillySveum
    说到底 RxBrain 目前最大的瓶颈还是视觉想象的误差累积问题,八步规划从 0.69 掉到 0.55,真的跑长程任务还是悬。

  • 아바타
    Bryan_Williams_2021
    智元、星海图它们都自研大模型了,腾讯的「平台+生态」逻辑在移动互联网时代没错,但在具身智能这个领域,数据是核心生产资料,机器人厂商真的甘心把自己大脑交给别人?

  • 아바타
    CClark_X266
    VLA-0.5 那个 UMI 采集系统挺扎实的,亚毫米级精度、一万小时人类示教数据,这是真金白银砸出来的。不是那种「在仿真里跑了几个 benchmark 就吹上天」的路线。

  • 아바타
    beautifulcat979
    腾讯这次把 WorkBuddy APP、ADP 4.0 海外版和 Hy-Embodied 一起发了,覆盖面确实广。但具身智能这块还是觉得偏早期,离真正的通用机器人还有很大距离。

  • 아바타
    BeverlyRobinsonSr
    RxBrain 的 GenEval 文生图得分 82.4,和 BAGEL 的 82 分持平,一个具身认知模型能做出这个生成质量确实意外。说明统一架构没有牺牲生成能力。

  • 아바타
    SAmen
    WAIC 转了一圈,腾讯的展台是人最多的之一。现场那个按摩机器人「小六」的力控确实惊艳,听说基于腱绳传动,能复现人手的按摩轨迹。

  • 아바타
    MMitchellJr86
    对比前年 WAIC 的 PPT 发布,腾讯这次有了 Tairos 平台的一年沉淀、有了工厂落地数据、有了开源生态,进步还是看得见的。但具身智能这个赛道还有很长的路要走。

  • 아바타
    Heather_Ramos_2024
    世界模型的概念今年被炒得太火了,各家都在说自己做了世界模型。张正友说「世界模型还没有统一定义」,还是比较诚实的。

  • 아바타
    rtko4f2uts
    腾讯的 EaaS 思路对中小机器人厂商很友好,不用自建训练和部署基础设施。但 GPU 的租赁成本算下来一个月也得几万块,也不是小数目。

  • 아바타
    GloriaMiller_2021
    Hy-Embodied 这个命名体系挺好的,VLM 是眼睛、RxBrain 是大脑、VLA 是小脑。对开发者来说很清楚该用哪个。

  • 아바타
    Sharon_Cooper_99_684
    腾讯如果不做硬件本体,那和宇树、智元它们的竞合关系会很微妙——既是平台提供方,又是投资人。这种双重身份怎么处理还没看到答案。