智元GO-2具身基座大模型

智元机器人推出的第二代具身智能基座大模型,首创动作思维链技术,打通机器人从理解意图到稳定执行的链路

深度报告

  • 智元GO-2(Genie Operator-2)是智元机器人于2026年4月9日发布的新一代具身基座大模型。该模型首次在统一架构中打通从逻辑推理到精准动作执行的“最后一公里”,结合数万小时的数据训练,在多个机器人基准测试中刷新行业SOTA(State of the Art,最先进水平),让机器人从“黑盒摸索”迈向真正的“知行合一”。GO-2的发布标志着具身智能领域取得重要突破,为通用机器人的商业化落地提供了关键技术支撑。

  • 智元机器人(Agibot)是一家专注于通用智能机器人研发的公司,总部位于上海。公司致力于“以智能机器创造无限生产力”,已构建完整的产品矩阵,包括远征系列、灵犀系列、精灵系列、酷拓系列机器人以及OmniHand机械手等产品。 2025年4月,智元发布第一代GO-1具身基座大模型。经过一年的技术迭代,2026年4月9日,智元正式发布GO-2新一代具身基座大模型。该模型继承了GO-1的技术优势,并在动作执行精度、任务泛化能力、复杂场景适应性等方面实现显著提升。 智元的产品已覆盖多个应用场景,包括工业制造、医疗康复、商业服务等领域。公司通过Genie Studio具身智能开发平台、AGIBOT World数据集等开放生态,为开发者提供完整的工具链支持。

  • GO-2具身基座大模型的核心定位是解决机器人从“理解意图”到“稳定执行”之间的断层问题。传统机器人可以听懂人类指令、识别周围物体、规划执行路径,却常在执行瞬间出现动作偏移、抓取失败等情况。这一问题被称为具身智能领域的“语义鸿沟”,是机器人走向实用化的最大挑战之一。 GO-2通过以下技术创新解决上述问题: 动作思维链(Chain of Action):GO-2首创动作思维链机制,模型不会直接输出控制信号,而是先生成一段高层动作序列作为任务的整体规划,描述行为的方向、结构与执行路径。这种方式使复杂任务被拆解为有序的子步骤,显著提升执行的成功率和稳定性。 异步双系统架构:GO-2采用异步双系统架构,将逻辑推理与运动控制分离处理。系统能够边想边做,在保持高频控制响应的同时,完成复杂的任务规划和决策。这种架构突破了传统机器人“边看边做”的局限,实现真正的多任务并行处理。 统一架构设计:GO-2首次在单一模型架构中融合逻辑推理与高精度运动控制两大能力。区别于此前分离的感知-规划-控制系统,GO-2实现了端到端的“知行合一”,使机器人能够理解复杂指令并稳定执行。 数据驱动的泛化能力:经过数万小时的高质量数据训练,GO-2具备强大的任务泛化能力。在LIBERO等业界公认的机器人基准测试中,GO-2刷新了行业最优成绩,展示了其在未见过的任务上的零样本执行能力。

  • 目前,GO-2主要面向企业级客户,通过智元的Genie Studio具身智能开发平台提供API调用服务。具体的定价方案未在公开渠道披露,企业客户需联系智元销售团队获取定制化报价。 智元的商业模式主要包括三个层面:硬件销售(机器人本体、机械手等)、软件授权(基座大模型、开发平台)、数据服务(AGIBOT World数据集)。这种软硬一体化的商业模式,使智元能够为客户提供完整的具身智能解决方案。

  • 由于GO-2于2026年4月9日刚发布,目前公开渠道的用户评价和社区讨论相对有限。从技术评测和行业报道来看,业界对GO-2的创新技术给予高度认可。 技术突破获肯定:多家媒体和行业机构评价GO-2是具身智能领域的里程碑式产品。动作思维链和异步双系统架构被认为是解决机器人执行稳定性问题的有效方案。 性能表现亮眼:GO-2在多个机器人基准测试中刷新SOTA,展现了强大的任务泛化能力。这一成果为通用机器人的商业化应用奠定了技术基础。 生态建设受关注:智元同步推进的Genie Studio开发平台、AGIBOT World数据集等生态建设,为开发者提供了完整的工具链支持,受到技术社区的积极评价。

  • GO-2的发布对具身智能行业产生重要影响: 推动技术进步:动作思维链和异步双系统架构为行业提供了新的技术方向,其他机器人公司可能加速类似技术的研发。 加速商业落地:GO-2展示的高精度执行能力,使机器人在复杂场景中的应用更加可行,有助于推动通用机器人在工业、服务等领域的商业化进程。 竞争格局变化:智元作为国内具身智能领域的头部企业,GO-2的发布进一步巩固了其技术领先地位。在国际市场上,GO-2对标特斯拉Optimus、波士顿动力Atlas等产品,展现了中国企业的技术实力。

  • 技术成熟度:虽然GO-2在基准测试中表现优异,但从实验室到真实场景的大规模部署,仍需进一步验证其在复杂环境下的稳定性和可靠性。 商业化挑战:高端具身智能机器人的成本仍然较高,如何在保证性能的前提下实现成本可控,是商业化成功的关键因素。 伦理与安全:随着机器人执行能力的提升,其安全性和可控性越来越受到关注。需要建立完善的 safety 机制,确保机器人在各种场景下的安全运行。

  • GO-2适用于以下场景和用户群体: 目标用户:机器人研发企业、自动化解决方案提供商、科研机构、工业制造企业等。需要具备一定的技术能力,通过Genie Studio平台进行二次开发。 应用场景:工业装配、仓储物流、医疗护理、商业服务、危险环境作业等需要机器人执行复杂任务的领域。 使用建议:建议先通过智元提供的开发文档和示例代码了解模型能力,再结合具体业务需求进行适配。对于复杂场景,建议与智元技术团队深入沟通,获取定制化支持。

  • 智元GO-2具身基座大模型的发布,标志着中国在通用智能机器人领域取得重要突破。动作思维链和异步双系统架构创新性地解决了机器人“知行合一”的核心难题,为通用机器人的实用化落地提供了关键技术支撑。随着技术成熟和生态完善,GO-2有望推动具身智能在更多场景实现商业化应用,加速智能机器人时代的到来。

用户评论

  • 头像
    AFlores_Pro
    WAIC上居然聊出个「VLA已死」的争论,智元这边的思路是把动作思维链塞进VLA里,先做低频粗粒度的动作规划,再执行高频精细操作。到底哪条技术路线能赢,还得看谁先在真实场景里稳定赚钱。

  • 头像
    Victoria.Robinson_20206
    IT时报说最快两年迎来机器人的ChatGPT时刻,GO-2这类基座模型算是把地基打了,但两年这个数我持观望态度。

  • 头像
    叶宇杰
    看到说GO-2基座模型加GE-2世界模型撑起60台机器人跨场地做公共服务,对比亚马逊Proteus那种仓储专用机器人,国内这个玩法明显更激进,就看运营能撑多久。

  • 头像
    bigladybug981
    远征A3 Ultra成了WAIC唯一入选镇馆之宝的人形机器人,大脑层700TOPS处理器内置GO-2基座模型,华为系出来的团队是真能卷。

  • 头像
    Thomas.Garcia_2022
    WAIC智元展台GO-2驱动机器人在流水线上下料装盒,人太多根本挤不进去。

  • 头像
    LThompson520
    看了篇拆解智元路线图的长文才理清楚:GO-1是视觉语言加隐式动作的架构,语义和运动之间有鸿沟,机器人听得懂但做不稳;GO-2直接把规划迁移到动作空间,让机器人用动作思考而不是用语言思考。一年迭代一代基座模型,这个节奏比大部分做具身智能的公司都激进,就是不知道底层数据飞轮能不能跟上。

  • 头像
    Stephen_JamesJr
    G2这台机器的硬件底子确实厚,Jetson Thor 2070 TFLOPS算力、双臂力控能感知到0.5牛、130多项极限测试、双电池热插拔,模型和硬件是一起卷的,GO-2放在这种本体上才发挥得出来。

  • 头像
    Carolyn655
    那篇「有人不服但没人敢自己做一遍」说得挺到位,6天产线直播真正值钱的不是单项数字,是多机协同、治具共享、异常交接这些单机demo永远测不出来的东西。四个月前智元还只能证明一台机器人在一个工位能干活,现在是一整条质检工段跑起来,这个进步速度比绝对值更值得关注。

  • 头像
    trueIinaMaki_dev
    雪球上那篇泼冷水的也有道理,客户方高管原话定性精灵G2就是「AGV+机械臂+大脑」,轮式底盘套个人形外壳。GO-2模型本身可能真不错,但宣传上包装成人形机器人进厂革命就有点过了,工业里轮式复合机器人早就普及多年。

  • 头像
    EvanCook
    64小时直播干完17625台平板、64828个任务,号称99.99%成功率,节拍三个月从58秒压到22秒。不过智元业务总裁自己也承认还不是完全自主,仍然要跟产线工人和现有设备协作,这个坦诚比数字本身让我多信了几分。

  • 头像
    Carl_Hughes_2021015
    直播前三小时800多片平板零失误,一小时310件,19秒一个节拍,看着比刷剧还上头。

  • 头像
    DonnaKrause
    Figure之前是实验室里分拣包裹直播两百小时,智元直接把8台G2拉到龙旗真实产线上直播6天,早八晚七跟着工厂排班走,这个对比是挺狠的。

  • 头像
    DragonDropHall
    r/singularity刷到智元直播G2在真实平板工厂干活的帖子,评论区老外都在问是不是遥操作,直播这形式确实是自证清白的好办法。

  • 头像
    SSanders_2020506
    第15000台下线比破万那次快了不少,但量产提这么快,品控和交付能不能跟上是个问号。

  • 头像
    淡然868
    北京那个智慧康养驿站的按摩艾灸机器人据说日均排满,家政场景也开始跟人类保洁分工了,说实话这种生活场景比工厂故事更打动我。

  • 头像
    HAlvarezQ
    头条那篇冷思考提的问题到现在没人正面回应过:龙旗是智元B轮股东,均胜又是采购方又是供应商还合资开公司,两笔数亿订单严格说都算关联交易;重复定位精度、故障率这些关键工业数据一个没公布。发那科的力控装配能做到4微米间隙,GO-2的宣传里只讲学习速度不讲精度,要真想当全球标杆,这些坎绕不过去。

  • 头像
    Sara_Baker520
    又是SOTA又是知行合一,官方词儿一套一套的,落地见真章吧。

  • 头像
    Susan.Morgan_Pro
    场景标定最快15分钟、产线换型重训不超过4小时,对制造业客户来说这两个数字比什么基准测试SOTA都有说服力,换型慢才是产线最怕的事。

  • 头像
    Sharon_Richardson_99
    新皮层那篇采访信息量大,彭志辉说GO-2的目标就是把任务执行成功率做到足够高。GO-1解决的是数据从哪来,GO-2解决的是数据有了执行还出错——细微物理偏差、产线位姿变化、随机扰动都会放大误差。从实验室问题转向真实场景问题,这个研发重心的转移是部署一年踩坑踩出来的。

  • 头像
    SIjen
    训练效率10倍、数据需求降一半,这俩数字要是真的就厉害了。

  • 头像
    阎娜磊
    龙旗产线上精灵G2从传送带抓平板放测试治具,节拍最快12.97秒,宁波均胜那边三销定位柔性装配成功率超99%,这些是拿真金白银验证过的场景,比发布会PPT实在。

  • 头像
    曹明静
    动作思维链被CVPR 2026接收,异步双系统被ACL 2026接收,具身智能公司里学术含金量算高的了。

  • 头像
    BPowellII_940
    异步双系统那个比喻很好懂:慢系统是导航,1到5Hz出宏观路线;快系统是司机,100Hz以上盯实时路况微调。训练时还故意给导航加噪声,逼司机学会在指引不完美时把车开稳,这个带噪声的Teacher Forcing设计挺妙。

  • 头像
    Juan manuelHidalgo
    看了智元GO-2的发布会视频,动作思维链这个设计思路确实很超前,机器人不再是「边看边做」而是先「想清楚」再执行,语义鸿沟这个难题算是被他们找到了突破口。

  • 头像
    DEedw
    认真看完GO-2的发布材料,动作思维链就是让机器人像运动员投篮前先在脑内预演弧线和力度,先想清楚再动手。LIBERO四类任务平均成功率98.5%,加了光照相机扰动的LIBERO-Plus零样本86.6%,纯仿真数据训练拉到真机还有82.9%,比π0.5的77.5%高一截。语义到运动这条鸿沟真要被填平了,机器人才算从看懂世界走到动手改世界。

  • 头像
    Jose.BellSr
    刚看完GO-2的技术解读,简单说就是让机器人在执行任务前先生成一个动作规划序列,这个思路很像人类做事前先规划步骤,不得不说稚晖君团队确实有东西。

  • 头像
    Michael.Carter_2020
    智元这波操作可以的,GO-2在LIBERO基准上刷新了SOTA,之前还觉得具身智能离实用很远,现在看来下半年就能看到商用机器人落地了。

  • 头像
    Sarah_King_2024
    作为一个持续关注具身智能的开发者,GO-2的异步双系统架构让我眼前一亮,边想边做这个能力实现起来真的不容易,智元算是给行业趟出一条路了。

  • 头像
    VHughesII
    智元机器人2023年才成立,三年就做到全球首个量产5000台的具身机器人企业,这个速度真的离谱,GO-2看来是要继续放大招。

  • 头像
    彭星
    感觉GO-2最核心的突破还是统一架构,把逻辑推理和运动控制放在一个模型里处理,这比之前的分离式方案效率高很多,期待上手体验。