智源 RoboBrain Orca 世界模型

智源研究院推出的多模态表征世界模型,先学统一世界潜在表征再读出文本、图像与机器人动作

深度报告

  • 智源研究院悟界·RoboBrain Orca Team 于 2026 年 6 月发布技术报告「Orca: The World is in Your Mind」,提出一条不同于主流「下一个词 / 下一帧 / 下一步动作预测」的世界模型路线:让模型先在内部学出一个统一的「世界潜在表征空间」,再从中读出文本、图像与机器人动作三种能力。它的核心理念被概括为「The World is in Your Mind」——先理解世界状态如何变化,再做理解、预测与行动。当前已开放 Orca-4B 权重与评测代码,整体仍属早期探索版本。

  • 悟界·RoboBrain Orca 由北京智源人工智能研究院(BAAI)的悟界·RoboBrain Orca Team 研发,是「悟界(WuJie)」系列在 2026 智源大会上与悟界·Physis-v0.1 一同亮相的成果。智源是国内最早系统性布局世界模型的机构:2024 年提出「世界模型是下一代大模型技术」的判断,先后发布悟界·Emu3、Emu3.5 等原生多模态世界模型;院长王仲远在 2026 年 6 月接受界面新闻专访时直言,智源已不再做纯语言模型科研,未来重心是「世界基座模型」。Orca 即这条路线下的一个具体实例化。 需要厘清的是,Orca 与同属「RoboBrain」名下的 RoboBrain 1.0(2025,CVPR 2025 录用,具身大脑)、RoboBrain 2.0(7B / 32B,2025,统一感知-推理-规划的具身推理模型)并非同一类产物。RoboBrain 1.0 / 2.0 是面向机器人操作的「具身大脑 / VLA」模型,而 Orca 是更底层的「世界基础模型」——它不急于让模型进厂执行某个动作,而是先教会模型世界本身如何变化。

  • Orca 把世界学习定义为「潜在世界状态建模」:给定来自视觉、语言、事件乃至力觉、触觉等多模态信号 X,模型将其映射到统一的世界状态 S=fθ(X),再建模状态随时间的转移 St+Δ ~ p(St+Δ | St, zt, ct),其中 zt 捕捉隐式动力学、ct 指定显式条件、Δ 决定是预测未来还是回溯过去。 为学到这个表征,Orca 设计了互补的两条学习路径。无意识学习模仿婴幼儿观察自然的方式,从约 12.5 万小时连续真实世界视频中吸收物体运动、遮挡关系、接触变化等密集而自然的状态转移,无需任何动作标签。有意识学习则借助约 1.6 亿条事件标注与约 1150 万条 VQA 数据,把连续变化组织成语义事件,学习「洗菜之后才会切菜」「手接触后物体位置改变」这类带因果的状态转移,并保留与人类意图的语言接口。 预训练完成后,骨干网络(backbone)被冻结,仅在后面接轻量的模态读出模块,就能从同一个潜在表征中读出三类能力:文本读出擅长状态转移与动态运动推理;图像读出根据当前画面和指令预测真实交互后的未来状态,强调物理一致性而非画面美观;动作读出在预训练中完全没用过带动作标签的机器人轨迹,却在下游仅用每个任务 200 条域内轨迹后训练一个从零训练的 DiT 风格 Action Expert,就让双臂机器人获得明显增益。团队强调,正是「冻结主干、轻量读出」的实验设计,才有力地证明真正起作用的是学到的世界表征,而非下游模块重新学了一遍任务。

  • Orca 目前没有公布任何商业 API 价格或免费额度,定位以科研与开发者测试为主。开源资源包括:项目主页 orca-wm.github.io、GitHub 仓库 orca-wm/Orca、Hugging Face 上的 BAAI/Orca-4B 检查点,以及 arXiv:2606.30534 技术报告。当前已开放 Orca-4B 权重与图像 / 文本生成评测代码,Orca-0.8B 也已在路线图中。它面向的不是直接的付费 SaaS 用户,而是机器人厂商、具身智能研究团队与数字孪生开发者。

  • Orca 发布后在海外研究社区引发持续讨论,登上 Hugging Face Daily Papers 月度榜单并一度居首,在 Hugging Face 与 X 上获得大量关注。不少研究者认可其「文本、图像、视频、动作是同一真实世界的不同模态投影」这一核心思路,认为它更接近早期通用世界模型的形态。真实机器人动作读出的结果尤其被看好:在双臂操作的环境泛化与物体泛化(OOD)设定下,Orca 的 Rule-based 评分达 32.4、M25 达 55,明显优于 V-JEPA 2.1(17.0 / 27)和 Qwen3.5(10.5 / 18),且展现出首次抓取失败后继续纠偏推进的「失败恢复」能力,被视作对具身智能最有想象力的部分。

  • 在文本读出维度,Orca-4B 在综合评测中取得 Overall 51.8、MVBench 65.3、TemporalBench 34.2、3DSRBench 52.1、SWITCH 55.6,在 4B 级小模型中领先同参数的 Qwen3.5 与 Gemma 4,优势集中在状态转移、常识推理、动态运动与空间关系四个维度,其中状态转移相对 Qwen3.5 提升约 12.3%。图像读出在真实交互预测基准 PRICE-V0.1 上,Orca-4B 取得 Avg 59.8±10.9,优于 FLUX.2、OmniGen2 等图像生成模型——后者常出现凭空插入物体、机器人本体消失等不符合物理过程的幻觉,而 Orca 更强调「未来状态是否合理」。 智源基于自研 FlagScale 框架做了 FSDP2 升级、分块交叉熵、前向后向预取等系统级重构,在 H100 集群上将训练吞吐从 StarVLA 基线的 0.66 提升到 2.91 Samples/Sec/GPU,实现约 4.4 倍加速。技术报告还展示了 scaling 行为:随预训练数据增加,0.8B 与 4B 模型的训练损失持续下降、尚未饱和,下游三类读出同步提升,说明这条世界学习路线仍有扩展空间。

  • Orca 团队的自我定位相当克制,明确承认当前限制:现版本主要依赖视觉与语言信号,距离覆盖触觉、力觉、声音、本体感受等物理模态尚有距离;世界状态学习仍部分依托已有视觉编码器与多模态表征空间;模型规模与数据使用量仍处于早期阶段;图像预测、动作泛化与世界模型评测体系都需要进一步完善。社区也存在路线层面的讨论——「先学世界表征再读出动作」能否真正超越直接模仿动作的 VLA 范式,还需更大规模数据与更多真实场景验证,目前机器人测试仅集中于五类双臂操作任务,工业机器人与自动驾驶等复杂环境的泛化尚未充分检验。

  • Orca 适合机器人厂商和具身智能研究团队作为通用世界表征底座,用于降低新任务的动作数据采集成本、提升少样本与跨场景泛化;也适合做交互式视频理解、物理状态预测与数字孪生的科研探索。它并不适合希望「开箱即用、按调用付费」的普通开发者——当前权重与代码按科研路线逐步开放,未提供商业 API。若只是想要一个能直接操控机械臂的成品大脑,RoboBrain 2.0 这类 VLA 模型可能更对路;若想研究「让 AI 先理解世界如何变化」这条更基础的路线,Orca 是当下最具代表性的开源样本之一。

  • Orca 的价值不在于宣称「世界模型已完成」,而在于提出了一条值得继续扩展的方向:智能系统能否先学习统一的世界状态,再把它读出为理解、预测与行动。如果这条路线走通,它的意义将不限于机器人,而可能延伸到物理系统、生命过程与科学实验等一切包含状态、干预与转移的真实世界建模任务。AI 的下一步,也许不是更快地输出答案,而是先在内部建起一个足够稳定、可预测、可迁移的世界。

用户评论

  • 头像
    Shirley.Clark_99
    这条路要是走通,意义就不只是机器人了。

  • 头像
    GCox_Pro
    HF 月榜第一,这波智源是真支棱起来了。

  • 头像
    PamelaWhite_2024
    冻结主干只训轻量读出这个实验设计很聪明,能直接证明学到的是世界表征而不是下游重新学了一遍。

  • 头像
    邵博贞
    世界模型终于从「画得漂亮」转向「预测得合理」了。

  • 头像
    Terry.GonzalezSr7
    动作读出最让我意外的是预训练根本没用动作标签,下游每个任务只给了 200 条轨迹就超过 V-JEPA 和 Qwen3.5。说明它真不是记住动作映射,而是先理解了世界状态变化。不过现在只测了五类双臂任务,离真实工厂和自动驾驶还远。

  • 头像
    Sandra_Parker52023
    仔细看了 PRICE 的对比,Orca 图像读出最大的不同是它不会凭空插物体、不会让机械臂本体消失,而是老老实实预测交互后的物理状态。传统 FLUX 这类生成模型画面再美,一旦涉及真实交互就满屏幻觉,这点上 Orca 思路是对的。

  • 头像
    Jeffrey.Phillips_X3
    王仲远那篇访谈说智源已经不做纯语言模型科研了,重心全在世界基座模型,看 Orca 和 Physis 的排布确实是动真格的。

  • 头像
    逍遥_17
    12.5 万小时视频加 1.6 亿事件标注,这数据体量确实舍得下本。

  • 头像
    Roger.Wood_7
    把「感知」和「认知」拆两条互补路径这个拆解我挺认同。无意识学习靠海量视频学自然动力学,有意识学习靠事件标注学因果,两条腿走路比单押一个老师模型稳。不过说这是通用世界模型的门把手可能还早,毕竟现在主要还是视觉和语言信号。

  • 头像
    Dennis.RodriguezZ
    4.4 倍训练加速,FlagScale 这套系统工程是真能打。

  • 头像
    JeanWilliamsIII
    开源了 Orca-4B 权重,智源这波格局可以。

  • 头像
    Raymond_Allen_99
    跟 V-JEPA 2.1 比,Orca 在状态转移理解上优势明显,文本读出 Overall 51.8 在 4B 级里确实能打。

  • 头像
    PhillipGarcia1689
    「别让 AI 一上来就进厂打螺丝」这个比喻很到位。现在大部分 VLA 都是直接模仿动作,等于让三岁小孩进工厂拧十万小时螺丝。Orca 反过来先教世界怎么变化再接动作,顺序对了,但代价是这条路更慢、更需要数据,短期难见产品。

  • 头像
    EChavez_2024
    社区里也有泼冷水的,说「感知认知分两条路」十年前就有人讲,换个世界模型名字重新包装。我觉得也不能全信,但真实复杂场景泛化确实还没验证。

  • 头像
    RuthCook75
    Orca-0.8B 还没全开放,蹲一个权重。

  • 头像
    smallmouse655
    失败恢复能力挺关键,第一次抓取失败后还能根据当前状态继续纠偏,不像只会记动作映射的模型一失败就卡死。