智源 RoboBrain Orca 世界模型

智源研究院推出的多模態表徵世界模型,先學統一世界潛在表徵再讀出文字、影象與機器人動作

深度報告

  • 智源研究院悟界·RoboBrain Orca Team 於 2026 年 6 月釋出技術報告「Orca: The World is in Your Mind」,提出一條不同於主流「下一個詞 / 下一幀 / 下一步動作預測」的世界模型路線:讓模型先在內部學出一個統一的「世界潛在表徵空間」,再從中讀出文字、影象與機器人動作三種能力。它的核心理念被概括為「The World is in Your Mind」——先理解世界狀態如何變化,再做理解、預測與行動。當前已開放 Orca-4B 權重與評測程式碼,整體仍屬早期探索版本。

  • 悟界·RoboBrain Orca 由北京智源人工智慧研究院(BAAI)的悟界·RoboBrain Orca Team 研發,是「悟界(WuJie)」系列在 2026 智源大會上與悟界·Physis-v0.1 一同亮相的成果。智源是國內最早系統性佈局世界模型的機構:2024 年提出「世界模型是下一代大模型技術」的判斷,先後釋出悟界·Emu3、Emu3.5 等原生多模態世界模型;院長王仲遠在 2026 年 6 月接受介面新聞專訪時直言,智源已不再做純語言模型科研,未來重心是「世界基座模型」。Orca 即這條路線下的一個具體例項化。 需要釐清的是,Orca 與同屬「RoboBrain」名下的 RoboBrain 1.0(2025,CVPR 2025 錄用,具身大腦)、RoboBrain 2.0(7B / 32B,2025,統一感知-推理-規劃的具身推理模型)並非同一類產物。RoboBrain 1.0 / 2.0 是面向機器人操作的「具身大腦 / VLA」模型,而 Orca 是更底層的「世界基礎模型」——它不急於讓模型進廠執行某個動作,而是先教會模型世界本身如何變化。

  • Orca 把世界學習定義為「潛在世界狀態建模」:給定來自視覺、語言、事件乃至力覺、觸覺等多模態訊號 X,模型將其對映到統一的世界狀態 S=fθ(X),再建模狀態隨時間的轉移 St+Δ ~ p(St+Δ | St, zt, ct),其中 zt 捕捉隱式動力學、ct 指定顯式條件、Δ 決定是預測未來還是回溯過去。 為學到這個表徵,Orca 設計了互補的兩條學習路徑。無意識學習模仿嬰幼兒觀察自然的方式,從約 12.5 萬小時連續真實世界影片中吸收物體運動、遮擋關係、接觸變化等密集而自然的狀態轉移,無需任何動作標籤。有意識學習則藉助約 1.6 億條事件標註與約 1150 萬條 VQA 資料,把連續變化組織成語義事件,學習「洗菜之後才會切菜」「手接觸後物體位置改變」這類帶因果的狀態轉移,並保留與人類意圖的語言介面。 預訓練完成後,骨幹網路(backbone)被凍結,僅在後面接輕量的模態讀出模組,就能從同一個潛在表徵中讀出三類能力:文字讀出擅長狀態轉移與動態運動推理;影象讀出根據當前畫面和指令預測真實互動後的未來狀態,強調物理一致性而非畫面美觀;動作讀出在預訓練中完全沒用過帶動作標籤的機器人軌跡,卻在下游僅用每個任務 200 條域內軌跡後訓練一個從零訓練的 DiT 風格 Action Expert,就讓雙臂機器人獲得明顯增益。團隊強調,正是「凍結主幹、輕量讀出」的實驗設計,才有力地證明真正起作用的是學到的世界表徵,而非下游模組重新學了一遍任務。

  • Orca 目前沒有公佈任何商業 API 價格或免費額度,定位以科研與開發者測試為主。開源資源包括:專案主頁 orca-wm.github.io、GitHub 倉庫 orca-wm/Orca、Hugging Face 上的 BAAI/Orca-4B 檢查點,以及 arXiv:2606.30534 技術報告。當前已開放 Orca-4B 權重與影象 / 文字生成評測程式碼,Orca-0.8B 也已在路線圖中。它面向的不是直接的付費 SaaS 使用者,而是機器人廠商、具身智慧研究團隊與數字孿生開發者。

  • Orca 釋出後在海外研究社群引發持續討論,登上 Hugging Face Daily Papers 月度榜單並一度居首,在 Hugging Face 與 X 上獲得大量關注。不少研究者認可其「文字、影象、影片、動作是同一真實世界的不同模態投影」這一核心思路,認為它更接近早期通用世界模型的形態。真實機器人動作讀出的結果尤其被看好:在雙臂操作的環境泛化與物體泛化(OOD)設定下,Orca 的 Rule-based 評分達 32.4、M25 達 55,明顯優於 V-JEPA 2.1(17.0 / 27)和 Qwen3.5(10.5 / 18),且展現出首次抓取失敗後繼續糾偏推進的「失敗恢復」能力,被視作對具身智慧最有想象力的部分。

  • 在文字讀出維度,Orca-4B 在綜合評測中取得 Overall 51.8、MVBench 65.3、TemporalBench 34.2、3DSRBench 52.1、SWITCH 55.6,在 4B 級小模型中領先同引數的 Qwen3.5 與 Gemma 4,優勢集中在狀態轉移、常識推理、動態運動與空間關係四個維度,其中狀態轉移相對 Qwen3.5 提升約 12.3%。影象讀出在真實互動預測基準 PRICE-V0.1 上,Orca-4B 取得 Avg 59.8±10.9,優於 FLUX.2、OmniGen2 等影象生成模型——後者常出現憑空插入物體、機器人本體消失等不符合物理過程的幻覺,而 Orca 更強調「未來狀態是否合理」。 智源基於自研 FlagScale 框架做了 FSDP2 升級、分塊交叉熵、前向後向預取等系統級重構,在 H100 叢集上將訓練吞吐從 StarVLA 基線的 0.66 提升到 2.91 Samples/Sec/GPU,實現約 4.4 倍加速。技術報告還展示了 scaling 行為:隨預訓練資料增加,0.8B 與 4B 模型的訓練損失持續下降、尚未飽和,下游三類讀出同步提升,說明這條世界學習路線仍有擴充套件空間。

  • Orca 團隊的自我定位相當剋制,明確承認當前限制:現版本主要依賴視覺與語言訊號,距離覆蓋觸覺、力覺、聲音、本體感受等物理模態尚有距離;世界狀態學習仍部分依託已有視覺編碼器與多模態表徵空間;模型規模與資料使用量仍處於早期階段;影象預測、動作泛化與世界模型評測體系都需要進一步完善。社群也存在路線層面的討論——「先學世界表徵再讀出動作」能否真正超越直接模仿動作的 VLA 正規化,還需更大規模資料與更多真實場景驗證,目前機器人測試僅集中於五類雙臂操作任務,工業機器人與自動駕駛等複雜環境的泛化尚未充分檢驗。

  • Orca 適合機器人廠商和具身智慧研究團隊作為通用世界表徵底座,用於降低新任務的動作資料採整合本、提升少樣本與跨場景泛化;也適合做互動式影片理解、物理狀態預測與數字孿生的科研探索。它並不適合希望「開箱即用、按呼叫付費」的普通開發者——當前權重與程式碼按科研路線逐步開放,未提供商業 API。若只是想要一個能直接操控機械臂的成品大腦,RoboBrain 2.0 這類 VLA 模型可能更對路;若想研究「讓 AI 先理解世界如何變化」這條更基礎的路線,Orca 是當下最具代表性的開源樣本之一。

  • Orca 的價值不在於宣稱「世界模型已完成」,而在於提出了一條值得繼續擴充套件的方向:智慧系統能否先學習統一的世界狀態,再把它讀出為理解、預測與行動。如果這條路線走通,它的意義將不限於機器人,而可能延伸到物理系統、生命過程與科學實驗等一切包含狀態、干預與轉移的真實世界建模任務。AI 的下一步,也許不是更快地輸出答案,而是先在內部建起一個足夠穩定、可預測、可遷移的世界。

使用者評論

  • 頭像
    Shirley.Clark_99
    這條路要是走通,意義就不只是機器人了。

  • 頭像
    GCox_Pro
    HF 月榜第一,這波智源是真支稜起來了。

  • 頭像
    PamelaWhite_2024
    凍結主幹只訓輕量讀出這個實驗設計很聰明,能直接證明學到的是世界表徵而不是下游重新學了一遍。

  • 頭像
    邵博貞
    世界模型終於從「畫得漂亮」轉向「預測得合理」了。

  • 頭像
    Terry.GonzalezSr7
    動作讀出最讓我意外的是預訓練根本沒用動作標籤,下游每個任務只給了 200 條軌跡就超過 V-JEPA 和 Qwen3.5。說明它真不是記住動作對映,而是先理解了世界狀態變化。不過現在只測了五類雙臂任務,離真實工廠和自動駕駛還遠。

  • 頭像
    Sandra_Parker52023
    仔細看了 PRICE 的對比,Orca 影象讀出最大的不同是它不會憑空插物體、不會讓機械臂本體消失,而是老老實實預測互動後的物理狀態。傳統 FLUX 這類生成模型畫面再美,一旦涉及真實互動就滿屏幻覺,這點上 Orca 思路是對的。

  • 頭像
    Jeffrey.Phillips_X3
    王仲遠那篇訪談說智源已經不做純語言模型科研了,重心全在世界基座模型,看 Orca 和 Physis 的排布確實是動真格的。

  • 頭像
    逍遙_17
    12.5 萬小時影片加 1.6 億事件標註,這資料體量確實捨得下本。

  • 頭像
    Roger.Wood_7
    把「感知」和「認知」拆兩條互補路徑這個拆解我挺認同。無意識學習靠海量影片學自然動力學,有意識學習靠事件標註學因果,兩條腿走路比單押一個老師模型穩。不過說這是通用世界模型的門把手可能還早,畢竟現在主要還是視覺和語言訊號。

  • 頭像
    Dennis.RodriguezZ
    4.4 倍訓練加速,FlagScale 這套系統工程是真能打。

  • 頭像
    JeanWilliamsIII
    開源了 Orca-4B 權重,智源這波格局可以。

  • 頭像
    Raymond_Allen_99
    跟 V-JEPA 2.1 比,Orca 在狀態轉移理解上優勢明顯,文字讀出 Overall 51.8 在 4B 級裡確實能打。

  • 頭像
    PhillipGarcia1689
    「別讓 AI 一上來就進廠打螺絲」這個比喻很到位。現在大部分 VLA 都是直接模仿動作,等於讓三歲小孩進工廠擰十萬小時螺絲。Orca 反過來先教世界怎麼變化再接動作,順序對了,但代價是這條路更慢、更需要資料,短期難見產品。

  • 頭像
    EChavez_2024
    社群裡也有潑冷水的,說「感知認知分兩條路」十年前就有人講,換個世界模型名字重新包裝。我覺得也不能全信,但真實複雜場景泛化確實還沒驗證。

  • 頭像
    RuthCook75
    Orca-0.8B 還沒全開放,蹲一個權重。

  • 頭像
    smallmouse655
    失敗恢復能力挺關鍵,第一次抓取失敗後還能根據當前狀態繼續糾偏,不像只會記動作對映的模型一失敗就卡死。