螞蟻靈波釋出業界首個具身原生世界動作模型LingBot-VA 2.0

從數字世界到物理世界

2026-07-13 23:56

7月10日,螞蟻靈波釋出業界首個具身原生世界動作模型LingBot-VA 2.0。它的意義不止於又一則模型釋出,更在於機器人基礎模型正式從「基於數字世界模型構建」朝著「面向物理世界原生設計」轉變——機器人「大腦」不再依託數字世界模型能力的「嫁接」,而是從動態建模、因果預測、實時執行等與環境互動的原始需求出發,做原生設計。

今年以來,世界模型與具身智慧怎麼融合一直是各方焦點。機器人面對的是連續變化的真實世界,既要對當前情況作出反應,還要理解一個動作會引發怎樣的環境變化,並據此決定下一步動作。行業主流路線大多依託面向數字內容創作的影片生成模型,再微調適配機器人控制;但內容創作在意畫質與創意,機器人控制更在意執行效率與預測合理性,出發點本就不同。

LingBot-VA 2.0選擇直面問題,基於自迴歸架構從頭開始預訓練,透過四大核心設計構建原生基模 其一,引入語義視覺—動作分詞器(Tokenizer)作為全新視覺編碼器,在視覺壓縮中加入語義與動作資訊對齊,讓「理解指令」更容易轉化為「完成動作」;其二,採用嚴格因果預訓練正規化,從訓練起就用自迴歸架構,確保視覺預測與動作生成完全遵循單向時間順序。

其三是引入MoE架構,在不犧牲推理效率的前提下有效擴大模型容量,在效能與效率間取得平衡;其四是透過增強的非同步推理機制實現實時閉環控制,在機器人執行動作的同時預測未來狀態,並用最新真實觀測不斷校正下一步決策。基於這些設計,LingBot-VA 2.0交出單卡150Hz實時推理效率的答卷,正面回應了行業普遍面臨的具身世界模型執行效率低的頑疾。

本週螞蟻靈波已連續釋出和開源多款模型,包括面向空間感知的LingBot-Vision與LingBot-Depth 2.0、面向「一腦多機」的LingBot-VLA 2.0、面向實時互動的LingBot-World 2.0,以及面向更高推理效率的影片生成基模LingBot-Video。LingBot-VA 2.0作為集大成者扮演了收官角色,也正式開啟了「具身原生」新階段。CEO朱興表示,靈波將持續探索具身智慧新上限,同時加速構建開放的技術與場景生態,助力機器人真正走向產業現場。