螞蟻靈波 具身模型

螞蟻集團旗下具身智慧公司,專注打造跨本體、跨場景的機器人大腦,釋出業界首個具身原生世界動作模型

深度報告

  • 螞蟻靈波是螞蟻集團於 2024 年 12 月成立的全資子公司,專攻具身智慧領域,定位為「機器人的通用大腦供應商」,而非本體製造商。2026 年 7 月,螞蟻靈波在 WAIC 期間一週內連續釋出並開源六款具身大模型,提出「具身原生(Embodied Native)」技術路線——拒絕在現有大模型上做遷移微調,而是圍繞物理世界的因果規律從頭預訓練。其代表性模型 LingBot-VA 2.0 實現了單卡 150Hz 實時推理,已在國大藥房上海門店投入實際運營。螞蟻集團透過子公司自研、合資公司(與智元機器人)和股權投資(覆蓋 12 家機器人公司)三層佈局,在具身智慧賽道上形成了獨特的「輕本體、重大腦」戰略。

  • 螞蟻靈波的誕生,始於螞蟻集團內部對 AI 戰略的一次深層拆解。螞蟻集團將 AGI 目標分為兩個層面:數字智慧和物理智慧。數字智慧由百靈大模型、AI 支付寶、螞蟻阿福等業務承載;物理智慧的核心執行主體,就是螞蟻靈波。 2024 年 12 月,螞蟻靈波在上海張江註冊成立,註冊資本 1 億元,由螞蟻科技集團股份有限公司全資持股。CEO 朱興 2011 年加入阿里巴巴,在支付、金融服務、O2O 等領域有超過 14 年的經驗,2023 年剛完成支付寶廣告商業化的從 0 到 1,2024 年底被抽調籌建螞蟻靈波。首席科學家沈宇軍來自螞蟻技術研究院互動智慧實驗室,本科學位來自清華大學電子工程系,博士畢業於香港中文大學資訊工程系,曾在商湯實習、位元組跳動任高階研究員。 目前螞蟻靈波團隊規模約 200 餘人,碩博技術人才佔比超過九成。在螞蟻集團內部,靈波掛在 CTO 線下,與百靈大模型團隊、支付寶 AI 團隊平行。

  • 螞蟻靈波構建了一套從感知到執行的完整技術棧,2026 年 7 月在一週內連續釋出了六款模型,覆蓋六大方向: LingBot-Vision(視覺基礎模型,1B 引數):採用邊界中心的自監督 ViT 架構,在 NYU-Depth v2 上 RMSE 領先 Meta DINOv3,僅用三分之一資料量即超越後者。 LingBot-Depth 2.0(空間感知模型):訓練資料從 300 萬擴充套件到 1.5 億樣本,在 16 個深度補全基準中 12 項排名第一,RMSE 從 0.132 降至 0.062。 LingBot-VLA 2.0(視覺-語言-動作模型,6B 引數):預訓練資料總量達 6 萬小時(來自 5 萬小時真實機器人資料 + 1 萬小時人類運算元據),已適配 17 家廠商的 20 種機器人構型(單臂、雙臂、雙足、輪式等)。在 GM-100 評測中,總體平均任務進度分和成功率均領先於 π0.5 與 GR00T N1.7。 LingBot-World 2.0 / World-Infinity(實時互動世界模型,14B/1.3B 引數化版本):支援小時級無限生成無視覺漂移,720p/60fps 實時輸出,業界首次引入 Agent 機制,已全部開源。 LingBot-VA 2.0(具身原生世界動作模型):這是本次釋出的旗艦模型。它不沿用「影片生成模型微調」的行業主流路線,而是基於自迴歸架構從頭開始預訓練。核心設計包括:語義視覺-動作分詞器(在視覺壓縮中融入語義與動作資訊對齊)、嚴格的因果預訓練正規化、MoE 架構(混合專家模型)、增強非同步推理機制(執行動作同時預測未來狀態)。該模型實現了單卡 150Hz 實時推理效率,即每秒完成 150 次推理,單次響應約 6.7 毫秒。 LingBot-Video(影片生成基礎模型):全球首個基於 MoE 架構、面向具身智慧的開源影片生成基模。 在實際應用層面,螞蟻靈波已與國大藥房合作,在上海門店落地機器人智慧藥房方案。三臺不同構型的機器人在 LingBot-VLA 2.0 驅動下自主分工,完成從接單、取貨到交付的全流程閉環,該方案入選了 2026 年 WAIC 十大「鎮館之寶」。 硬體方面,螞蟻靈波於 2025 年 9 月推出了首款服務機器人 Robbyant R1,定位家庭、養老、醫療健康等服務場景,已在上海歷史博物館等場所投入使用。R1 的關節模組來自鈦虎機器人,底盤來自銀河通用——兩家螞蟻投資的企業。目前 R1 仍主要在受控環境中測試,尚未向零售客戶銷售。

  • 螞蟻靈波的核心商業模式可以概括為「賣大腦,不賣身體」。公司不走硬體製造路線,而是透過開源加開放模型生態,構建具身智慧的「公共底座」。 其商業模式的具體支點包括: 一是開源建生態。六款模型全部開源(權重、程式碼、後訓練工具鏈、評測集全部放出),透過開源吸引全球開發者和機器人廠商接入,形成以靈波模型為核心的開發者生態。目前已有十幾家機器人廠商與靈波建立合作。 二是場景化收費。雖未公佈具體定價,但藥房、零售分揀、物流分揀等落地場景的商業模式已開始驗證。螞蟻靈波與國大藥房、隆盛等生態客戶夥伴合作,在不改造門店的前提下提供「大腦」服務。 三是資料生態共建。螞蟻靈波與簡智機器人達成戰略合作,聯合研發專屬數採裝置。樂聚機器人作為核心資料合作伙伴,為 LingBot-VLA 提供了近 1 萬小時的高質量多模態真實機器人資料。 螞蟻集團的整體佈局不止於靈波自身:透過子公司自研(Robbyant)、合資公司(與智元機器人合資成立的「杭州傳智未來科技有限公司」,註冊資本 2000 萬元)、以及 18 個月內投資 12 家機器人公司(最新一筆領投智元機器人 5 億元融資輪),構建了多層次、分散風險的戰略格局。

  • 螞蟻靈波的技術路線在開發者和行業從業者中引起了明顯分化。有合作廠商表示,「靈波的模型給了我們一個新的選擇,不用從頭造大腦」。樂聚機器人官方宣佈旗下 KUAVO 4 Pro(夸父)已完成 LingBot-VLA 的後訓練適配,並在 95 個真實操作場景做了系統性測評。 但也有機器人行業從業者提出質疑。「推理頻率只是工程指標之一,真正的考驗是在真實場景中的泛化能力。在模擬環境裡跑 150Hz 和在有老人、小孩、寵物的家庭環境裡跑 150Hz,是兩回事」。 關於 R1 機器人,使用者反饋仍處於早期階段,目前主要在博物館導覽、藥房等場景使用,尚未有大規模消費者體驗報告。部分參觀過 WAIC 的觀眾表示,靈波的乒乓球對打演示「令人印象深刻,機器人反應速度確實快」,但也有人認為「演示環境和真實家庭場景差距巨大」。

  • 螞蟻靈波在行業媒體和資本市場獲得了較高的關注度。 極客公園評價:「螞蟻靈波在 GM-100 評測中效能綜合領先,展現出更強的雙臂協同操作能力和跨本體、多工泛化能力」。 36氪的深度分析認為,「具身原生代表了一條不同於行業主流的技術路徑,切入了一個長期被忽視的底層問題——機器人是否應該有一套屬於自己的模型設計正規化」。 AI Dev Signals 將螞蟻靈波列為 Physical AI 領域全球排名第二(僅次於英偉達),評價其為「該領域最激進的開源推動者」。 競品格局方面,螞蟻靈波的「輕本體、重大腦」路線與 Figure、Tesla 的垂直整合路線形成鮮明對比。高盛在研報中對人形機器人的商業化程序持謹慎態度,認為技術拐點仍不明朗,預計到 2027 年全球人形機器人出貨量約 7.6 萬臺,到 2032 年約 50.2 萬臺,步伐慢於市場預期。

  • 螞蟻靈波面臨的挑戰同樣清晰。 最大的不確定性來自技術路線本身。「具身原生」從零預訓練的路徑意味著更高的研發投入和更長的驗證週期。相比遷移微調路線「幾個月出成果」的節奏,靈波的路線需要更長時間才能證明其泛化能力的優勢——如果最終效果沒有顯著超越遷移方案,高昂的投入將難以持續。 資料瓶頸是更現實的困難。具身智慧行業面臨一個根本性問題:真實世界資料與語言資料存在幾萬到幾百萬倍的差距。靈波的資料來源主要依賴生態夥伴供給,自身不造大量本體。但問題在於——宇樹科技剛剛推出了自己的具身大模型 UnifoLM-OminiA-0.3,智元機器人也有自己的世界模型和資料平臺。一旦這些本體廠商開始認真自研大腦,資料供給隨時可能收緊。開源雖然是建立生態的策略,但它本身不構成護城河。 在螞蟻集團內部,靈波需要與百靈大模型團隊、支付寶 AI 團隊爭奪資源。在螞蟻集團外部,僅阿里系內部就有多個具身智慧條線「各自為戰」,包括千問 Qwen-Robot、高德世界模型,尚未形成統一的戰略協同。R1 機器人的出貨量也較為有限,目前更接近「驗證模型的載體」,距離大規模量產尚有距離。

  • 螞蟻靈波的產品目前主要面向兩類受眾:一是機器人本體廠商,可以透過接入靈波的通用大腦,減少在演算法層面的重複投入,尤其適合中小型機器人公司。二是特定服務場景的運營方,如藥房、養老機構、博物館等,可以透過螞蟻靈波的方案快速部署具備自主決策能力的機器人。 對於普通消費者來說,螞蟻靈波的產品仍處於早期階段,R1 機器人的購買渠道和正式定價尚未公開,暫時不推薦個人消費者入手。 如果希望尋找替代方案,宇樹科技的人形機器人 G1(售價約 16,000 美元)和 H1(約 90,000 美元)在硬體價效比上有明顯優勢,但在「大腦」層面需要自建演算法能力。

  • 螞蟻靈波代表了螞蟻集團在 AI 戰略上的一個重要落子——從數字世界走向物理世界。它的「具身原生」技術路線是一次大膽的嘗試,如果成功,可能重新定義機器人大腦的開發正規化;如果驗證不暢,高昂的研發投入和開源生態的「無護城河」困境將成為隱憂。無論如何,螞蟻靈波的打法在國內大廠中獨樹一幟,它回答的不是「怎麼做出一款更好的機器人」,而是「機器人的智慧應該從哪來」這個更底層的問題。

使用者評論

  • 頭像
    CelestiaSky360
    WAIC 現場看了螞蟻靈波的智慧藥房 demo,三臺不同機器人協作取藥,全程不需要人工干預,現場效果確實震撼。國大藥房已經在用了,不是實驗室產品,這點很關鍵。

  • 頭像
    Sarah.Murray5209
    靈波的 LingBot-VLA 2.0 開源了,6 萬小時真機資料預訓練,支援 20 多種機器人構型。這資料量目前開源界應該沒有對手,連 Physical Intelligence 的 π0.5 都被超了。

  • 頭像
    BenjaminGonzalez_7
    說實話,靈波開源這個策略挺聰明的。現在技術路線還沒定死,誰先建生態誰就有話語權。就是不知道變現路徑怎麼走,畢竟賣模型和賣硬體是兩回事。

  • 頭像
    ABrown007
    150Hz 實時推理,單卡就能跑,這效率確實能打。不過看技術文件,他們說的「具身原生」到底和微調路線差多少,還得看實際部署效果。

  • 頭像
    Betty.MoralesZ663
    關注螞蟻靈波有一段時間了。CEO 朱興之前是做支付寶商業化的,沒有機器人背景,反而選了最難的從零預訓練路線。這個團隊的技術判斷力確實值得關注。

  • 頭像
    AJohnson_8893
    在模擬環境裡跑 150Hz 和在家裡跑是兩回事,家裡有老人小孩寵物,環境不確定性太大。靈波現在藥房場景還行,但離走進家庭還有距離。

  • 頭像
    GP_wal
    看了 WAIC 的乒乓球對打演示,機器人反應速度確實快,球剛彈起來它就已經在預判落點了。沒有外接高速相機,純靠本體視覺,這點挺牛。

  • 頭像
    SCwar
    螞蟻靈波的路線和宇樹科技完全不同,一個做大腦一個做身體,其實並不直接競爭。問題是靈波的資料靠本體廠商供給,哪天宇樹或智元自己把大腦做起來了,資料來源就斷了。

  • 頭像
    Anthony.Howard
    六款模型一週內全部開源,這魄力確實少見。深度學習框架到訓練工具鏈全放出來了,開發者社群反響也不錯。不過開源本身不構成護城河,技術迭代速度才是。

  • 頭像
    SHill_Plus68
    R1 機器人在上海歷史博物館當導遊那個影片看過,走路還算穩,互動也還行。但 1 億註冊資本做機器人,和特斯拉、Figure 這種幾十億美金融資的比,體量差太多。

  • 頭像
    CherylKim_2021
    有個做機器人的朋友說他們正在適配靈波的 LingBot-VLA,原來他們的機器人要走專門的演算法團隊,現在直接接靈波的大腦就能動了。對小公司來說省了一大筆錢。

  • 頭像
    JBailey_Plus7
    本質上是螞蟻集團為線下場景做的技術儲備。支付、醫療、信用這些業務早就滲透到線下了,機器人是自然延伸。不是跨界,是主業的延伸。

  • 頭像
    BreadBud513
    LingBot-Depth 2.0 在透明物體識別上進步很大,香檳杯那種以前深度相機完全搞不定的東西,現在能補全出完整輪廓了。這對抓取任務太關鍵了。

  • 頭像
    趙華_1
    一堆人吹捧具身智慧,但我看了靈波的資料後意識到這個賽道比想象中難得多。真實世界資料和語言資料有幾百萬倍的差距,光解決資料問題就要燒很多年錢。

  • 頭像
    SusanEdwards
    靈波這個團隊碩博佔比超過九成,首席科學家沈宇軍是清華本科港中文博士,之前做計算機視覺的。技術底子確實厚,但 200 人的團隊和 Google DeepMind 比還是太小了。

  • 頭像
    琉璃_23
    高盛的報告看過了,對機器人商業化很謹慎,說到 2027 年全球才 7.6 萬臺出貨量。螞蟻現在砸錢做靈波,短期看不到回報,但長期來看如果不提前佈局就會被甩開。

  • 頭像
    EHall520
    LingBot-Video 居然是 MoE 架構的,30B 引數推理時只啟用 3B,這個設計挺巧妙。專門給具身智慧訓練用的影片模型,和 Sora 那種內容生成路線完全不同。

  • 頭像
    Sandra156
    剛看完靈波的釋出會,VA 2.0 從零預訓練不微調已有模型,這個思路真的需要勇氣。但是結果是好的,夾薯片不碎那個演示太有說服力了。

  • 頭像
    Brenda.Ross_Plus
    螞蟻在機器人賽道投了十幾家公司了,宇樹、星海圖、靈心巧手都有參股。靈波自己不做本體,而是做大腦供應商,這個定位在國產大廠裡確實是獨一份。

  • 頭像
    dm0feb8
    看了一圈 WAIC 的具身智慧展區,靈波的展臺人最多。不改造門店直接上崗這個賣點確實抓人,現在很多藥房和商超就是想引入機器人但又不想改造空間。