蚂蚁集团集中开源多款具身智能基础模型,全栈布局浮出水面
具身智能补全拼图
蚂蚁集团旗下的蚂蚁灵波科技,一口气集中发布并开源了多款具身智能基础模型,把视觉、空间、动作、世界模型全串了起来。这不再是单点技术秀,而是一张冲着「机器人真正能干活」去的全栈拼图。
具体看,这一波开源的模型包括视觉基础模型LingBot-Vision、空间感知模型LingBot-Depth2.0、具身基座模型LingBot-VLA2.0、实时交互世界模型LingBot-World2.0、视频生成模型LingBot-Video,以及具身原生世界动作模型LingBot-VA2.0。名字一长串,核心就一件事:让机器人既「看得见」、又「懂空间」、还能「动得对」。
为什么这事重要?因为具身智能的难点从来不是单点算法,而是把感知、决策、执行揉成一个能落地的闭环。过去大模型很能聊,但让它操控一个真实机械臂,往往就抓瞎。蚂蚁把从眼睛到手脚的模型打包开源,等于给开发者递了一套相对完整的「机器人操作系统底座」。
蚂蚁的选择也有现实考量。互联网流量见顶,巨头们都在找下一个载体,而机器人被认为是AI从屏幕走向物理世界的那扇门。蚂蚁在金融、生活服务积累的场景数据,如果未来能接上具身智能,理论上能长出一堆新业务——从仓储到巡检到客服现场。
开源则是另一层算计。具身智能还早,生态远未定型,谁先放出好用的底座、聚起开发者,谁就可能在标准上占先。蚂蚁用开源换生态位,是典型的平台打法。
说到底,这一波模型集中开源,信号比产品本身更值得读。它说明大厂的AI竞赛,已经从「卷对话」卷到了「卷身体」——谁能教会机器在真实世界里稳稳干活,谁就握住了下一阶段的船票。
值得强调的是,蚂蚁这步棋带着鲜明的全栈国产化底色。在外部算力受限、底层芯片不稳的大背景下,把从感知到动作的模型全部自研并开源,既是技术卡位,也是供应链安全的防御工事。机器人能不能跑起来是一回事,有没有不被卡脖子的底座是另一回事。
对创业公司来说,巨头开源既是机会也是压力——底座免费了,应用层的同质化竞争会更快到来。