蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0

从数字世界到物理世界

2026-07-13 23:56

7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0。它的意义不止于又一则模型发布,更在于机器人基础模型正式从「基于数字世界模型构建」朝着「面向物理世界原生设计」转变——机器人「大脑」不再依托数字世界模型能力的「嫁接」,而是从动态建模、因果预测、实时执行等与环境交互的原始需求出发,做原生设计。

今年以来,世界模型与具身智能怎么融合一直是各方焦点。机器人面对的是连续变化的真实世界,既要对当前情况作出反应,还要理解一个动作会引发怎样的环境变化,并据此决定下一步动作。行业主流路线大多依托面向数字内容创作的视频生成模型,再微调适配机器人控制;但内容创作在意画质与创意,机器人控制更在意执行效率与预测合理性,出发点本就不同。

LingBot-VA 2.0选择直面问题,基于自回归架构从头开始预训练,通过四大核心设计构建原生基模 其一,引入语义视觉—动作分词器(Tokenizer)作为全新视觉编码器,在视觉压缩中加入语义与动作信息对齐,让「理解指令」更容易转化为「完成动作」;其二,采用严格因果预训练范式,从训练起就用自回归架构,确保视觉预测与动作生成完全遵循单向时间顺序。

其三是引入MoE架构,在不牺牲推理效率的前提下有效扩大模型容量,在性能与效率间取得平衡;其四是通过增强的异步推理机制实现实时闭环控制,在机器人执行动作的同时预测未来状态,并用最新真实观测不断校正下一步决策。基于这些设计,LingBot-VA 2.0交出单卡150Hz实时推理效率的答卷,正面回应了行业普遍面临的具身世界模型执行效率低的顽疾。

本周蚂蚁灵波已连续发布和开源多款模型,包括面向空间感知的LingBot-Vision与LingBot-Depth 2.0、面向「一脑多机」的LingBot-VLA 2.0、面向实时交互的LingBot-World 2.0,以及面向更高推理效率的视频生成基模LingBot-Video。LingBot-VA 2.0作为集大成者扮演了收官角色,也正式开启了「具身原生」新阶段。CEO朱兴表示,灵波将持续探索具身智能新上限,同时加速构建开放的技术与场景生态,助力机器人真正走向产业现场。