魔芯科技联合华为发布MoWorld世界模型,14B参数NPU实时50FPS

世界模型首次跑通国产全链路

2026-07-14 12:38
MoWorld 世界模型
MoWorld 世界模型

世界模型这条赛道,正在从「能生成视频」悄悄转向「能实时交互」。7月13日,中国初创魔芯科技联合华为、浙大潘云鹤团队发布的MoWorld,把这件事往前推了一步:这个14B参数的超高帧率交互式世界模型,在华为昇腾NPU上跑出了最高50 FPS的实时推理,推理成本还降了约70%。

先说世界模型是什么。简单讲,它不是单纯预测下一帧画面,而是让AI在内部构建一个「可推演的时空世界」——物体的位置、运动、因果关系都建模进去,这样它才能在被问到「如果我推开这个杯子会怎样」时,给出符合物理的连续反应。这正是机器人、自动驾驶、游戏智能体最渴求的能力:不是演给你看,而是真能「想清楚再动」。

MoWorld的突破点落在两个「首次」上。一是参数规模压到14B还能保持高帧率实时,说明模型结构对推理效率做了狠优化;二是在国产NPU上打通了训练-蒸馏-推理的全链路——蒸馏把大模型的能力「浓缩」进小模型,推理再跑在国产硬件上,整条链路不依赖英伟达。50 FPS意味着它已经接近人机实时交互的门槛,不再是离线渲染的demo。

成本降70%这个数字背后,是「国产芯+国产化流程」叠加的必然。过去这类大模型推理高度依赖A100/H100和对应的软件栈,算力和License成本都高;一旦能在昇腾上跑通,单卡成本和供给稳定性都不再是硬约束。

更接地气的一层是落地场景。50 FPS的实时交互,意味着它可以直接接进机器人仿真、工业数字孪生和车载感知里做「边看边想」的闭环,而不是等离线算完再回放。把世界模型从展示视频变成可嵌入的实时模块,正是这类工作最实在的价值。

把视线拉远,世界模型和具身智能其实是同一场仗的两面。机器人要真正进工厂、进家庭,缺的不是会聊天的脑,而是能在真实物理世界里实时决策、实时纠错的脑。MoWorld这类工作未必是终点,但它指明了一个方向:国产大模型的下半场,比的不只是谁参数大,更是谁能在自己的硬件上,把智能跑得又便宜又实时。