苹果评估 PrismML:大模型压缩 15 倍塞进 iPhone

端侧 AI 要重估算力

2026-07-15 23:32

7月15日的AI日报里有一条容易被忽略的消息:苹果正评估一家叫PrismML的初创公司技术,据称能把大型AI模型(比如阿里的Qwen)大幅压缩,直接跑在iPhone 15及更新机型上,内存需求降低15倍,同时提升运行速度和能效。

端侧AI的瓶颈从来不是「想不想跑」,而是「跑不跑得动」。大模型动辄几十亿参数,塞进手机要占掉惊人的内存和算力,所以今天绝大多数AI体验还是云端推理、手机只做展示。PrismML这类压缩技术的价值,在于把模型体积和内存占用砍掉一个数量级,让端侧设备真的能独立完成推理。对手机厂商来说,本地推理意味着差异化卖点,谁能先把大模型跑顺,谁就多一张旗舰机的牌。

如果15倍压缩属实,它对「算力需求」这堂课是颠覆性的。 过去两年英伟达的狂飙,底层逻辑是「模型越大越聪明,推理越多越费卡」。可一旦模型能被压到手机本地跑,相当一部分推理请求就不需要再去云端数据中心绕一圈。分析师认为,这可能引发投资者对AI算力需求的重新思考——不是需求消失,而是需求的分布从集中式数据中心,向海量终端扩散。

但得泼盆冷水。压缩往往伴随精度损失,「小15倍」和「一样准」很难同时成立。苹果只是在「评估」,不是已经采用;这类技术要过工程稳定性、功耗、隐私一排关卡,落地周期不会短。历史上「手机跑大模型」的宣言不少,真正大规模铺开的有限。值得注意的是,端侧推理的兴起不等于云端算力的终结,训练仍是大模型迭代的主战场,英伟达在训练端的护城河短期内无人能撼,变化的只是推理侧的需求分布。

对普通用户,端侧化的好处很实在:数据不出设备、响应更快、断网也能用,也更省电。对英伟达,短期训练端的护城河纹丝不动,推理端则是另一番景象——如果ASIC和压缩技术把大量推理挪到终端,云端算力单价会承压。过去两年英伟达的狂飙,靠的正是推理需求爆发,这一环若被分流,逻辑就要重估。眼下这还只是评估阶段的一朵浪花,但它指向的方向,值得每个关心AI基建的人记住:算力的战场,正在从机房蔓延到每个人的口袋。