蘋果評估 PrismML:大模型壓縮 15 倍塞進 iPhone

端側 AI 要重估算力

2026-07-15 23:32

7月15日的AI日報裡有一條容易被忽略的訊息:蘋果正評估一家叫PrismML的初創公司技術,據稱能把大型AI模型(比如阿里的Qwen)大幅壓縮,直接跑在iPhone 15及更新機型上,記憶體需求降低15倍,同時提升執行速度和能效。

端側AI的瓶頸從來不是「想不想跑」,而是「跑不跑得動」。大模型動輒幾十億引數,塞進手機要佔掉驚人的記憶體和算力,所以今天絕大多數AI體驗還是雲端推理、手機只做展示。PrismML這類壓縮技術的價值,在於把模型體積和記憶體佔用砍掉一個數量級,讓端側裝置真的能獨立完成推理。對手機廠商來說,本地推理意味著差異化賣點,誰能先把大模型跑順,誰就多一張旗艦機的牌。

如果15倍壓縮屬實,它對「算力需求」這堂課是顛覆性的。 過去兩年英偉達的狂飆,底層邏輯是「模型越大越聰明,推理越多越費卡」。可一旦模型能被壓到手機本地跑,相當一部分推理請求就不需要再去雲端資料中心繞一圈。分析師認為,這可能引發投資者對AI算力需求的重新思考——不是需求消失,而是需求的分佈從集中式資料中心,向海量終端擴散。

但得潑盆冷水。壓縮往往伴隨精度損失,「小15倍」和「一樣準」很難同時成立。蘋果只是在「評估」,不是已經採用;這類技術要過工程穩定性、功耗、隱私一排關卡,落地週期不會短。歷史上「手機跑大模型」的宣言不少,真正大規模鋪開的有限。值得注意的是,端側推理的興起不等於雲端算力的終結,訓練仍是大模型迭代的主戰場,英偉達在訓練端的護城河短期內無人能撼,變化的只是推理側的需求分佈。

對普通使用者,端側化的好處很實在:資料不出裝置、響應更快、斷網也能用,也更省電。對英偉達,短期訓練端的護城河紋絲不動,推理端則是另一番景象——如果ASIC和壓縮技術把大量推理挪到終端,雲端算力單價會承壓。過去兩年英偉達的狂飆,靠的正是推理需求爆發,這一環若被分流,邏輯就要重估。眼下這還只是評估階段的一朵浪花,但它指向的方向,值得每個關心AI基建的人記住:算力的戰場,正在從機房蔓延到每個人的口袋。