PrismML把Qwen3.6压到27B,跑进了iPhone 17 Pro
端侧大模型拐点将至

端侧大模型又往前拱了一步。最新消息显示,PrismML将Qwen3.6压缩到27B参数,并成功在iPhone 17 Pro上本地运行,规模超过了此前任何移动端部署的模型。这意味着,不联网、不调用云端,手机本身就能跑一个参数规模相当大的语言模型。
这件事的意义,不在「跑得动」三个字,而在「跑得动且可控」。 过去两年端侧AI的主旋律是「小」——手机里跑的要么是几B的精简模型,要么是把请求甩给云端。PrismML的做法是模型蒸馏与系统优化的组合拳:在尽量保住能力的前提下,把原本只能在数据中心跑的大模型压到能在消费级芯片上推理的尺寸。iPhone 17 Pro的神经网络引擎和统一内存架构,恰好给了它落地土壤。
为什么大家都在抢端侧?最直观的答案是隐私与成本。云端推理每一次调用都要把用户输入传到服务器,既要付算力账单,又要把数据交出去。模型一旦落在本地,输入不出设备,延迟也更低。苹果从Apple Intelligence开始押注端侧,安卓阵营也在跟进,PrismML把Qwen3.6这样的前沿模型搬上手机,等于给「本地智能」补上了最关键的一块拼图。
同日的AI早报里还有一组数字值得对照:GPT-5.6的Sol、Terra、Luna三档API定价分别为每百万Token 5美元、2.5美元、1美元(输出档为30、15、6美元)。云端模型的能力在涨,价格也在分层。端侧和云端不是替代关系,而是分工——重活交给云端大模型,轻量、高频、隐私敏感的活交给本地小模型,才是更现实的架构。
OpenAI这边也在调整产品线:Codex被并入ChatGPT桌面应用,Atlas独立浏览器停止支持,ChatGPT Work智能体向企业版开放。行业正在从「单个聊天机器人」走向「嵌入工作流的智能体」,而端侧模型的成熟,会让「智能体在手机上本地跑」从概念变成日常。
往后看,模型压缩与端侧部署会是一条长期主线。当27B模型能稳稳跑在手机上,下一步就是更多参数、更低功耗、更稳的体验。对普通用户来说,这意味着AI助手会越来越「贴身」——不依赖网络、不泄露隐私、随时响应。 端侧智能的拐点,可能比很多人预期的来得更早。