PrismML把Qwen3.6壓到27B,跑進了iPhone 17 Pro

端側大模型拐點將至

2026-07-13 12:27
PrismML 把 Qwen3.6 壓到 27B,跑進了 iPhone 17 Pro
PrismML 把 Qwen3.6 壓到 27B,跑進了 iPhone 17 Pro

端側大模型又往前拱了一步。最新訊息顯示,PrismML將Qwen3.6壓縮到27B引數,併成功在iPhone 17 Pro上本地執行,規模超過了此前任何移動端部署的模型。這意味著,不聯網、不呼叫雲端,手機本身就能跑一個引數規模相當大的語言模型。

這件事的意義,不在「跑得動」三個字,而在「跑得動且可控」。 過去兩年端側AI的主旋律是「小」——手機裡跑的要麼是幾B的精簡模型,要麼是把請求甩給雲端。PrismML的做法是模型蒸餾與系統最佳化的組合拳:在儘量保住能力的前提下,把原本只能在資料中心跑的大模型壓到能在消費級晶片上推理的尺寸。iPhone 17 Pro的神經網路引擎和統一記憶體架構,恰好給了它落地土壤。

為什麼大家都在搶端側?最直觀的答案是隱私與成本。雲端推理每一次呼叫都要把使用者輸入傳到伺服器,既要付算力賬單,又要把資料交出去。模型一旦落在本地,輸入不出裝置,延遲也更低。蘋果從Apple Intelligence開始押注端側,安卓陣營也在跟進,PrismML把Qwen3.6這樣的前沿模型搬上手機,等於給「本地智慧」補上了最關鍵的一塊拼圖。

同日的AI早報裡還有一組數字值得對照:GPT-5.6的Sol、Terra、Luna三檔API定價分別為每百萬Token 5美元、2.5美元、1美元(輸出檔為30、15、6美元)。雲端模型的能力在漲,價格也在分層。端側和雲端不是替代關係,而是分工——重活交給雲端大模型,輕量、高頻、隱私敏感的活交給本地小模型,才是更現實的架構。

OpenAI這邊也在調整產品線:Codex被併入ChatGPT桌面應用,Atlas獨立瀏覽器停止支援,ChatGPT Work智慧體向企業版開放。行業正在從「單個聊天機器人」走向「嵌入工作流的智慧體」,而端側模型的成熟,會讓「智慧體在手機上本地跑」從概念變成日常。

往後看,模型壓縮與端側部署會是一條長期主線。當27B模型能穩穩跑在手機上,下一步就是更多引數、更低功耗、更穩的體驗。對普通使用者來說,這意味著AI助手會越來越「貼身」——不依賴網路、不洩露隱私、隨時響應。 端側智慧的拐點,可能比很多人預期的來得更早。