深度報告
-
2026年7月14日,加州理工學院背景的 AI 初創公司 PrismML 釋出了 Bonsai 27B,這是全球首款能在智慧手機上本地執行的 27B 級多模態大模型。基於阿里 Qwen3.6 27B 底座,透過極端低位元量化將模型壓縮至 3.9GB(1-bit 版)和 5.9GB(三值版),在保留約 90-95% 基準效能的同時,首次讓 270 億引數級別的推理能力以 Apache 2.0 開源協議免費走進消費級硬體。
-
PrismML 由加州理工學院(Caltech)電氣工程與計算數學教授 Babak Hassibi 聯合創立,核心團隊還包括 Sahin Lale、Omead Pooladzandi 和 Reza Sadri,均來自加州理工。公司核心技術源於該校多年的數學理論研究,專注於神經網路壓縮。Hassibi 教授早在 1990 年代就參與提出了神經網路剪枝方法 Optimal Brain Surgeon,對模型精簡有深厚積累。 PrismML 在 SAFE 和種子輪合計融資 1625 萬美元,由矽谷知名風投 Khosla Ventures 領投,Cerberus Capital 和加州理工學院參投,Google 和三星也提供算力與產業支援。投資人 Vinod Khosla 將這項技術形容為「數學上的突破,而非又一個小模型」,認為 AI 的未來不由資料中心規模定義,而由單位能耗和成本下的智慧密度決定。 公司於 2026 年 3 月結束隱身模式,釋出首款產品 1-bit Bonsai 8B,隨後在 5 月推出 Bonsai Image 4B。Bonsai 27B 是 Bonsai 系列的旗艦型號,標誌其壓縮路線向更高能力層級的推進。據報道,蘋果公司正與 PrismML 進行早期技術評估洽談。
-
Bonsai 27B 並非從頭訓練的基礎模型,而是基於阿里 Qwen3.6 27B 的重度量化版本。它在極端壓縮的同時保留了完整的功能集:262K token 超長上下文視窗、多模態視覺理解(4-bit HQQ 視覺塔)、結構化工具呼叫、計算機操作智慧體迴圈,以及推測解碼加速推理。 模型提供兩個量化變體:Ternary 版採用三值權重 {-1, 0, +1} 加 FP16 分組縮放,有效位元 1.71,體積 5.9GB,面向筆記本場景,追求質量優先;1-bit 版採用二值權重 {-1, +1},有效位元 1.125,體積 3.9GB,面向手機場景,追求體積優先。兩者的關鍵區別在於:選擇 1-bit 版意味著在 Agentic 工具呼叫、視覺理解和複雜數學推理上接受更明顯的精度損失。 手機適配方面,12GB 記憶體的 iPhone 17 Pro 實際可用的單應用記憶體約為 6GB,1-bit 版 3.9GB 的體積加上 KV cache 和啟用值,剛好能塞進這個預算。官方實測資料顯示,1-bit 版在 iPhone 17 Pro Max 上約 11 token/s,約 672 token 消耗 1% 電量。在桌面端,1-bit 版在 RTX 5090 上可達 163 token/s,Ternary 版為 134 token/s;在 M5 Max Mac 上,1-bit 版達 87 token/s,Ternary 版為 58 token/s。 獨立開發者實測反饋(基於 RTX 3090 跑 Q4_K_M GGUF 版本)顯示,這個量級在消費級顯示卡上的速度令人滿意:4K 上下文約 28 token/s,16K 上下文仍有 19 token/s。結構化 JSON 提取和單輪 RAG 表現「穩,無幻覺」,但多步推理(超過 3 步的工具呼叫鏈)有明顯短板。中文社群實測也印證了這一點:Bonsai 27B 在 8GB 老顯示卡上可跑(僅需 3.8GB),速度和準確性都不錯,但必須開啟 thinking 模式才能保證輸出質量。
-
Bonsai 27B 以 Apache 2.0 協議完全開源,權重在 Hugging Face 免費下載,允許商用無需授權。PrismML 同時提供限時免費的開發者預覽 API(透過 Together.ai),方便開發者在拉取權重前先做原型驗證。 這一商業策略與蘋果早年的開發者生態策略相似:透過開源讓模型滲透進更多產品和生態,以開放的姿態建立行業標準和開發者粘性。端側模型的核心價值在於推理免費、資料不出裝置,這對隱私敏感領域和離線場景極具吸引力。
-
來自社群的真實反饋顯示,開發者對 Bonsai 27B 的整體評價偏向積極,尤其是其「做到了其他模型做不到的事」——讓 27B 級模型在手機上執行。一位在 RTX 3090 上測試的開發者給出了細緻的優劣分析:分類管道、結構化提取、單輪 RAG 場景「完全可投產」,許可證為 Apache 2.0 意味著「不需要法務審查就能部署,這比 benchmark 上的幾分重要得多」。但他也指出,在複雜智慧體迴圈場景中,由於 MoE 稀疏性,模型在 3 步以上的推理鏈中容易丟失線索,重複上一步而不是繼續推進。 掘金中文社群的詳細測試文章也指出:Agentic 工具呼叫維度降幅最大(1-bit 版下降 17.5%),實測中可用性下降可能比數字更顯著。今日頭條上基於 RTX 2070 8GB 的測試給出了一個直觀的「智商排名」:Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B,核心評價是「部署極簡、速度不錯、誠實不胡編」,但必須開 thinking 模式。
-
行業媒體對 Bonsai 27B 的報道聚焦在「里程碑」層面。主流觀點認為,這款模型的真正意義不在於單項基準分數,而在於它「常態化」了什麼:一個 27B 級多模態模型,以寬鬆許可證活在消費級硬體上、離線可用。 CoinDesk 從加密金融視角指出,端側 AI 消除了加密行業對雲基礎設施的信任痛點:使用者資料不必離開裝置,對加密錢包、DeFi 介面和交易工具而言,這是有意義的隱私升級。Hacker News 社群討論則更務實:承認技術突破同時反覆提醒極端量化在真實工程場景中的短板不可忽視。 獨立分析部落格 Sean Kim 給出了最直接的判斷:「執行在手機上」和「匹配全精度模型」不是同一個主張。合理的模式是混合部署:本地端側模型處理輕量、隱私敏感的任務,複雜推理留到雲端。 從競爭格局看,Apple、Google、Qualcomm 都在推端側 AI,但主流停留在 3-7B 引數規模的模型。Bonsai 27B 直接將引數規模提升了近 4 倍,開闢了「智慧密度」這個競爭維度。PrismML 提出的智慧密度指標(intelligence density,每 GB 能力值)顯示,1-bit Bonsai 27B 為 0.53/GB,是全精度基線的 10 倍以上。
-
圍繞 Bonsai 27B 的主要爭議集中在極端量化對 Agentic 能力的侵蝕程度上。官方 benchmark 顯示 1-bit 版在工具呼叫維度下降 17.5%,但社群實測認為實際下降可能更顯著。有開發者指出,模型在第三層推理後開始「掉鏈子」的傾向,在重度 Agentic 場景中足以讓整個流程不可用。 另一個討論點在於「Bonsai 27B 不是新模型,而是打包」。批評者認為,PrismML 沒有訓練自己的基礎模型,而是在 Qwen3.6 的基礎上做量化打包——雖然壓縮技術本身是突破性的,但技術壁壘究竟有多高,需觀察其他團隊能否快速復現類似效果。 視覺能力的存疑也不容忽視:MMMU Pro / OCRBench 上 1-bit 版得分僅 59.6,相比基線 72.6 降幅明顯,說明極端量化對視覺理解的影響比文字任務更大。
-
Bonsai 27B 適合以下開發者:需要離線本地 AI 能力的移動端應用開發者;隱私敏感場景(醫療、法律、金融文件處理);需要在消費級顯示卡(8-12GB VRAM)上執行 27B 級模型的研究人員;對工具呼叫精度要求不高的文字處理管線。 不建議用於以下場景:需要穩定多步 Agentic 能力的生產系統、高精度的視覺理解管道、複雜數學推理任務。 當前最合理的部署策略是混合架構:Bonsai 27B(Ternary 版)作為本地端側主力,用於隱私敏感和低延遲需求的任務;雲端大模型處理複雜推理和需要高精度的場景。這套堆疊在 2026 年才是真正可行的——因為本地那端終於有足夠強的模型了。
-
Bonsai 27B 是端側 AI 發展的標誌性節點:它讓「27B 級模型裝進手機」從理論上可討論變成了實際上可下載、可執行。在數學和程式設計等結構化工件上的精度保留尚可,但在 Agentic 和視覺任務上的短板也足夠明顯。作為 Apache 2.0 開源的端側模型,它為開發者提供了一個新的堆疊層級——不是一個全能的替代品,而是一個原來不存在的新選項。截至 2026 年 7 月,它是端側 AI 路上最大的一步,但不是最後一步。
使用者評論
-
Richard112—終於有個 27B 模型能在手機上跑了,下載完試了下,3.8GB 確實小得離譜。日常寫寫文案、做做總結完全夠用,但別指望它像雲端模型那樣聰明,開 thinking 模式才穩,這個要注意。 -
SMartinez_66—部署是真的很簡單,LM Studio 下搜一下就能用,門檻低到離譜,這點做得比很多開源模型好。我 8G 老卡也能跑,雖然必須開 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 單卡就能跑,28 tok/s 的生成速度對於日常聊天完全夠了。做結構化 JSON 提取賊穩,沒有幻覺,這點好評。 -
BettyLopez007—我在 iPhone 17 Pro 上試了 1-bit 版本,速度確實只有 11 tok/s 左右,但考慮到是本地跑 27B 的模型,這個表現已經超出預期了。電池消耗還行,不會明顯發熱。 -
BAndersonK—實測發現它做工具呼叫的時候不太行,多步 agent 流程到了第三步就開始掉鏈子,格式也飄了。當聊天模型用可以,做自動化 agent 還差點意思。 -
月光_17—Apache 2.0 開源協議是真香,部署不需要法務審查,直接下載就能用。這一點比 benchmark 上的分數重要多了,商用省心。 -
Jesse_Foster_66—說它是 DeepSeek 時刻有點過了,畢竟它只是 Qwen 3.6 的量化打包,沒有訓練自己的基礎模型。但壓縮技術本身確實有兩把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已經能當日常主力了。262K 上下文視窗是真的大,載入一整本技術書進去做問答,記憶沒丟。 -
StephanieFoster369—和 Gemma-4-26B 對比了一下,智商確實不如人家,但 Bonsai 的代價最小,3.8GB 就能跑,生成速度還快一倍,就看你在意什麼了。 -
Ryan_RussellQ—蘋果在和 PrismML 談評估我覺得是好事,如果未來 iPhone 能本地跑 27B 的模型,Siri 應該能支稜起來吧。現在手機上的端側模型才 3B,差距太大了。 -
雲煙_6—弱智吧測試翻車了哈哈,問它洗車店離 30 米是開車去還是走路去,它真在那分析油耗。不過這種腦筋急轉彎本來也不是大模型的強項。 -
Billy.Green—執行在手機上和匹配全精度模型不是一回事,這個清醒的認識很重要。用之前先想清楚你的場景是哪一類,需要 agent 能力就選 ternary 5.9GB 版。 -
海浪_21—最讓我驚訝的是它的智慧密度概念。54GB 壓到 3.9GB,保留 90% 的能力,這在數學和程式設計任務上確實做到了。視覺能力掉得有點多,MMMU 才 59.6,看圖還是差點。 -
Mason.TorresSr—說實話我對這個模型最大的期待是離線翻譯和文件處理,出差坐飛機也能用。試了下把一份 30 頁的 PDF 丟進去做總結,效果還行,就是載入慢了點。 -
Michelle_RussellQ—在 Together.ai 上試了 preview API,不用下載就能測,這點很友好。回覆質量的確定位在「夠用」級別,和 GPT 4.5 肯定比不了,但看在免費的份上,很香了。 -
Jonathan196—Hacker News 上討論挺熱烈的,大家最擔心的還是極端量化對 agentic 能力的侵蝕。數學掉 2% 無所謂,但 tool calling 掉 17.5% 在真實場景裡影響太大了。 -
Karen.Rodriguez007—我看到的觀點是混合部署才合理,本地模型處理隱私敏感和輕量任務,複雜推理留到雲端。Bonsai 讓本地這端終於有足夠強的模型了,不用所有事都上雲。 -
Jennifer.Kelly_99—視覺塔需要額外下載 900MB,而且不開 thinking 模式圖片識別不準。但日常看圖讀文件識別驗證碼還是挺快的,0.5 秒就出結果。 -
Lydia.MendozaX—對於搞本地 AI 的開發者來說,這是今年夏天最有意思的釋出。它把手機端側的門檻從 3-8B 的小模型推進到了 27B 級別,質的飛躍。 -
Arthur90—最大的亮點是真正離線可用,資料不出裝置。對於處理敏感資訊的場景,比如律師看合同、醫生看病例,這個價值比 benchmark 分數重要得多。 -
Matthew.MurphyK—用 Locally AI 這個 App 直接就能在 iPhone 上跑,不需要折騰環境配置。不過下載模型最好用 WiFi,13GB 的資料量用流量扛不住。 -
KathleenRoberts_Plus1—剛下載就翻車了,沒有 Hugging Face 的 token 認證的話 27B 的倉庫下載不了,要先申請訪問許可權。還好小的模型可以直接下,建議先試試 8B 版本。 -
GregoryNelson_66—好奇它和常規 4-bit 量化的本質區別,看了技術文件才發現是貫穿到所有層的低位元設計,不留高精度逃生艙。這也是它能壓到 3.9GB 的原因。 -
DPrice007—從 54GB 到 3.9GB,14 倍的壓縮比,還能保持 90% 的智力保留,不管怎麼說都是技術奇蹟。微軟蘋果谷歌都該緊張一下了。 -
NWrightIII—17.5% 的工具呼叫精度損失在多步場景裡會被指數放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生產環境用的話還是得配雲端兜底。