深度报告
-
2026年7月14日,加州理工学院背景的 AI 初创公司 PrismML 发布了 Bonsai 27B,这是全球首款能在智能手机上本地运行的 27B 级多模态大模型。基于阿里 Qwen3.6 27B 底座,通过极端低比特量化将模型压缩至 3.9GB(1-bit 版)和 5.9GB(三值版),在保留约 90-95% 基准性能的同时,首次让 270 亿参数级别的推理能力以 Apache 2.0 开源协议免费走进消费级硬件。
-
PrismML 由加州理工学院(Caltech)电气工程与计算数学教授 Babak Hassibi 联合创立,核心团队还包括 Sahin Lale、Omead Pooladzandi 和 Reza Sadri,均来自加州理工。公司核心技术源于该校多年的数学理论研究,专注于神经网络压缩。Hassibi 教授早在 1990 年代就参与提出了神经网络剪枝方法 Optimal Brain Surgeon,对模型精简有深厚积累。 PrismML 在 SAFE 和种子轮合计融资 1625 万美元,由硅谷知名风投 Khosla Ventures 领投,Cerberus Capital 和加州理工学院参投,Google 和三星也提供算力与产业支持。投资人 Vinod Khosla 将这项技术形容为「数学上的突破,而非又一个小模型」,认为 AI 的未来不由数据中心规模定义,而由单位能耗和成本下的智能密度决定。 公司于 2026 年 3 月结束隐身模式,发布首款产品 1-bit Bonsai 8B,随后在 5 月推出 Bonsai Image 4B。Bonsai 27B 是 Bonsai 系列的旗舰型号,标志其压缩路线向更高能力层级的推进。据报道,苹果公司正与 PrismML 进行早期技术评估洽谈。
-
Bonsai 27B 并非从头训练的基础模型,而是基于阿里 Qwen3.6 27B 的重度量化版本。它在极端压缩的同时保留了完整的功能集:262K token 超长上下文窗口、多模态视觉理解(4-bit HQQ 视觉塔)、结构化工具调用、计算机操作智能体循环,以及推测解码加速推理。 模型提供两个量化变体:Ternary 版采用三值权重 {-1, 0, +1} 加 FP16 分组缩放,有效比特 1.71,体积 5.9GB,面向笔记本场景,追求质量优先;1-bit 版采用二值权重 {-1, +1},有效比特 1.125,体积 3.9GB,面向手机场景,追求体积优先。两者的关键区别在于:选择 1-bit 版意味着在 Agentic 工具调用、视觉理解和复杂数学推理上接受更明显的精度损失。 手机适配方面,12GB 内存的 iPhone 17 Pro 实际可用的单应用内存约为 6GB,1-bit 版 3.9GB 的体积加上 KV cache 和激活值,刚好能塞进这个预算。官方实测数据显示,1-bit 版在 iPhone 17 Pro Max 上约 11 token/s,约 672 token 消耗 1% 电量。在桌面端,1-bit 版在 RTX 5090 上可达 163 token/s,Ternary 版为 134 token/s;在 M5 Max Mac 上,1-bit 版达 87 token/s,Ternary 版为 58 token/s。 独立开发者实测反馈(基于 RTX 3090 跑 Q4_K_M GGUF 版本)显示,这个量级在消费级显卡上的速度令人满意:4K 上下文约 28 token/s,16K 上下文仍有 19 token/s。结构化 JSON 提取和单轮 RAG 表现「稳,无幻觉」,但多步推理(超过 3 步的工具调用链)有明显短板。中文社区实测也印证了这一点:Bonsai 27B 在 8GB 老显卡上可跑(仅需 3.8GB),速度和准确性都不错,但必须开启 thinking 模式才能保证输出质量。
-
Bonsai 27B 以 Apache 2.0 协议完全开源,权重在 Hugging Face 免费下载,允许商用无需授权。PrismML 同时提供限时免费的开发者预览 API(通过 Together.ai),方便开发者在拉取权重前先做原型验证。 这一商业策略与苹果早年的开发者生态策略相似:通过开源让模型渗透进更多产品和生态,以开放的姿态建立行业标准和开发者粘性。端侧模型的核心价值在于推理免费、数据不出设备,这对隐私敏感领域和离线场景极具吸引力。
-
来自社区的真实反馈显示,开发者对 Bonsai 27B 的整体评价偏向积极,尤其是其「做到了其他模型做不到的事」——让 27B 级模型在手机上运行。一位在 RTX 3090 上测试的开发者给出了细致的优劣分析:分类管道、结构化提取、单轮 RAG 场景「完全可投产」,许可证为 Apache 2.0 意味着「不需要法务审查就能部署,这比 benchmark 上的几分重要得多」。但他也指出,在复杂智能体循环场景中,由于 MoE 稀疏性,模型在 3 步以上的推理链中容易丢失线索,重复上一步而不是继续推进。 掘金中文社区的详细测试文章也指出:Agentic 工具调用维度降幅最大(1-bit 版下降 17.5%),实测中可用性下降可能比数字更显著。今日头条上基于 RTX 2070 8GB 的测试给出了一个直观的「智商排名」:Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B,核心评价是「部署极简、速度不错、诚实不胡编」,但必须开 thinking 模式。
-
行业媒体对 Bonsai 27B 的报道聚焦在「里程碑」层面。主流观点认为,这款模型的真正意义不在于单项基准分数,而在于它「常态化」了什么:一个 27B 级多模态模型,以宽松许可证活在消费级硬件上、离线可用。 CoinDesk 从加密金融视角指出,端侧 AI 消除了加密行业对云基础设施的信任痛点:用户数据不必离开设备,对加密钱包、DeFi 界面和交易工具而言,这是有意义的隐私升级。Hacker News 社区讨论则更务实:承认技术突破同时反复提醒极端量化在真实工程场景中的短板不可忽视。 独立分析博客 Sean Kim 给出了最直接的判断:「运行在手机上」和「匹配全精度模型」不是同一个主张。合理的模式是混合部署:本地端侧模型处理轻量、隐私敏感的任务,复杂推理留到云端。 从竞争格局看,Apple、Google、Qualcomm 都在推端侧 AI,但主流停留在 3-7B 参数规模的模型。Bonsai 27B 直接将参数规模提升了近 4 倍,开辟了「智能密度」这个竞争维度。PrismML 提出的智能密度指标(intelligence density,每 GB 能力值)显示,1-bit Bonsai 27B 为 0.53/GB,是全精度基线的 10 倍以上。
-
围绕 Bonsai 27B 的主要争议集中在极端量化对 Agentic 能力的侵蚀程度上。官方 benchmark 显示 1-bit 版在工具调用维度下降 17.5%,但社区实测认为实际下降可能更显著。有开发者指出,模型在第三层推理后开始「掉链子」的倾向,在重度 Agentic 场景中足以让整个流程不可用。 另一个讨论点在于「Bonsai 27B 不是新模型,而是打包」。批评者认为,PrismML 没有训练自己的基础模型,而是在 Qwen3.6 的基础上做量化打包——虽然压缩技术本身是突破性的,但技术壁垒究竟有多高,需观察其他团队能否快速复现类似效果。 视觉能力的存疑也不容忽视:MMMU Pro / OCRBench 上 1-bit 版得分仅 59.6,相比基线 72.6 降幅明显,说明极端量化对视觉理解的影响比文本任务更大。
-
Bonsai 27B 适合以下开发者:需要离线本地 AI 能力的移动端应用开发者;隐私敏感场景(医疗、法律、金融文档处理);需要在消费级显卡(8-12GB VRAM)上运行 27B 级模型的研究人员;对工具调用精度要求不高的文本处理管线。 不建议用于以下场景:需要稳定多步 Agentic 能力的生产系统、高精度的视觉理解管道、复杂数学推理任务。 当前最合理的部署策略是混合架构:Bonsai 27B(Ternary 版)作为本地端侧主力,用于隐私敏感和低延迟需求的任务;云端大模型处理复杂推理和需要高精度的场景。这套堆栈在 2026 年才是真正可行的——因为本地那端终于有足够强的模型了。
-
Bonsai 27B 是端侧 AI 发展的标志性节点:它让「27B 级模型装进手机」从理论上可讨论变成了实际上可下载、可运行。在数学和编程等结构化工件上的精度保留尚可,但在 Agentic 和视觉任务上的短板也足够明显。作为 Apache 2.0 开源的端侧模型,它为开发者提供了一个新的堆栈层级——不是一个全能的替代品,而是一个原来不存在的新选项。截至 2026 年 7 月,它是端侧 AI 路上最大的一步,但不是最后一步。
用户评论
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。