Bonsai 27B
Mô hình lớn đa phương thức hạng 27B đầu tiên chạy cục bộ trên điện thoại, nén xuống 3,9GB từ Qwen3.6 27B của Alibaba bằng lượng tử hóa cực hạn
Báo cáo chuyên sâu
-
Vào ngày 14 tháng 7 năm 2026, PrismML, một công ty khởi nghiệp AI có nền tảng tại Caltech, đã phát hành Bonsai 27B, mô hình lớn đa phương thức cấp 27B đầu tiên trên thế giới có thể chạy cục bộ trên điện thoại thông minh. Dựa trên cơ sở Alibaba Qwen3.6 27B, mô hình này được nén thành 3,9 GB (phiên bản 1 bit) và 5,9 GB (phiên bản ba giá trị) thông qua lượng tử hóa bit cực thấp. Trong khi vẫn giữ được khoảng 90-95% hiệu năng chuẩn, khả năng suy luận ở cấp độ tham số 27 tỷ lần đầu tiên được cung cấp miễn phí trên phần cứng của người tiêu dùng theo giao thức nguồn mở Apache 2.0.
-
PrismML được đồng sáng lập bởi Babak Hassibi, giáo sư kỹ thuật điện và toán tính toán tại Viện Công nghệ California (Caltech), và nhóm cốt lõi còn bao gồm Sahin Lale, Omead Pooladzandi và Reza Sadri, tất cả đều đến từ Caltech. Công nghệ cốt lõi của công ty bắt nguồn từ nghiên cứu lý thuyết toán học kéo dài nhiều năm của trường, tập trung vào việc nén mạng lưới thần kinh. Giáo sư Hassibi đã tham gia đề xuất phương pháp cắt tỉa mạng lưới thần kinh Tối ưu bác sĩ phẫu thuật não ngay từ những năm 1990 và có kinh nghiệm sâu sắc trong việc đơn giản hóa mô hình. PrismML đã huy động được tổng cộng 16,25 triệu USD trong các vòng SAFE và hạt giống, dẫn đầu bởi Khosla Ventures, một công ty đầu tư mạo hiểm nổi tiếng ở Thung lũng Silicon, với sự tham gia của Cerberus Capital và Viện Công nghệ California. Google và Samsung cũng cung cấp sức mạnh tính toán và hỗ trợ ngành. Nhà đầu tư Vinod Khosla mô tả công nghệ này là "một bước đột phá về mặt toán học, không phải một mô hình nhỏ nào khác" và tin rằng tương lai của AI không được xác định bởi quy mô của trung tâm dữ liệu mà bởi mật độ trí tuệ trên mỗi đơn vị năng lượng tiêu thụ và chi phí. Công ty đã kết thúc chế độ tàng hình vào tháng 3 năm 2026 và phát hành sản phẩm đầu tiên của mình, Bonsai 8B 1-bit, tiếp theo là Bonsai Image 4B vào tháng 5. Bonsai 27B là mẫu hàng đầu của dòng Bonsai, đánh dấu sự tiến bộ của lộ trình nén của nó lên mức khả năng cao hơn. Apple được cho là đang đàm phán với PrismML để đánh giá công nghệ sớm.
-
Cây cảnh 27B không phải là mô hình cơ bản được đào tạo từ đầu mà là phiên bản được lượng tử hóa mạnh mẽ dựa trên Alibaba Qwen3.6 27B. Nó được nén cực kỳ cao trong khi vẫn giữ được bộ tính năng đầy đủ: cửa sổ ngữ cảnh siêu dài 262K mã thông báo, hiểu biết trực quan đa phương thức (Tháp tầm nhìn HQQ 4 bit), lệnh gọi công cụ có cấu trúc, vòng lặp tác nhân do máy tính vận hành và giải mã suy đoán để tăng tốc độ suy luận. Mô hình này cung cấp hai biến thể định lượng: phiên bản Ternary sử dụng trọng số ba giá trị {-1, 0, +1} cộng với tỷ lệ nhóm FP16, với bit hiệu dụng là 1,71 và dung lượng là 5,9 GB. Nó hướng tới các kịch bản máy tính xách tay và đặt chất lượng lên hàng đầu; phiên bản 1 bit sử dụng trọng số nhị phân {-1, +1}, bit hiệu dụng 1,125 và dung lượng 3,9 GB. Nó hướng tới các kịch bản điện thoại di động và theo đuổi khối lượng trước tiên. Sự khác biệt chính giữa hai phiên bản này là: Chọn phiên bản 1 bit đồng nghĩa với việc chấp nhận mức độ chính xác bị giảm đáng kể hơn trong các lệnh gọi công cụ Agentic, hiểu biết trực quan và lý luận toán học phức tạp. Về khả năng thích ứng của điện thoại di động, bộ nhớ ứng dụng đơn thực tế có sẵn của bộ nhớ 12GB iPhone 17 Pro là khoảng 6GB. Phiên bản 1 bit 3,9GB cộng với bộ đệm KV và giá trị kích hoạt có thể phù hợp với ngân sách này. Dữ liệu đo chính thức cho thấy phiên bản 1 bit trên iPhone 17 Pro Max là khoảng 11 token/s và khoảng 672 token tiêu thụ 1% pin. Trên máy tính để bàn, phiên bản 1 bit có thể đạt 163 token/s trên RTX 5090 và phiên bản ternary có thể đạt 134 token/s; trên M5 Max Mac, phiên bản 1 bit có thể đạt 87 mã thông báo/s và phiên bản thứ ba có thể đạt 58 mã thông báo/s. Phản hồi thực tế từ các nhà phát triển độc lập (dựa trên RTX 3090 chạy phiên bản Q4_K_M GGUF) cho thấy tốc độ ở mức độ này trên card đồ họa cấp độ người tiêu dùng là thỏa đáng: khoảng 28 token/s trong bối cảnh 4K và vẫn là 19 token/s trong bối cảnh 16K. Trích xuất JSON có cấu trúc và hiệu suất RAG một vòng là "ổn định và không có ảo giác", nhưng lý luận nhiều bước (chuỗi lệnh gọi công cụ hơn 3 bước) có những thiếu sót rõ ràng. Thử nghiệm thực tế trong cộng đồng Trung Quốc cũng khẳng định điều này: Bonsai 27B có thể chạy trên card đồ họa 8GB cũ (chỉ cần 3,8GB), tốc độ và độ chính xác tốt nhưng phải bật chế độ suy nghĩ để đảm bảo chất lượng đầu ra.
-
Bonsai 27B hoàn toàn là nguồn mở theo giao thức Apache 2.0. Các quả tạ được tải xuống miễn phí từ Ôm Mặt và được phép sử dụng cho mục đích thương mại mà không cần được phép. PrismML cũng cung cấp API xem trước miễn phí dành cho nhà phát triển trong thời gian giới hạn (thông qua Together.ai) để tạo điều kiện cho các nhà phát triển thực hiện xác minh nguyên mẫu trước khi cân nhắc. Chiến lược kinh doanh này tương tự như chiến lược hệ sinh thái nhà phát triển ban đầu của Apple: thông qua nguồn mở, mô hình có thể được thâm nhập vào nhiều sản phẩm và hệ sinh thái hơn, đồng thời có thể sử dụng thái độ cởi mở để thiết lập các tiêu chuẩn ngành và sự gắn bó của nhà phát triển. Giá trị cốt lõi của mô hình phía thiết bị là suy luận miễn phí và dữ liệu không rời khỏi thiết bị, điều này rất hấp dẫn đối với các trường nhạy cảm về quyền riêng tư và các tình huống ngoại tuyến.
-
Phản hồi thực tế từ cộng đồng cho thấy đánh giá chung của các nhà phát triển về Bonsai 27B là tích cực, đặc biệt là nó “làm được điều mà các mô hình khác không thể làm được” – cho phép các mô hình đẳng cấp 27B chạy trên điện thoại di động. Một nhà phát triển đã thử nghiệm RTX 3090 đã đưa ra phân tích chi tiết về ưu điểm và nhược điểm: quy trình phân loại, trích xuất có cấu trúc và các kịch bản RAG một vòng "hoàn toàn sẵn sàng sản xuất" và giấy phép là Apache 2.0, có nghĩa là "nó có thể được triển khai mà không cần xem xét pháp lý, điều này quan trọng hơn nhiều so với một vài điểm trên điểm chuẩn". Nhưng ông cũng chỉ ra rằng trong các kịch bản vòng lặp tác nhân phức tạp, do tính thưa thớt của MoE, mô hình dễ bị mất manh mối trong hơn 3 bước của chuỗi lý luận và lặp lại bước trước đó thay vì tiếp tục tiến lên. Một bài viết thử nghiệm chi tiết trên cộng đồng Nuggets Chinese cũng chỉ ra rằng thứ nguyên lệnh gọi công cụ Agentic có mức giảm lớn nhất (giảm 17,5% ở phiên bản 1 bit) và mức giảm khả năng sử dụng trong thử nghiệm thực tế có thể đáng kể hơn các con số. Bài kiểm tra của Toutiao dựa trên RTX 2070 8GB đưa ra “xếp hạng IQ” trực quan: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. Đánh giá cốt lõi là “triển khai cực kỳ đơn giản, tốc độ tốt, trung thực và không nói nhảm”, nhưng phải bật chế độ tư duy.
-
Các phương tiện truyền thông trong ngành đưa tin về Bonsai 27B tập trung vào mức độ “cột mốc”. Quan điểm chính thống là tầm quan trọng thực sự của mô hình này không nằm ở điểm chuẩn duy nhất mà ở những gì nó "bình thường hóa": một mô hình đa phương thức cấp 27B hoạt động trên phần cứng cấp độ người tiêu dùng với giấy phép lỏng lẻo và có sẵn ngoại tuyến. CoinDesk đã chỉ ra từ góc độ tài chính tiền điện tử rằng AI cuối cùng sẽ loại bỏ điểm yếu của ngành mã hóa là tin tưởng vào cơ sở hạ tầng đám mây: dữ liệu người dùng không cần phải rời khỏi thiết bị, đây là một bản nâng cấp quyền riêng tư có ý nghĩa cho ví tiền điện tử, giao diện DeFi và công cụ giao dịch. Các cuộc thảo luận của cộng đồng Hacker News thực tế hơn: thừa nhận những đột phá về công nghệ trong khi liên tục nhắc nhở rằng không thể bỏ qua những thiếu sót của việc định lượng cực đoan trong các kịch bản kỹ thuật thực tế. Blog phân tích độc lập Sean Kim đã đưa ra nhận định trực tiếp nhất: "Chạy trên điện thoại di động" và "phù hợp với một mô hình có độ chính xác hoàn toàn" không phải là một đề xuất giống nhau. Một mô hình hợp lý là triển khai kết hợp: mô hình phía thiết bị cục bộ xử lý các tác vụ nhẹ, nhạy cảm với quyền riêng tư và lý luận phức tạp được giao cho đám mây. Trong bối cảnh cạnh tranh, Apple, Google và Qualcomm đều đang thúc đẩy AI đầu cuối, nhưng xu hướng chủ đạo vẫn ở các mô hình quy mô tham số 3-7B. Bonsai 27B trực tiếp tăng thang thông số lên gần 4 lần, mở ra khía cạnh cạnh tranh về “mật độ thông minh”. Chỉ báo mật độ thông minh (giá trị dung lượng trên mỗi GB) do PrismML đề xuất cho thấy Bonsai 27B 1 bit là 0,53/GB, cao hơn 10 lần so với đường cơ sở có độ chính xác đầy đủ.
-
Cuộc tranh cãi chính xung quanh Bonsai 27B tập trung vào mức độ định lượng quá mức làm xói mòn khả năng của Agentic. Điểm chuẩn chính thức cho thấy phiên bản 1 bit đã giảm 17,5% về thứ nguyên lệnh gọi công cụ, nhưng thử nghiệm của cộng đồng tin rằng mức giảm thực tế có thể đáng kể hơn. Một số nhà phát triển chỉ ra rằng mô hình có xu hướng "thả chuỗi" sau lớp suy luận thứ ba, điều này đủ để khiến toàn bộ quá trình không thể sử dụng được trong các tình huống tác nhân nghiêm trọng. Một điểm thảo luận khác là “Bonsai 27B không phải là mẫu mới mà là một gói”. Các nhà phê bình tin rằng PrismML không đào tạo mô hình cơ bản của riêng mình mà thực hiện đóng gói định lượng dựa trên Qwen3.6. Mặc dù bản thân công nghệ nén đã mang tính đột phá nhưng vẫn còn phải xem các rào cản kỹ thuật cao đến mức nào và liệu các nhóm khác có thể nhanh chóng tái tạo các hiệu ứng tương tự hay không. Không thể bỏ qua các câu hỏi về khả năng thị giác: phiên bản 1 bit của MMMU Pro/OCRBench chỉ đạt 59,6 điểm, giảm đáng kể so với mức cơ bản là 72,6, cho thấy rằng lượng tử hóa cực độ có tác động lớn hơn đến khả năng hiểu trực quan so với các tác vụ văn bản.
-
Bonsai 27B phù hợp với các nhà phát triển sau: nhà phát triển ứng dụng di động cần khả năng AI cục bộ ngoại tuyến; các tình huống nhạy cảm về quyền riêng tư (xử lý tài liệu y tế, pháp lý, tài chính); các nhà nghiên cứu cần chạy các mô hình cấp 27B trên card đồ họa cấp độ người tiêu dùng (VRAM 8-12GB); và các quy trình xử lý văn bản không yêu cầu độ chính xác của lệnh gọi công cụ cao. Không nên sử dụng nó trong các tình huống sau: hệ thống sản xuất yêu cầu khả năng Tác nhân đa bước ổn định, quy trình hiểu biết trực quan có độ chính xác cao và các nhiệm vụ lý luận toán học phức tạp. Chiến lược triển khai hợp lý nhất hiện nay là kiến trúc kết hợp: Bonsai 27B (phiên bản Ternary) đóng vai trò là lực lượng chính ở phía khách hàng địa phương và được sử dụng cho các nhiệm vụ có yêu cầu nhạy cảm về quyền riêng tư và độ trễ thấp; mô hình đám mây lớn xử lý các lý luận và tình huống phức tạp đòi hỏi độ chính xác cao. Ngăn xếp này sẽ chỉ thực sự khả thi vào năm 2026 - vì cuối cùng địa phương cũng có một mô hình đủ mạnh.
-
Bonsai 27B là một nút mang tính biểu tượng trong quá trình phát triển AI phía thiết bị: nó cho phép "cài đặt các mô hình cấp 27B trên điện thoại di động" từ mức có thể thảo luận về mặt lý thuyết đến mức thực sự có thể tải xuống và chạy được. Khả năng duy trì độ chính xác trên các phôi có cấu trúc như toán học và lập trình là có thể chấp nhận được, nhưng những thiếu sót trong các tác vụ tác nhân và trực quan cũng đủ rõ ràng. Là mô hình phía máy khách nguồn mở của Apache 2.0, nó cung cấp cho các nhà phát triển một cấp độ ngăn xếp mới - không phải là một sự thay thế toàn diện mà là một tùy chọn mới chưa tồn tại trước đây. Tính đến tháng 7 năm 2026, đây là bước tiến lớn nhất trên con đường hướng tới AI phía thiết bị, nhưng không phải là bước cuối cùng.
Đánh giá của người dùng
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。