Bonsai 27B
أول نموذج كبير متعدد الوسائط من فئة 27B يعمل محليًا على ��لهاتف الذكي، مضغوط إلى 3.9 جيجابايت من نموذج Qwen3.6 27B من علي بابا عبر تكميم فائق
تقرير معمّق
-
في 14 يوليو 2026، أصدرت شركة PrismML، وهي شركة ناشئة تعمل في مجال الذكاء الاصطناعي ولها خلفية في معهد كاليفورنيا للتكنولوجيا، Bonsai 27B، وهو أول نموذج كبير متعدد الوسائط على مستوى 27B في العالم يمكن تشغيله محليًا على هاتف ذكي. استنادًا إلى قاعدة Alibaba Qwen3.6 27B، تم ضغط النموذج إلى 3.9 جيجابايت (إصدار 1 بت) و5.9 جيجابايت (إصدار ثلاثي القيم) من خلال تكميم البتات المنخفضة للغاية. مع الاحتفاظ بحوالي 90-95% من الأداء المعياري، تتوفر القدرة على التفكير على مستوى المعلمات والتي تبلغ 27 مليارًا مجانًا على أجهزة المستهلك لأول مرة بموجب بروتوكول Apache 2.0 مفتوح المصدر.
-
شارك في تأسيس PrismML باباك حسيبي، أستاذ الهندسة الكهربائية والرياضيات الحاسوبية في معهد كاليفورنيا للتكنولوجيا (Caltech)، ويضم الفريق الأساسي أيضًا شاهين لالي، وأومياد بولادزاندي، ورضا صدري، وجميعهم من معهد كاليفورنيا للتكنولوجيا. تنبع التكنولوجيا الأساسية للشركة من سنوات عديدة من البحث النظري الرياضي في المدرسة، مع التركيز على ضغط الشبكة العصبية. شارك البروفيسور حسيبي في اقتراح طريقة تقليم الشبكة العصبية Optimal Brain Surgeon في وقت مبكر من التسعينيات، ويتمتع بخبرة عميقة في تبسيط النماذج. جمعت PrismML ما مجموعه 16.25 مليون دولار أمريكي في جولات SAFE والجولات الأولية، بقيادة Khosla Ventures، وهي شركة رأس مال استثماري مشهورة في وادي السيليكون، بمشاركة من Cerberus Capital ومعهد كاليفورنيا للتكنولوجيا. كما قدمت جوجل وسامسونج قوة الحوسبة ودعم الصناعة. ووصف المستثمر فينود خوسلا هذه التكنولوجيا بأنها "اختراق رياضي، وليس نموذجًا صغيرًا آخر" ورأى أن مستقبل الذكاء الاصطناعي لا يتحدد بحجم مركز البيانات، ولكن بكثافة الذكاء لكل وحدة استهلاك للطاقة والتكلفة. أنهت الشركة وضع التخفي في مارس 2026 وأصدرت منتجها الأول، 1 بت Bonsai 8B، يليه Bonsai Image 4B في مايو. يعد Bonsai 27B النموذج الرئيسي لسلسلة Bonsai، مما يمثل تقدمًا في طريق الضغط الخاص به إلى مستويات أعلى من القدرة. وبحسب ما ورد تجري شركة Apple محادثات مع PrismML لإجراء تقييم مبكر للتكنولوجيا.
-
Bonsai 27B ليس نموذجًا أساسيًا تم تدريبه من الصفر، ولكنه نسخة كمية بشكل كبير تعتمد على Alibaba Qwen3.6 27B. إنه مضغوط للغاية مع الاحتفاظ بمجموعة الميزات الكاملة: نوافذ سياق طويلة للغاية بحجم 262 ألف رمز مميز، وفهم مرئي متعدد الوسائط (برج رؤية HQQ ذو 4 بتات)، واستدعاءات الأدوات المنظمة، وحلقات الوكيل التي يتم تشغيلها بواسطة الكمبيوتر، وفك التشفير التأملي لتسريع الاستدلال. يوفر النموذج متغيرين للقياس الكمي: يستخدم الإصدار Ternary أوزانًا ثلاثية القيمة {-1، 0، +1} بالإضافة إلى تحجيم المجموعة FP16، مع بت فعال يبلغ 1.71 وحجم 5.9 جيجابايت. إنه موجه نحو سيناريوهات الكمبيوتر المحمول ويسعى إلى الجودة أولاً؛ يستخدم الإصدار 1 بت الأوزان الثنائية {-1، +1} والبتات الفعالة 1.125 وحجم 3.9 جيجابايت. إنه موجه لسيناريوهات الهاتف المحمول ويتبع الحجم أولاً. والفرق الرئيسي بين الاثنين هو ما يلي: اختيار الإصدار 1 بت يعني قبول فقدان أكثر أهمية للدقة في استدعاءات أدوات Agentic، والفهم البصري، والتفكير الرياضي المعقد. فيما يتعلق بتكييف الهاتف المحمول، تبلغ الذاكرة الفعلية للتطبيق الفردي المتوفرة لذاكرة iPhone 17 Pro بسعة 12 جيجابايت حوالي 6 جيجابايت. يمكن أن يتناسب الإصدار 1 بت بسعة 3.9 جيجابايت بالإضافة إلى ذاكرة التخزين المؤقت KV وقيمة التنشيط مع هذه الميزانية. تُظهر البيانات الرسمية المقاسة أن إصدار 1 بت على iPhone 17 Pro Max يبلغ حوالي 11 رمزًا/ثانية، ويستهلك حوالي 672 رمزًا 1% من البطارية. على سطح المكتب، يمكن أن يصل الإصدار 1 بت إلى 163 رمزًا/ثانية على RTX 5090، ويمكن أن يصل الإصدار الثلاثي إلى 134 رمزًا/ثانية؛ على M5 Max Mac، يمكن أن يصل الإصدار 1 بت إلى 87 رمزًا/ثانية، ويمكن أن يصل الإصدار الثلاثي إلى 58 رمزًا/ثانية. تُظهر التعليقات الفعلية من المطورين المستقلين (استنادًا إلى RTX 3090 الذي يقوم بتشغيل إصدار Q4_K_M GGUF) أن السرعة بهذا الحجم على بطاقات الرسومات المخصصة للمستهلك مرضية: حوالي 28 رمزًا/ثانية في سياق 4K، ولا تزال 19 رمزًا/ثانية في سياق 16K. يعد استخراج JSON المنظم وأداء RAG أحادي الجولة "مستقرًا وبدون هلوسة"، لكن التفكير متعدد الخطوات (أكثر من سلسلة استدعاء أداة مكونة من 3 خطوات) له عيوب واضحة. يؤكد الاختبار الفعلي في المجتمع الصيني هذا أيضًا: يمكن تشغيل Bonsai 27B على بطاقة رسومات قديمة بسعة 8 جيجابايت (مطلوب 3.8 جيجابايت فقط)، بسرعة ودقة جيدتين، ولكن يجب تشغيل وضع التفكير لضمان جودة الإخراج.
-
Bonsai 27B مفتوح المصدر بالكامل بموجب بروتوكول Apache 2.0. يمكن تنزيل الأوزان مجانًا من Hugging Face، ويُسمح بالاستخدام التجاري دون تصريح. يوفر PrismML أيضًا واجهة برمجة تطبيقات مجانية لمعاينة المطورين لفترة محدودة (من خلال Together.ai) لتسهيل قيام المطورين بالتحقق من النموذج الأولي قبل سحب الأوزان. تشبه استراتيجية العمل هذه استراتيجية النظام البيئي للمطورين المبكرة لشركة Apple: من خلال المصدر المفتوح، يمكن اختراق النموذج في المزيد من المنتجات والأنظمة البيئية، ويمكن استخدام الموقف المنفتح لوضع معايير الصناعة والتزام المطورين. القيمة الأساسية للنموذج من جانب الجهاز هي أن الاستدلال مجاني وأن البيانات لا تترك الجهاز، وهو أمر جذاب للغاية بالنسبة للحقول الحساسة للخصوصية والسيناريوهات غير المتصلة بالإنترنت.
-
تُظهر ردود الفعل الحقيقية من المجتمع أن التقييم الإجمالي للمطورين لـ Bonsai 27B إيجابي، خاصة أنه "يفعل ما لا تستطيع النماذج الأخرى القيام به" - مما يسمح لنماذج فئة 27B بالعمل على الهواتف المحمولة. قدم المطور الذي اختبر RTX 3090 تحليلاً مفصلاً للمزايا والعيوب: إن مسار التصنيف، والاستخراج المنظم، وسيناريوهات RAG أحادية الجولة "جاهزة تمامًا للإنتاج"، والترخيص هو Apache 2.0، مما يعني "يمكن نشره دون مراجعة قانونية، وهو أكثر أهمية بكثير من بضع نقاط في المعيار." لكنه أشار أيضًا إلى أنه في سيناريوهات حلقة الوكيل المعقدة، نظرًا لتناثر وزارة التعليم، يكون النموذج عرضة لفقدان الأدلة في أكثر من 3 خطوات من سلاسل الاستدلال وتكرار الخطوة السابقة بدلاً من الاستمرار في التقدم. أشارت مقالة اختبارية مفصلة عن مجتمع Nuggets الصيني أيضًا إلى أن بُعد استدعاء أداة Agentic لديه أكبر انخفاض (انخفاض بنسبة 17.5% في إصدار 1 بت)، وقد يكون انخفاض قابلية الاستخدام في الاختبار الفعلي أكثر أهمية من الأرقام. يوفر اختبار Toutiao استنادًا إلى RTX 2070 8GB "تصنيف معدل الذكاء" البديهي: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. التقييم الأساسي هو "النشر البسيط للغاية، والسرعة الجيدة، والصدق وعدم الهراء"، ولكن يجب تشغيل وضع التفكير.
-
تركز تغطية وسائل الإعلام الصناعية لـ Bonsai 27B على مستوى "المعلم". تتلخص وجهة النظر السائدة في أن الأهمية الحقيقية لهذا النموذج لا تكمن في النتيجة المعيارية الفردية، بل فيما "يقوم بتطبيعه": نموذج متعدد الوسائط على مستوى 27B يعيش على أجهزة من فئة المستهلك بترخيص فضفاض ومتاح دون اتصال بالإنترنت. أشار CoinDesk من منظور تمويل العملات المشفرة إلى أن الذكاء الاصطناعي النهائي يزيل نقطة الألم في صناعة التشفير المتمثلة في الثقة في البنية التحتية السحابية: لا يتعين على بيانات المستخدم مغادرة الجهاز، وهو ما يعد ترقية ذات معنى لخصوصية محافظ العملات المشفرة وواجهات DeFi وأدوات التداول. أصبحت مناقشات مجتمع Hacker News أكثر واقعية: الاعتراف بالاختراقات التكنولوجية مع التذكير مرارا وتكرارا بأن أوجه القصور في القياس الكمي الشديد في السيناريوهات الهندسية الحقيقية لا يمكن تجاهلها. أعطى مدونة التحليل المستقلة شون كيم الحكم الأكثر مباشرة: "التشغيل على هاتف محمول" و"مطابقة نموذج كامل الدقة" ليسا نفس الاقتراح. النموذج المعقول هو النشر المختلط: يتعامل نموذج جانب الجهاز المحلي مع مهام خفيفة الوزن وحساسة للخصوصية، ويتم ترك التفكير المعقد للسحابة. من خلال المشهد التنافسي، تعمل شركات Apple وGoogle وQualcomm على الترويج للذكاء الاصطناعي النهائي، لكن الاتجاه السائد يظل عند نماذج مقياس المعلمات من 3 إلى 7 مليار. يعمل Bonsai 27B على زيادة مقياس المعلمة بشكل مباشر بما يقرب من 4 مرات، مما يفتح البعد التنافسي لـ "الكثافة الذكية". يوضح مؤشر كثافة الذكاء (قيمة القدرة لكل جيجابايت) الذي اقترحته PrismML أن 1 بت Bonsai 27B هو 0.53/جيجابايت، وهو أكثر من 10 أضعاف خط الأساس الكامل للدقة.
-
يتمحور الجدل الرئيسي الدائر حول Bonsai 27B حول مدى تأثير القياس الكمي الشديد على قدرات العميل. يظهر المعيار الرسمي أن إصدار 1 بت قد انخفض بنسبة 17.5% في بُعد استدعاء الأداة، لكن اختبار المجتمع يعتقد أن الانخفاض الفعلي قد يكون أكثر أهمية. وأشار بعض المطورين إلى أن النموذج يميل إلى "إسقاط السلسلة" بعد الطبقة الثالثة من الاستدلال، وهو ما يكفي لجعل العملية برمتها غير قابلة للاستخدام في سيناريوهات الوكيل الشديدة. نقطة أخرى للمناقشة هي أن "Bonsai 27B ليس نموذجًا جديدًا، ولكنه حزمة". يعتقد النقاد أن PrismML لم تقم بتدريب نموذجها الأساسي الخاص بها، ولكنها قامت بالتغليف الكمي بناءً على Qwen3.6. على الرغم من أن تقنية الضغط بحد ذاتها تعتبر رائدة، إلا أنه يبقى أن نرى مدى ارتفاع العوائق التقنية وما إذا كانت الفرق الأخرى قادرة على إنتاج تأثيرات مماثلة بسرعة. لا يمكن تجاهل الأسئلة المتعلقة بالقدرة البصرية: سجل الإصدار 1 بت من MMMU Pro/OCRBench 59.6 نقطة فقط، وهو انخفاض كبير عن خط الأساس البالغ 72.6، مما يشير إلى أن التكميم الشديد له تأثير أكبر على الفهم البصري من المهام النصية.
-
يعد Bonsai 27B مناسبًا للمطورين التاليين: مطوري تطبيقات الهاتف المحمول الذين يحتاجون إلى إمكانات الذكاء الاصطناعي المحلية دون اتصال بالإنترنت؛ السيناريوهات الحساسة للخصوصية (معالجة المستندات الطبية والقانونية والمالية)؛ والباحثون الذين يحتاجون إلى تشغيل نماذج على مستوى 27B على بطاقات رسومية من فئة المستهلك (8-12 جيجابايت VRAM)؛ وخطوط معالجة النصوص التي لا تتطلب دقة عالية في استدعاء الأدوات. لا يُنصح باستخدامه في السيناريوهات التالية: أنظمة الإنتاج التي تتطلب قدرات Agent مستقرة متعددة الخطوات، وخطوط فهم بصرية عالية الدقة، ومهام التفكير الرياضي المعقدة. استراتيجية النشر الأكثر منطقية في الوقت الحاضر هي بنية هجينة: يعمل Bonsai 27B (الإصدار الثلاثي) كقوة رئيسية من جانب العميل المحلي ويستخدم للمهام ذات المتطلبات الحساسة للخصوصية وزمن الوصول المنخفض؛ يتعامل النموذج السحابي الكبير مع التفكير المعقد والسيناريوهات التي تتطلب دقة عالية. لن يكون هذا المكدس ممكنًا حقًا إلا في عام 2026 - لأن الطرف المحلي أصبح لديه أخيرًا نموذج قوي بما فيه الكفاية.
-
يعد Bonsai 27B عقدة مميزة في تطوير الذكاء الاصطناعي من جانب الجهاز: فهو يسمح "بتثبيت نماذج من مستوى 27B على الهواتف المحمولة" من كونها قابلة للمناقشة من الناحية النظرية إلى كونها قابلة للتنزيل والتشغيل فعليًا. يعد الاحتفاظ بالدقة في قطع العمل المنظمة مثل الرياضيات والبرمجة أمرًا مقبولًا، ولكن أوجه القصور في المهام الفاعلية والمرئية واضحة أيضًا بما فيه الكفاية. باعتباره نموذجًا مفتوح المصدر من جانب العميل لـ Apache 2.0، فهو يوفر للمطورين مستوى مكدسًا جديدًا - ليس بديلاً شاملاً، ولكنه خيار جديد لم يكن موجودًا من قبل. اعتبارًا من يوليو 2026، تعد هذه أكبر خطوة على الطريق نحو الذكاء الاصطناعي من جانب الجهاز، ولكنها ليست الأخيرة.
مراجعات المستخدمين
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。