Bonsai 27B

Le premier grand modèle multimodal de classe 27B à fonctionner localement sur smartphone, compressé à 3,9 Go à partir de Qwen3.6 27B d'Alibaba par quantification extrême

Rapport détaillé

  • Le 14 juillet 2026, PrismML, une startup d'IA issue de Caltech, a lancé Bonsai 27B, le premier grand modèle multimodal de niveau 27B au monde pouvant s'exécuter localement sur un smartphone. Basé sur la base Alibaba Qwen3.6 27B, le modèle est compressé à 3,9 Go (version 1 bit) et 5,9 Go (version à trois valeurs) grâce à une quantification extrêmement faible en bits. Tout en conservant environ 90 à 95 % des performances de référence, la capacité de raisonnement au niveau des paramètres de 27 milliards est disponible gratuitement sur le matériel grand public pour la première fois sous le protocole open source Apache 2.0.

  • PrismML a été cofondé par Babak Hassibi, professeur de génie électrique et de mathématiques computationnelles au California Institute of Technology (Caltech), et l'équipe principale comprend également Sahin Lale, Omead Pooladzandi et Reza Sadri, tous de Caltech. La technologie de base de l'entreprise est issue de nombreuses années de recherche théorique mathématique menée par l'école, axée sur la compression des réseaux neuronaux. Le professeur Hassibi a participé à la proposition de la méthode d’élagage du réseau neuronal Optimal Brain Surgeon dès les années 1990 et possède une profonde expérience dans la simplification de modèles. PrismML a levé un total de 16,25 millions de dollars américains dans le cadre de SAFE et de tours de table, dirigés par Khosla Ventures, une société de capital-risque bien connue de la Silicon Valley, avec la participation de Cerberus Capital et du California Institute of Technology. Google et Samsung ont également fourni une puissance de calcul et un soutien industriel. L'investisseur Vinod Khosla a décrit cette technologie comme « une avancée mathématique, pas un autre petit modèle » et a estimé que l'avenir de l'IA n'est pas défini par la taille du centre de données, mais par la densité d'intelligence par unité de consommation d'énergie et de coût. La société a mis fin au mode furtif en mars 2026 et a lancé son premier produit, le Bonsai 8B 1 bit, suivi du Bonsai Image 4B en mai. Le Bonsai 27B est le modèle phare de la série Bonsai, marquant l'avancement de sa voie de compression vers des niveaux de capacité plus élevés. Apple serait en pourparlers avec PrismML pour une première évaluation technologique.

  • Bonsai 27B n'est pas un modèle de base formé à partir de zéro, mais une version fortement quantifiée basée sur Alibaba Qwen3.6 27B. Il est extrêmement compressé tout en conservant l'ensemble des fonctionnalités : fenêtres contextuelles ultra longues de 262 000 jetons, compréhension visuelle multimodale (tour de vision HQQ 4 bits), appels d'outils structurés, boucles d'agents pilotées par ordinateur et décodage spéculatif pour accélérer l'inférence. Le modèle propose deux variantes de quantification : la version Ternary utilise des poids à trois valeurs {-1, 0, +1} plus une mise à l'échelle de groupe FP16, avec un bit effectif de 1,71 et un volume de 5,9 Go. Il est orienté vers des scénarios de notebook et recherche avant tout la qualité ; la version 1 bit utilise des poids binaires {-1, +1}, des bits effectifs 1,125 et un volume de 3,9 Go. Il est orienté vers les scénarios de téléphonie mobile et recherche d'abord le volume. La principale différence entre les deux est la suivante : choisir la version 1 bit signifie accepter une perte de précision plus importante dans les appels d'outils Agentic, la compréhension visuelle et le raisonnement mathématique complexe. En termes d'adaptation au téléphone mobile, la mémoire mono-application réellement disponible de l'iPhone 17 Pro de 12 Go de mémoire est d'environ 6 Go. La version 1 bit de 3,9 Go plus le cache KV et la valeur d'activation peuvent parfaitement s'adapter à ce budget. Les données mesurées officielles montrent que la version 1 bit sur l'iPhone 17 Pro Max représente environ 11 jetons/s et qu'environ 672 jetons consomment 1 % de la batterie. Sur le bureau, la version 1 bit peut atteindre 163 token/s sur le RTX 5090, et la version ternaire peut atteindre 134 token/s ; sur le Mac M5 Max, la version 1 bit peut atteindre 87 token/s, et la version ternaire peut atteindre 58 token/s. Les retours réels des développeurs indépendants (basés sur le RTX 3090 exécutant la version Q4_K_M GGUF) montrent que la vitesse de cette ampleur sur les cartes graphiques grand public est satisfaisante : environ 28 jetons/s dans le contexte 4K, et toujours 19 jetons/s dans le contexte 16K. L'extraction JSON structurée et les performances RAG en un seul tour sont "stables et sans hallucinations", mais le raisonnement en plusieurs étapes (plus de 3 étapes d'appel d'outils) présente des lacunes évidentes. Les tests réels dans la communauté chinoise le confirment également : Bonsai 27B peut fonctionner sur une ancienne carte graphique de 8 Go (seulement 3,8 Go sont requis), avec une bonne vitesse et précision, mais le mode réflexion doit être activé pour garantir la qualité de sortie.

  • Bonsai 27B est entièrement open source sous le protocole Apache 2.0. Les poids peuvent être téléchargés gratuitement depuis Hugging Face et leur utilisation commerciale est autorisée sans autorisation. PrismML fournit également une API de prévisualisation gratuite pour les développeurs à durée limitée (via Together.ai) pour permettre aux développeurs de vérifier les prototypes avant de tirer des poids. Cette stratégie commerciale est similaire à la première stratégie d'écosystème de développeurs d'Apple : grâce à l'open source, le modèle peut être pénétré dans davantage de produits et d'écosystèmes, et une attitude ouverte peut être utilisée pour établir des normes industrielles et la rigueur des développeurs. La valeur fondamentale du modèle côté appareil est que l’inférence est gratuite et que les données ne quittent pas l’appareil, ce qui est très intéressant pour les domaines sensibles à la confidentialité et les scénarios hors ligne.

  • Les vrais retours de la communauté montrent que l’évaluation globale du Bonsai 27B par les développeurs est positive, en particulier qu’il « fait ce que les autres modèles ne peuvent pas faire » – permettant aux modèles de classe 27B de fonctionner sur des téléphones mobiles. Un développeur qui a testé sur RTX 3090 a donné une analyse détaillée des avantages et des inconvénients : le pipeline de classification, l'extraction structurée et les scénarios RAG à un seul tour sont "entièrement prêts pour la production", et la licence est Apache 2.0, ce qui signifie "qu'elle peut être déployée sans examen juridique, ce qui est bien plus important que quelques points sur le benchmark". Mais il a également souligné que dans les scénarios complexes de boucles d'agents, en raison de la rareté du MoE, le modèle est susceptible de perdre des indices dans plus de 3 étapes de chaînes de raisonnement et de répéter l'étape précédente au lieu de continuer à avancer. Un article de test détaillé sur la communauté chinoise Nuggets a également souligné que la dimension d'appel de l'outil Agentic présente la baisse la plus importante (baisse de 17,5 % dans la version 1 bit), et que la baisse d'utilisabilité dans les tests réels peut être plus importante que les chiffres. Le test de Toutiao basé sur RTX 2070 8Go donne un « IQ Ranking » intuitif : Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. L'évaluation de base est « un déploiement extrêmement simple, une bonne vitesse, honnête et sans bêtises », mais le mode réflexion doit être activé.

  • La couverture médiatique du Bonsai 27B par les médias de l’industrie se concentre sur le niveau « étape importante ». L'opinion dominante est que la véritable signification de ce modèle ne réside pas dans le score de référence unique, mais dans ce qu'il « normalise » : un modèle multimodal de niveau 27B qui vit sur du matériel grand public avec une licence libre et est disponible hors ligne. CoinDesk a souligné du point de vue de la crypto-finance que l'IA finale élimine le problème de l'industrie du cryptage lié à la confiance dans l'infrastructure cloud : les données des utilisateurs n'ont pas besoin de quitter l'appareil, ce qui constitue une mise à niveau significative de la confidentialité pour les portefeuilles cryptographiques, les interfaces DeFi et les outils de trading. Les discussions de la communauté Hacker News sont plus pragmatiques : elles reconnaissent les avancées technologiques tout en rappelant à plusieurs reprises que les lacunes de la quantification extrême dans les scénarios d’ingénierie réels ne peuvent être ignorées. Le blog d'analyse indépendant Sean Kim a émis le jugement le plus direct : « courir sur un téléphone portable » et « correspondre à un modèle de pleine précision » ne sont pas la même proposition. Un modèle raisonnable est un déploiement hybride : le modèle local côté appareil gère des tâches légères et sensibles à la confidentialité, et le raisonnement complexe est laissé au cloud. Dans le paysage concurrentiel, Apple, Google et Qualcomm promeuvent tous l’IA finale, mais le courant dominant reste à des modèles à l’échelle de paramètres 3-7B. Bonsai 27B augmente directement l'échelle des paramètres de près de 4 fois, ouvrant la dimension compétitive de la « densité intelligente ». L'indicateur de densité d'intelligence (valeur de capacité par Go) proposé par PrismML montre que le Bonsai 27B 1 bit est de 0,53/Go, soit plus de 10 fois la référence de précision totale.

  • La principale controverse autour du Bonsai 27B porte sur la mesure dans laquelle une quantification extrême érode les capacités agentiques. Le benchmark officiel montre que la version 1 bit a chuté de 17,5 % dans la dimension des appels d'outils, mais les tests de la communauté estiment que la baisse réelle pourrait être plus importante. Certains développeurs ont souligné que le modèle a tendance à « abandonner la chaîne » après la troisième couche d'inférence, ce qui suffit à rendre l'ensemble du processus inutilisable dans des scénarios agents sévères. Un autre point de discussion est que "Bonsai 27B n'est pas un nouveau modèle, mais un package". Les critiques estiment que PrismML n'a pas formé son propre modèle de base, mais a réalisé un packaging quantitatif basé sur Qwen3.6. Bien que la technologie de compression elle-même soit révolutionnaire, il reste à voir quelle est l’ampleur des barrières techniques et si d’autres équipes peuvent rapidement reproduire des effets similaires. Les questions sur la capacité visuelle ne peuvent être ignorées : la version 1 bit de MMMU Pro/OCRBench n'a obtenu qu'un score de 59,6, une baisse significative par rapport à la valeur de base de 72,6, ce qui indique que la quantification extrême a un plus grand impact sur la compréhension visuelle que les tâches textuelles.

  • Bonsai 27B convient aux développeurs suivants : les développeurs d'applications mobiles qui ont besoin de capacités d'IA locales hors ligne ; scénarios sensibles à la confidentialité (traitement de documents médicaux, juridiques et financiers) ; les chercheurs qui doivent exécuter des modèles de niveau 27B sur des cartes graphiques grand public (8 à 12 Go de VRAM) ; et des pipelines de traitement de texte qui ne nécessitent pas une grande précision d'appel d'outil. Il n'est pas recommandé de l'utiliser dans les scénarios suivants : systèmes de production qui nécessitent des capacités agentiques stables en plusieurs étapes, des pipelines de compréhension visuelle de haute précision et des tâches de raisonnement mathématique complexes. La stratégie de déploiement la plus raisonnable à l'heure actuelle est une architecture hybride : Bonsai 27B (version ternaire) sert de force principale côté client local et est utilisé pour des tâches sensibles à la confidentialité et à faible latence ; le grand modèle cloud gère des raisonnements et des scénarios complexes nécessitant une grande précision. Cette pile ne sera véritablement réalisable qu’en 2026 – car le côté local dispose enfin d’un modèle suffisamment solide.

  • Bonsai 27B est un nœud emblématique dans le développement de l'IA côté appareil : il permet aux "modèles de niveau 27B d'être installés sur les téléphones mobiles" d'être théoriquement discutables à réellement téléchargeables et exécutables. La rétention de précision sur des pièces structurées telles que les mathématiques et la programmation est acceptable, mais les lacunes sur les tâches agentiques et visuelles sont également assez évidentes. En tant que modèle open source côté client d'Apache 2.0, il offre aux développeurs un nouveau niveau de pile - pas un remplacement complet, mais une nouvelle option qui n'existait pas auparavant. Depuis juillet 2026, il s’agit de la plus grande étape sur la voie de l’IA côté appareil, mais pas la dernière.

Avis des utilisateurs

  • avatar
    Richard112
    终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。

  • avatar
    SMartinez_66
    部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。

  • avatar
    TMorgan_20248
    用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。

  • avatar
    BettyLopez007
    我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。

  • avatar
    BAndersonK
    实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。

  • avatar
    月光_17
    Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。

  • avatar
    Jesse_Foster_66
    说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。

  • avatar
    GEbel
    用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。

  • avatar
    StephanieFoster369
    和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。

  • avatar
    Ryan_RussellQ
    苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。

  • avatar
    云烟_6
    弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。

  • avatar
    Billy.Green
    运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。

  • avatar
    海浪_21
    最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。

  • avatar
    Mason.TorresSr
    说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。

  • avatar
    Michelle_RussellQ
    在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。

  • avatar
    Jonathan196
    Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。

  • avatar
    Karen.Rodriguez007
    我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。

  • avatar
    Jennifer.Kelly_99
    视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。

  • avatar
    Lydia.MendozaX
    对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。

  • avatar
    Arthur90
    最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。

  • avatar
    Matthew.MurphyK
    用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。

  • avatar
    KathleenRoberts_Plus1
    刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。

  • avatar
    GregoryNelson_66
    好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。

  • avatar
    DPrice007
    从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。

  • avatar
    NWrightIII
    17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。