Bonsai 27B

El primer gran modelo multimodal de clase 27B que funciona localmente en un smartphone, comprimido a 3,9 GB a partir de Qwen3.6 27B de Alibaba mediante cuantización extrema

Informe detallado

  • El 14 de julio de 2026, PrismML, una startup de inteligencia artificial con experiencia en Caltech, lanzó Bonsai 27B, el primer modelo grande multimodal de nivel 27B del mundo que puede ejecutarse localmente en un teléfono inteligente. Basado en la base Alibaba Qwen3.6 27B, el modelo está comprimido a 3,9 GB (versión de 1 bit) y 5,9 GB (versión de tres valores) mediante una cuantificación extrema de bits bajos. Si bien conserva alrededor del 90-95% del rendimiento de referencia, la capacidad de razonamiento a nivel de parámetros de 27 mil millones está disponible de forma gratuita en hardware de consumo por primera vez bajo el protocolo de código abierto Apache 2.0.

  • PrismML fue cofundado por Babak Hassibi, profesor de ingeniería eléctrica y matemáticas computacionales en el Instituto de Tecnología de California (Caltech), y el equipo central también incluye a Sahin Lale, Omead Pooladzandi y Reza Sadri, todos de Caltech. La tecnología central de la empresa se origina a partir de muchos años de investigación teórica matemática de la escuela, centrándose en la compresión de redes neuronales. El profesor Hassibi participó en la propuesta del método de poda de redes neuronales Optimal Brain Surgeon ya en la década de 1990 y tiene una profunda experiencia en la simplificación de modelos. PrismML recaudó un total de 16,25 millones de dólares en rondas SAFE y semilla, lideradas por Khosla Ventures, una conocida firma de capital de riesgo de Silicon Valley, con la participación de Cerberus Capital y el Instituto de Tecnología de California. Google y Samsung también proporcionaron potencia informática y apoyo a la industria. El inversor Vinod Khosla describió esta tecnología como "un avance matemático, no otro modelo pequeño" y consideró que el futuro de la IA no está definido por el tamaño del centro de datos, sino por la densidad de inteligencia por unidad de consumo de energía y coste. La compañía puso fin al modo sigiloso en marzo de 2026 y lanzó su primer producto, el Bonsai 8B de 1 bit, seguido del Bonsai Image 4B en mayo. El Bonsai 27B es el modelo insignia de la serie Bonsai y marca el avance de su ruta de compresión hacia niveles más altos de capacidad. Según se informa, Apple está en conversaciones con PrismML para una evaluación temprana de la tecnología.

  • Bonsai 27B no es un modelo básico entrenado desde cero, sino una versión muy cuantificada basada en Alibaba Qwen3.6 27B. Está extremadamente comprimido y al mismo tiempo conserva el conjunto completo de funciones: ventanas de contexto ultralargas de 262 000 tokens, comprensión visual multimodal (HQQ Vision Tower de 4 bits), llamadas de herramientas estructuradas, bucles de agentes operados por computadora y decodificación especulativa para acelerar la inferencia. El modelo proporciona dos variantes de cuantificación: la versión Ternaria utiliza pesos de tres valores {-1, 0, +1} más escalamiento de grupo FP16, con un bit efectivo de 1,71 y un volumen de 5,9 GB. Está orientado a escenarios de portátiles y persigue la calidad en primer lugar; la versión de 1 bit utiliza pesos binarios {-1, +1}, bits efectivos 1,125 y un volumen de 3,9 GB. Está orientado a escenarios de telefonía móvil y busca primero el volumen. La diferencia clave entre los dos es la siguiente: elegir la versión de 1 bit significa aceptar una pérdida más significativa de precisión en las llamadas a herramientas Agentic, la comprensión visual y el razonamiento matemático complejo. En términos de adaptación del teléfono móvil, la memoria real disponible para una sola aplicación del iPhone 17 Pro de 12 GB es de aproximadamente 6 GB. La versión de 1 bit de 3,9 GB más caché KV y valor de activación puede ajustarse a este presupuesto. Los datos medidos oficiales muestran que la versión de 1 bit en el iPhone 17 Pro Max consume aproximadamente 11 tokens/s, y aproximadamente 672 tokens consumen el 1% de la batería. En el escritorio, la versión de 1 bit puede alcanzar 163 token/s en el RTX 5090, y la versión ternaria puede alcanzar 134 token/s; en el Mac M5 Max, la versión de 1 bit puede alcanzar 87 token/s y la versión ternaria puede alcanzar 58 token/s. Los comentarios reales de desarrolladores independientes (basados ​​en RTX 3090 ejecutando la versión Q4_K_M GGUF) muestran que la velocidad de esta magnitud en tarjetas gráficas de consumo es satisfactoria: aproximadamente 28 token/s en el contexto 4K, y aún 19 token/s en el contexto 16K. La extracción JSON estructurada y el rendimiento RAG de una sola ronda son "estables y sin alucinaciones", pero el razonamiento de varios pasos (más de una cadena de llamadas de herramientas de 3 pasos) tiene deficiencias obvias. Las pruebas reales en la comunidad china también lo confirman: Bonsai 27B puede ejecutarse en una tarjeta gráfica antigua de 8 GB (sólo se requieren 3,8 GB), con buena velocidad y precisión, pero el modo de pensamiento debe estar activado para garantizar la calidad de salida.

  • Bonsai 27B es completamente de código abierto bajo el protocolo Apache 2.0. Los pesos se pueden descargar gratis desde Hugging Face y se permite el uso comercial sin autorización. PrismML también proporciona una API de vista previa para desarrolladores gratuita por tiempo limitado (a través de Together.ai) para facilitar a los desarrolladores la verificación del prototipo antes de hacer esfuerzos. Esta estrategia comercial es similar a la estrategia inicial del ecosistema de desarrolladores de Apple: a través del código abierto, el modelo puede penetrar en más productos y ecosistemas, y se puede utilizar una actitud abierta para establecer estándares de la industria y la rigidez de los desarrolladores. El valor central del modelo del lado del dispositivo es que la inferencia es gratuita y los datos no salen del dispositivo, lo cual es muy atractivo para campos sensibles a la privacidad y escenarios fuera de línea.

  • Los comentarios reales de la comunidad muestran que la evaluación general de los desarrolladores del Bonsai 27B es positiva, especialmente porque "hace lo que otros modelos no pueden hacer": permitir que los modelos de clase 27B se ejecuten en teléfonos móviles. Un desarrollador que probó el RTX 3090 dio un análisis detallado de las ventajas y desventajas: el canal de clasificación, la extracción estructurada y los escenarios RAG de una sola ronda están "completamente listos para producción", y la licencia es Apache 2.0, lo que significa que "se puede implementar sin revisión legal, lo cual es mucho más importante que unos pocos puntos en el punto de referencia". Pero también señaló que en escenarios complejos de bucle de agentes, debido a la escasez de MoE, el modelo es propenso a perder pistas en más de 3 pasos de cadenas de razonamiento y repetir el paso anterior en lugar de seguir avanzando. Un artículo de prueba detallado sobre la comunidad china de Nuggets también señaló que la dimensión de llamada de la herramienta Agentic tiene la mayor caída (caída del 17,5% en la versión de 1 bit), y la caída de usabilidad en las pruebas reales puede ser más significativa que los números. La prueba de Toutiao basada en RTX 2070 8GB proporciona una “clasificación de coeficiente intelectual” intuitiva: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. La evaluación central es "implementación extremadamente simple, buena velocidad, honesta y sin tonterías", pero el modo de pensar debe estar activado.

  • La cobertura de los medios de la industria sobre Bonsai 27B se centra en el nivel de "hitos". La opinión generalizada es que la verdadera importancia de este modelo no reside en la puntuación de referencia única, sino en lo que "normaliza": un modelo multimodal de nivel 27B que funciona con hardware de consumo con una licencia flexible y está disponible sin conexión. CoinDesk señaló desde la perspectiva de las finanzas criptográficas que la IA final elimina el problema de la industria del cifrado de confiar en la infraestructura de la nube: los datos del usuario no tienen que salir del dispositivo, lo que es una mejora significativa de la privacidad para las billeteras criptográficas, las interfaces DeFi y las herramientas comerciales. Las discusiones de la comunidad de Hacker News son más pragmáticas: reconocen los avances tecnológicos y al mismo tiempo recuerdan repetidamente que no se pueden ignorar las deficiencias de la cuantificación extrema en escenarios de ingeniería reales. El blog de análisis independiente Sean Kim dio el juicio más directo: "Ejecutar en un teléfono móvil" y "hacer coincidir un modelo de precisión total" no son la misma propuesta. Un modelo razonable es una implementación híbrida: el modelo del lado del dispositivo local maneja tareas livianas y sensibles a la privacidad, y el razonamiento complejo se deja en manos de la nube. Desde el panorama competitivo, Apple, Google y Qualcomm están promoviendo la IA final, pero la corriente principal se mantiene en modelos a escala de parámetros de 3 a 7 mil millones. Bonsai 27B aumenta directamente la escala de parámetros casi 4 veces, abriendo la dimensión competitiva de la "densidad inteligente". El indicador de densidad de inteligencia (valor de capacidad por GB) propuesto por PrismML muestra que Bonsai 27B de 1 bit es 0,53/GB, que es más de 10 veces la línea base de precisión total.

  • La principal controversia que rodea a Bonsai 27B se centra en hasta qué punto la cuantificación extrema erosiona las capacidades de los Agentes. El punto de referencia oficial muestra que la versión de 1 bit ha caído un 17,5% en la dimensión de llamada de herramienta, pero las pruebas de la comunidad creen que la caída real puede ser más significativa. Algunos desarrolladores señalaron que el modelo tiene una tendencia a "soltar la cadena" después de la tercera capa de inferencia, lo que es suficiente para hacer que todo el proceso sea inutilizable en escenarios agentes severos. Otro punto de discusión es que "Bonsai 27B no es un modelo nuevo, sino un paquete". Los críticos creen que PrismML no entrenó su propio modelo básico, sino que realizó un empaquetado cuantitativo basado en Qwen3.6. Aunque la tecnología de compresión en sí es innovadora, queda por ver qué tan altas son las barreras técnicas y si otros equipos pueden reproducir rápidamente efectos similares. Las preguntas sobre la capacidad visual no se pueden ignorar: la versión de 1 bit de MMMU Pro/OCRBench obtuvo solo 59,6, una caída significativa desde el punto de referencia de 72,6, lo que indica que la cuantificación extrema tiene un mayor impacto en la comprensión visual que las tareas de texto.

  • Bonsai 27B es adecuado para los siguientes desarrolladores: desarrolladores de aplicaciones móviles que necesitan capacidades de IA locales fuera de línea; escenarios sensibles a la privacidad (procesamiento de documentos médicos, legales y financieros); investigadores que necesitan ejecutar modelos de nivel 27B en tarjetas gráficas de consumo (8-12 GB de VRAM); y canales de procesamiento de texto que no requieren una alta precisión de llamada de herramientas. No se recomienda su uso en los siguientes escenarios: sistemas de producción que requieren capacidades Agentic estables de varios pasos, canales de comprensión visual de alta precisión y tareas complejas de razonamiento matemático. La estrategia de implementación más razonable en la actualidad es una arquitectura híbrida: Bonsai 27B (versión ternaria) sirve como fuerza principal en el lado del cliente local y se utiliza para tareas con requisitos de baja latencia y sensibles a la privacidad; el modelo grande de la nube maneja razonamientos y escenarios complejos que requieren alta precisión. Esta pila sólo será realmente viable en 2026, porque el extremo local finalmente tiene un modelo lo suficientemente fuerte.

  • Bonsai 27B es un nodo icónico en el desarrollo de la IA del lado del dispositivo: permite que "modelos de nivel 27B se instalen en teléfonos móviles" desde ser teóricamente discutibles hasta ser realmente descargables y ejecutables. La retención de la precisión en piezas de trabajo estructuradas como matemáticas y programación es aceptable, pero las deficiencias en tareas visuales y de agencia también son bastante obvias. Como modelo de código abierto del lado del cliente de Apache 2.0, proporciona a los desarrolladores un nuevo nivel de pila, no un reemplazo integral, sino una nueva opción que no existía antes. A partir de julio de 2026, es el paso más grande en el camino hacia la IA del lado del dispositivo, pero no el último.

Reseñas de usuarios

  • avatar
    Richard112
    终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。

  • avatar
    SMartinez_66
    部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。

  • avatar
    TMorgan_20248
    用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。

  • avatar
    BettyLopez007
    我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。

  • avatar
    BAndersonK
    实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。

  • avatar
    月光_17
    Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。

  • avatar
    Jesse_Foster_66
    说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。

  • avatar
    GEbel
    用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。

  • avatar
    StephanieFoster369
    和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。

  • avatar
    Ryan_RussellQ
    苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。

  • avatar
    云烟_6
    弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。

  • avatar
    Billy.Green
    运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。

  • avatar
    海浪_21
    最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。

  • avatar
    Mason.TorresSr
    说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。

  • avatar
    Michelle_RussellQ
    在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。

  • avatar
    Jonathan196
    Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。

  • avatar
    Karen.Rodriguez007
    我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。

  • avatar
    Jennifer.Kelly_99
    视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。

  • avatar
    Lydia.MendozaX
    对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。

  • avatar
    Arthur90
    最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。

  • avatar
    Matthew.MurphyK
    用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。

  • avatar
    KathleenRoberts_Plus1
    刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。

  • avatar
    GregoryNelson_66
    好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。

  • avatar
    DPrice007
    从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。

  • avatar
    NWrightIII
    17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。