Bonsai 27B
O primeiro grande modelo multimodal da classe 27B a rodar localmente em um smartphone, comprimido para 3,9 GB a partir do Qwen3.6 27B da Alibaba via quantização extrema
Relatório detalhado
-
Em 14 de julho de 2026, PrismML, uma startup de IA com experiência na Caltech, lançou o Bonsai 27B, o primeiro modelo grande multimodal de nível 27B do mundo que pode ser executado localmente em um smartphone. Baseado na base Alibaba Qwen3.6 27B, o modelo é compactado para 3,9 GB (versão de 1 bit) e 5,9 GB (versão de três valores) por meio de quantização de bits extremamente baixos. Embora retenha cerca de 90-95% do desempenho do benchmark, a capacidade de raciocínio em nível de parâmetro de 27 bilhões está disponível gratuitamente em hardware de consumo pela primeira vez sob o protocolo de código aberto Apache 2.0.
-
PrismML foi cofundado por Babak Hassibi, professor de engenharia elétrica e matemática computacional no Instituto de Tecnologia da Califórnia (Caltech), e a equipe principal também inclui Sahin Lale, Omead Pooladzandi e Reza Sadri, todos da Caltech. A tecnologia principal da empresa origina-se de muitos anos de pesquisa teórica matemática da escola, com foco na compressão de redes neurais. O professor Hassibi participou da proposta do método de poda de rede neural Optimal Brain Surgeon já na década de 1990 e tem profunda experiência em simplificação de modelos. A PrismML levantou um total de US$ 16,25 milhões em rodadas SAFE e seed, lideradas pela Khosla Ventures, uma conhecida empresa de capital de risco do Vale do Silício, com participação da Cerberus Capital e do California Institute of Technology. Google e Samsung também forneceram poder computacional e suporte à indústria. O investidor Vinod Khosla descreveu esta tecnologia como “um avanço matemático, não outro modelo pequeno” e acredita que o futuro da IA não é definido pelo tamanho do data center, mas pela densidade de inteligência por unidade de consumo e custo de energia. A empresa encerrou o modo furtivo em março de 2026 e lançou seu primeiro produto, o Bonsai 8B de 1 bit, seguido pelo Bonsai Image 4B em maio. O Bonsai 27B é o modelo principal da série Bonsai, marcando o avanço da sua rota de compressão para níveis mais elevados de capacidade. A Apple está supostamente em negociações com o PrismML para avaliação inicial da tecnologia.
-
Bonsai 27B não é um modelo básico treinado do zero, mas uma versão fortemente quantizada baseada no Alibaba Qwen3.6 27B. Ele é extremamente compactado, mantendo o conjunto completo de recursos: janelas de contexto ultralongas de token de 262K, compreensão visual multimodal (HQQ Vision Tower de 4 bits), chamadas de ferramentas estruturadas, loops de agentes operados por computador e decodificação especulativa para acelerar a inferência. O modelo fornece duas variantes de quantificação: a versão Ternary usa pesos de três valores {-1, 0, +1} mais escala de grupo FP16, com um bit efetivo de 1,71 e um volume de 5,9 GB. É orientado para cenários de notebook e busca a qualidade em primeiro lugar; a versão de 1 bit usa pesos binários {-1, +1}, bits efetivos 1,125 e um volume de 3,9 GB. É orientado para cenários de telefonia móvel e busca primeiro o volume. A principal diferença entre os dois é esta: escolher a versão de 1 bit significa aceitar uma perda mais significativa de precisão nas chamadas de ferramentas Agentic, compreensão visual e raciocínio matemático complexo. Em termos de adaptação ao telefone móvel, a memória real disponível para um único aplicativo do iPhone 17 Pro de 12 GB é de cerca de 6 GB. A versão de 1 bit de 3,9 GB mais cache KV e valor de ativação pode caber neste orçamento. Dados oficiais medidos mostram que a versão de 1 bit no iPhone 17 Pro Max consome cerca de 11 tokens/s e cerca de 672 tokens consomem 1% da bateria. No desktop, a versão de 1 bit pode chegar a 163 token/s no RTX 5090, e a versão ternária pode chegar a 134 token/s; no M5 Max Mac, a versão de 1 bit pode atingir 87 token/s, e a versão ternária pode atingir 58 token/s. O feedback real de desenvolvedores independentes (baseado no RTX 3090 executando a versão Q4_K_M GGUF) mostra que a velocidade desta magnitude em placas gráficas de consumo é satisfatória: cerca de 28 token/s no contexto 4K, e ainda 19 token/s no contexto 16K. A extração JSON estruturada e o desempenho do RAG de rodada única são "estáveis e sem alucinações", mas o raciocínio em várias etapas (mais de uma cadeia de chamadas de ferramenta de 3 etapas) tem deficiências óbvias. Testes reais na comunidade chinesa também confirmam isso: o Bonsai 27B pode ser executado em uma placa gráfica antiga de 8 GB (apenas 3,8 GB são necessários), com boa velocidade e precisão, mas o modo de pensamento deve estar ativado para garantir a qualidade da saída.
-
Bonsai 27B é totalmente open source sob o protocolo Apache 2.0. Os pesos podem ser baixados gratuitamente no Hugging Face e o uso comercial é permitido sem autorização. O PrismML também fornece uma API gratuita de visualização do desenvolvedor por tempo limitado (por meio do Together.ai) para facilitar que os desenvolvedores façam a verificação do protótipo antes de puxar pesos. Esta estratégia de negócios é semelhante à estratégia inicial do ecossistema de desenvolvedores da Apple: através do código aberto, o modelo pode ser penetrado em mais produtos e ecossistemas, e uma atitude aberta pode ser usada para estabelecer padrões da indústria e aderência do desenvolvedor. O valor central do modelo do lado do dispositivo é que a inferência é gratuita e os dados não saem do dispositivo, o que é muito atraente para campos sensíveis à privacidade e cenários offline.
-
O feedback real da comunidade mostra que a avaliação geral dos desenvolvedores do Bonsai 27B é positiva, especialmente porque ele “faz o que outros modelos não podem fazer” – permitindo que modelos da classe 27B rodem em telefones celulares. Um desenvolvedor que testou no RTX 3090 fez uma análise detalhada das vantagens e desvantagens: o pipeline de classificação, a extração estruturada e os cenários RAG de rodada única estão “totalmente prontos para produção” e a licença é Apache 2.0, o que significa “pode ser implantado sem revisão legal, o que é muito mais importante do que alguns pontos no benchmark”. Mas ele também destacou que em cenários complexos de loop de agentes, devido à escassez do MoE, o modelo tende a perder pistas em mais de 3 etapas de cadeias de raciocínio e a repetir a etapa anterior em vez de continuar avançando. Um artigo de teste detalhado na comunidade chinesa do Nuggets também apontou que a dimensão de chamada de ferramenta Agentic tem a maior queda (queda de 17,5% na versão de 1 bit), e a queda de usabilidade nos testes reais pode ser mais significativa do que os números. O teste de Toutiao baseado no RTX 2070 8GB fornece uma “classificação de QI” intuitiva: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. A avaliação central é “implantação extremamente simples, boa velocidade, honesta e sem sentido”, mas o modo de pensamento deve estar ativado.
-
A cobertura do Bonsai 27B pela mídia da indústria concentra-se no nível de “marco”. A visão dominante é que o verdadeiro significado deste modelo não reside na pontuação única do benchmark, mas no que ele “normaliza”: um modelo multimodal de nível 27B que vive em hardware de consumo com uma licença flexível e está disponível offline. A CoinDesk apontou, do ponto de vista do financiamento criptográfico, que a IA final elimina o ponto problemático da indústria de criptografia de confiar na infraestrutura em nuvem: os dados do usuário não precisam sair do dispositivo, o que é uma atualização de privacidade significativa para carteiras criptográficas, interfaces DeFi e ferramentas de negociação. As discussões da comunidade Hacker News são mais pragmáticas: reconhecendo os avanços tecnológicos e lembrando repetidamente que as deficiências da quantificação extrema em cenários reais de engenharia não podem ser ignoradas. O blog de análise independente Sean Kim fez o julgamento mais direto: “Executar em um telefone celular” e “combinar com um modelo de precisão total” não são a mesma proposta. Um modelo razoável é uma implantação híbrida: o modelo do lado do dispositivo local lida com tarefas leves e sensíveis à privacidade, e o raciocínio complexo é deixado para a nuvem. No cenário competitivo, Apple, Google e Qualcomm estão promovendo IA de ponta, mas o mainstream permanece em modelos em escala de parâmetros de 3 a 7 bilhões. O Bonsai 27B aumenta diretamente a escala de parâmetros em quase 4 vezes, abrindo a dimensão competitiva da "densidade inteligente". O indicador de densidade de inteligência (valor de capacidade por GB) proposto pelo PrismML mostra que o Bonsai 27B de 1 bit é 0,53/GB, o que é mais de 10 vezes a linha de base de precisão total.
-
A principal controvérsia em torno do Bonsai 27B centra-se na medida em que a quantificação extrema corrói as capacidades da Agente. O benchmark oficial mostra que a versão de 1 bit caiu 17,5% na dimensão de chamada de ferramenta, mas os testes da comunidade acreditam que a queda real pode ser mais significativa. Alguns desenvolvedores apontaram que o modelo tende a “descartar a cadeia” após a terceira camada de inferência, o que é suficiente para tornar todo o processo inutilizável em cenários de agente severos. Outro ponto de discussão é que “Bonsai 27B não é um modelo novo, mas sim um pacote”. Os críticos acreditam que o PrismML não treinou seu próprio modelo básico, mas fez um empacotamento quantitativo baseado no Qwen3.6. Embora a tecnologia de compressão em si seja inovadora, resta saber quão altas são as barreiras técnicas e se outras equipas conseguem reproduzir rapidamente efeitos semelhantes. Perguntas sobre capacidade visual não podem ser ignoradas: a versão de 1 bit do MMMU Pro/OCRBench obteve apenas 59,6, uma queda significativa em relação à linha de base de 72,6, indicando que a quantização extrema tem um impacto maior na compreensão visual do que tarefas de texto.
-
O Bonsai 27B é adequado para os seguintes desenvolvedores: desenvolvedores de aplicativos móveis que precisam de recursos de IA locais off-line; cenários sensíveis à privacidade (processamento de documentos médicos, jurídicos e financeiros); pesquisadores que precisam executar modelos de nível 27B em placas gráficas de consumo (VRAM de 8 a 12 GB); e pipelines de processamento de texto que não exigem alta precisão de chamada de ferramenta. Não é recomendado o uso nos seguintes cenários: sistemas de produção que exigem recursos Agentic estáveis de várias etapas, pipelines de compreensão visual de alta precisão e tarefas complexas de raciocínio matemático. A estratégia de implantação mais razoável atualmente é uma arquitetura híbrida: Bonsai 27B (versão ternária) serve como a força principal no lado do cliente local e é usado para tarefas com requisitos sensíveis à privacidade e de baixa latência; o grande modelo de nuvem lida com raciocínios complexos e cenários que exigem alta precisão. Essa pilha só será verdadeiramente viável em 2026 – porque a extremidade local finalmente terá um modelo forte o suficiente.
-
Bonsai 27B é um nó icônico no desenvolvimento de IA do lado do dispositivo: ele permite que “modelos de nível 27B sejam instalados em telefones celulares” de serem teoricamente discutíveis para realmente serem baixados e executáveis. A retenção da precisão em peças de trabalho estruturadas, como matemática e programação, é aceitável, mas as deficiências em tarefas ativas e visuais também são bastante óbvias. Como modelo de código aberto do lado do cliente do Apache 2.0, ele fornece aos desenvolvedores um novo nível de pilha - não uma substituição abrangente, mas uma nova opção que não existia antes. Desde julho de 2026, é o maior passo no caminho para a IA do lado do dispositivo, mas não o último.
Avaliações de usuários
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。