Bonsai 27B
Первая мультимодальная большая модель класса 27B, работающая локально на смартфоне: сжата до 3,9 ГБ из Qwen3.6 27B от Alibaba путём экстремального квантования
Подробный отчёт
-
14 июля 2026 года PrismML, стартап в области искусственного интеллекта с опытом работы в Калифорнийском технологическом институте, выпустил Bonsai 27B, первую в мире мультимодальную большую модель уровня 27B, которая может работать локально на смартфоне. Основанная на базе Alibaba Qwen3.6 27B, модель сжимается до 3,9 ГБ (1-битная версия) и 5,9 ГБ (трехзначная версия) посредством экстремально низкого битового квантования. При сохранении примерно 90–95 % производительности эталонных тестов возможности рассуждения на уровне 27 миллиардов параметров впервые доступны бесплатно на потребительском оборудовании по протоколу с открытым исходным кодом Apache 2.0.
-
Сооснователем PrismML выступил Бабак Хассиби, профессор электротехники и вычислительной математики Калифорнийского технологического института (Калифорнийский технологический институт), а в основную команду также входят Шахин Лале, Омиад Пуладзанди и Реза Садри — все из Калифорнийского технологического института. Основная технология компании основана на многолетних математических теоретических исследованиях школы, посвященных сжатию нейронных сетей. Профессор Хассиби участвовал в предложении метода сокращения нейронных сетей Optimal Brain Surgeon еще в 1990-х годах и имеет большой опыт упрощения моделей. PrismML привлекла в общей сложности 16,25 млн долларов США в рамках SAFE и начальных раундов под руководством Khosla Ventures, известной венчурной компании Кремниевой долины, при участии Cerberus Capital и Калифорнийского технологического института. Google и Samsung также предоставили вычислительную мощность и отраслевую поддержку. Инвестор Винод Хосла назвал эту технологию «математическим прорывом, а не очередной маленькой моделью» и полагал, что будущее ИИ определяется не размером центра обработки данных, а плотностью интеллекта на единицу энергопотребления и стоимости. Компания завершила скрытый режим в марте 2026 года и выпустила свой первый продукт — 1-bit Bonsai 8B, а в мае — Bonsai Image 4B. Bonsai 27B — флагманская модель серии Bonsai, знаменующая продвижение технологии сжатия на более высокий уровень возможностей. Сообщается, что Apple ведет переговоры с PrismML о ранней оценке технологий.
-
Bonsai 27B — это не базовая модель, обученная с нуля, а сильно квантованная версия на базе Alibaba Qwen3.6 27B. Он чрезвычайно сжат, сохраняя при этом полный набор функций: сверхдлинные контекстные окна на 262 тыс. токенов, мультимодальное визуальное понимание (4-битная HQQ Vision Tower), структурированные вызовы инструментов, управляемые компьютером циклы агентов и спекулятивное декодирование для ускорения вывода. Модель предоставляет два варианта количественной оценки: троичная версия использует трехзначные веса {-1, 0, +1} плюс групповое масштабирование FP16 с эффективным битом 1,71 и объемом 5,9 ГБ. Он ориентирован на сценарии использования ноутбуков и в первую очередь уделяет внимание качеству; 1-битная версия использует двоичные веса {-1, +1}, эффективные биты 1,125 и объем 3,9 ГБ. Он ориентирован на сценарии использования мобильных телефонов и в первую очередь ориентирован на объем. Ключевое различие между ними заключается в следующем: выбор 1-битной версии означает более значительную потерю точности в вызовах агентских инструментов, визуальном понимании и сложных математических рассуждениях. С точки зрения адаптации мобильного телефона фактически доступная память для одного приложения на iPhone 17 Pro объемом 12 ГБ составляет около 6 ГБ. 1-битная версия объемом 3,9 ГБ плюс KV-кэш и стоимость активации могут как раз вписаться в этот бюджет. Официальные данные измерений показывают, что 1-битная версия на iPhone 17 Pro Max составляет около 11 токенов/с, а около 672 токенов потребляют 1% заряда батареи. На настольном компьютере 1-битная версия может достигать 163 токенов/с на RTX 5090, а троичная версия может достигать 134 токенов/с; на M5 Max Mac 1-битная версия может достигать 87 токенов/с, а троичная версия — 58 токенов/с. Фактические отзывы независимых разработчиков (на основе RTX 3090 с версией Q4_K_M GGUF) показывают, что скорость такого масштаба на видеокартах потребительского уровня является удовлетворительной: около 28 токенов/с в контексте 4K и все еще 19 токенов/с в контексте 16K. Структурированное извлечение JSON и производительность RAG за один раунд являются «стабильными и без галлюцинаций», но многоэтапное рассуждение (более чем трехэтапная цепочка вызовов инструментов) имеет очевидные недостатки. Реальное тестирование в китайском сообществе также подтверждает это: Bonsai 27B может работать на старой видеокарте емкостью 8 ГБ (требуется только 3,8 ГБ) с хорошей скоростью и точностью, но для обеспечения качества вывода необходимо включить режим мышления.
-
Bonsai 27B имеет полностью открытый исходный код и работает по протоколу Apache 2.0. Гири можно бесплатно загрузить с Hugging Face, а коммерческое использование разрешено без разрешения. PrismML также предоставляет ограниченный по времени бесплатный API предварительного просмотра для разработчиков (через Together.ai), который помогает разработчикам выполнять проверку прототипа перед тем, как набирать вес. Эта бизнес-стратегия похожа на раннюю стратегию экосистемы разработчиков Apple: благодаря открытому исходному коду модель можно внедрить в большее количество продуктов и экосистем, а открытый подход можно использовать для установления отраслевых стандартов и повышения лояльности разработчиков. Основная ценность модели на стороне устройства заключается в том, что вывод бесплатен и данные не покидают устройство, что очень привлекательно для полей, чувствительных к конфиденциальности, и автономных сценариев.
-
Реальные отзывы сообщества показывают, что общая оценка Bonsai 27B разработчиками положительная, особенно то, что он «делает то, что не могут сделать другие модели» — позволяет моделям класса 27B работать на мобильных телефонах. Разработчик, проводивший тестирование на RTX 3090, дал подробный анализ преимуществ и недостатков: конвейер классификации, структурированное извлечение и однораундовые сценарии RAG «полностью готовы к работе», а лицензия — Apache 2.0, что означает «ее можно развернуть без юридической проверки, что гораздо важнее, чем несколько баллов в тесте». Но он также отметил, что в сложных сценариях цикла агентов из-за разреженности MoE модель склонна терять подсказки на более чем трех этапах цепочки рассуждений и повторять предыдущий шаг вместо продолжения продвижения. В подробной тестовой статье, опубликованной в китайском сообществе Nuggets, также указывается, что параметр вызова агентских инструментов имеет самое большое падение (падение на 17,5 % в 1-битной версии), а снижение удобства использования в реальном тестировании может быть более значительным, чем цифры. Тест Тутиао на основе RTX 2070 8 ГБ дает интуитивно понятный «рейтинг IQ»: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. Основная оценка — «чрезвычайно простое развертывание, хорошая скорость, честность и отсутствие глупостей», но необходимо включить режим мышления.
-
Освещение Бонсай 27B в отраслевых СМИ сосредоточено на «этапном» уровне. Основная точка зрения заключается в том, что реальная значимость этой модели заключается не в одном балле теста, а в том, что она «нормализует»: мультимодальная модель уровня 27B, которая работает на оборудовании потребительского уровня со свободной лицензией и доступна в автономном режиме. CoinDesk отметил с точки зрения криптофинансирования, что конечный ИИ устраняет болезненную точку индустрии шифрования, связанную с доверием к облачной инфраструктуре: пользовательские данные не должны покидать устройство, что является значимым обновлением конфиденциальности для криптокошельков, интерфейсов DeFi и торговых инструментов. Дискуссии сообщества Hacker News более прагматичны: признание технологических прорывов и постоянное напоминание о том, что нельзя игнорировать недостатки экстремальных количественных оценок в реальных инженерных сценариях. Независимый аналитический блог Шон Ким дал самое прямое суждение: «Работа на мобильном телефоне» и «соответствие модели с полной точностью» — это не одно и то же. Разумная модель — это гибридное развертывание: модель на стороне локального устройства решает легкие, чувствительные к конфиденциальности задачи, а сложные рассуждения оставляются в облаке. В конкурентной среде Apple, Google и Qualcomm продвигают конечный ИИ, но основным направлением остаются модели с масштабом параметров 3–7B. Bonsai 27B напрямую увеличивает шкалу параметров почти в 4 раза, открывая конкурентное измерение «интеллектуальной плотности». Показатель плотности интеллекта (значение емкости на ГБ), предложенный PrismML, показывает, что 1-битный Bonsai 27B составляет 0,53/ГБ, что более чем в 10 раз превышает базовый уровень полной точности.
-
Основные разногласия вокруг Бонсай 27B сосредоточены вокруг того, насколько экстремальная количественная оценка подрывает возможности Агентов. Официальный тест показывает, что 1-битная версия упала на 17,5% по измерению вызовов инструментов, но тестирование сообщества показывает, что фактическое падение может быть более значительным. Некоторые разработчики отметили, что модель имеет тенденцию «обрывать цепочку» после третьего уровня вывода, чего достаточно, чтобы сделать весь процесс непригодным для использования в тяжелых агентных сценариях. Еще один спорный момент: «Бонсай 27Б — это не новая модель, а пакет». Критики считают, что PrismML не обучал собственную базовую модель, а делал количественную упаковку на основе Qwen3.6. Хотя сама технология сжатия является новаторской, еще неизвестно, насколько высоки технические барьеры и смогут ли другие команды быстро воспроизвести аналогичные эффекты. Нельзя игнорировать вопросы о зрительных способностях: 1-битная версия MMMU Pro/OCRBench набрала всего 59,6 балла, что значительно ниже базового показателя в 72,6, что указывает на то, что экстремальное квантование оказывает большее влияние на визуальное понимание, чем текстовые задачи.
-
Bonsai 27B подходит для следующих разработчиков: разработчиков мобильных приложений, которым необходимы автономные локальные возможности искусственного интеллекта; сценарии, чувствительные к конфиденциальности (обработка медицинских, юридических, финансовых документов); исследователи, которым необходимо запускать модели уровня 27B на видеокартах потребительского уровня (8–12 ГБ видеопамяти); и конвейеры обработки текста, не требующие высокой точности вызова инструментов. Не рекомендуется использовать в следующих сценариях: производственные системы, требующие стабильных многоэтапных агентских возможностей, высокоточных конвейеров визуального понимания и сложных математических задач. Наиболее разумной стратегией развертывания в настоящее время является гибридная архитектура: Bonsai 27B (тройная версия) служит основной силой на стороне локального клиента и используется для задач с требованиями конфиденциальности и малой задержки; Большая облачная модель обрабатывает сложные рассуждения и сценарии, требующие высокой точности. Этот стек станет по-настоящему осуществимым только в 2026 году, потому что на местном уровне наконец-то появилась достаточно сильная модель.
-
Bonsai 27B — знаковый узел в разработке искусственного интеллекта на стороне устройства: он позволяет «устанавливать модели уровня 27B на мобильные телефоны» из теоретически обсуждаемых моделей в фактически доступные для загрузки и запуска. Сохранение точности на структурированных задачах, таких как математика и программирование, приемлемо, но недостатки на агентных и визуальных задачах также достаточно очевидны. Будучи клиентской моделью Apache 2.0 с открытым исходным кодом, она предоставляет разработчикам новый уровень стека — не полную замену, а новую опцию, которой раньше не существовало. По состоянию на июль 2026 года это самый большой шаг на пути к искусственному интеллекту на стороне устройства, но не последний.
Отзывы пользователей
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。