Bonsai 27B
Das erste multimodale Großmodell der 27B-Klasse, das lokal auf dem Smartphone läuft – per Extremquantisierung von Alibabas Qwen3.6 27B auf 3,9 GB komprimiert
Ausführlicher Bericht
-
Am 14. Juli 2026 veröffentlichte PrismML, ein KI-Startup mit Hintergrund bei Caltech, Bonsai 27B, das weltweit erste multimodale Großmodell auf 27B-Ebene, das lokal auf einem Smartphone ausgeführt werden kann. Basierend auf der Alibaba Qwen3.6 27B-Basis wird das Modell durch extreme Low-Bit-Quantisierung auf 3,9 GB (1-Bit-Version) und 5,9 GB (dreiwertige Version) komprimiert. Unter Beibehaltung von etwa 90–95 % der Benchmark-Leistung ist die 27 Milliarden Argumentationsfunktion auf Parameterebene zum ersten Mal kostenlos auf Verbraucherhardware unter dem Open-Source-Protokoll Apache 2.0 verfügbar.
-
PrismML wurde von Babak Hassibi, Professor für Elektrotechnik und Computermathematik am California Institute of Technology (Caltech), mitbegründet. Zum Kernteam gehören außerdem Sahin Lale, Omead Pooladzandi und Reza Sadri, alle vom Caltech. Die Kerntechnologie des Unternehmens stammt aus der langjährigen mathematisch-theoretischen Forschung der Schule mit Schwerpunkt auf der Komprimierung neuronaler Netze. Professor Hassibi beteiligte sich bereits in den 1990er-Jahren am Vorschlag der neuronalen Netzbereinigungsmethode „Optimal Brain Surgeon“ und verfügt über umfassende Erfahrung in der Modellvereinfachung. PrismML hat in SAFE- und Seed-Runden unter der Leitung von Khosla Ventures, einer bekannten Risikokapitalgesellschaft aus dem Silicon Valley, unter Beteiligung von Cerberus Capital und dem California Institute of Technology insgesamt 16,25 Millionen US-Dollar eingesammelt. Auch Google und Samsung stellten Rechenleistung und Branchenunterstützung zur Verfügung. Investor Vinod Khosla beschrieb diese Technologie als „einen mathematischen Durchbruch, nicht als ein weiteres kleines Modell“ und glaubte, dass die Zukunft der KI nicht durch die Größe des Rechenzentrums, sondern durch die Intelligenzdichte pro Energieeinheit und Kosten definiert wird. Das Unternehmen beendete den Stealth-Modus im März 2026 und veröffentlichte sein erstes Produkt, den 1-Bit-Bonsai 8B, gefolgt vom Bonsai Image 4B im Mai. Der Bonsai 27B ist das Flaggschiffmodell der Bonsai-Serie und markiert die Weiterentwicklung seiner Komprimierungsmethode auf ein höheres Leistungsniveau. Berichten zufolge befindet sich Apple in Gesprächen mit PrismML für eine frühe Technologiebewertung.
-
Bonsai 27B ist kein von Grund auf trainiertes Basismodell, sondern eine stark quantisierte Version basierend auf Alibaba Qwen3.6 27B. Es ist extrem komprimiert, behält aber den vollen Funktionsumfang bei: ultralange Kontextfenster mit 262 K-Token, multimodales visuelles Verständnis (4-Bit HQQ Vision Tower), strukturierte Tool-Aufrufe, computergesteuerte Agentenschleifen und spekulative Dekodierung zur Beschleunigung der Inferenz. Das Modell bietet zwei Quantifizierungsvarianten: Die Ternary-Version verwendet dreiwertige Gewichte {-1, 0, +1} plus FP16-Gruppenskalierung mit einem effektiven Bit von 1,71 und einem Volumen von 5,9 GB. Es orientiert sich an Notebook-Szenarien und strebt zunächst nach Qualität; Die 1-Bit-Version verwendet Binärgewichte {-1, +1}, effektive Bits 1,125 und ein Volumen von 3,9 GB. Es orientiert sich an Mobiltelefonszenarien und strebt zunächst nach Volumen. Der Hauptunterschied zwischen den beiden ist folgender: Die Wahl der 1-Bit-Version bedeutet, einen größeren Verlust an Präzision bei Agentic-Tool-Aufrufen, visuellem Verständnis und komplexer mathematischer Argumentation in Kauf zu nehmen. Im Hinblick auf die Anpassung an Mobiltelefone beträgt der tatsächlich verfügbare Einzelanwendungsspeicher des 12-GB-Speichers des iPhone 17 Pro etwa 6 GB. Die 1-Bit-Version mit 3,9 GB plus KV-Cache und Aktivierungswert passt gerade noch in dieses Budget. Offizielle Messdaten zeigen, dass die 1-Bit-Version auf dem iPhone 17 Pro Max etwa 11 Token/s beträgt und etwa 672 Token 1 % des Akkus verbrauchen. Auf dem Desktop kann die 1-Bit-Version auf dem RTX 5090 163 Token/s erreichen, und die ternäre Version kann 134 Token/s erreichen; Auf dem M5 Max Mac kann die 1-Bit-Version 87 Token/s und die ternäre Version 58 Token/s erreichen. Tatsächliches Feedback unabhängiger Entwickler (basierend auf RTX 3090 mit der Q4_K_M GGUF-Version) zeigt, dass die Geschwindigkeit dieser Größenordnung auf Consumer-Grafikkarten zufriedenstellend ist: etwa 28 Token/s im 4K-Kontext und immer noch 19 Token/s im 16K-Kontext. Die strukturierte JSON-Extraktion und die RAG-Leistung in einer Runde sind „stabil und ohne Halluzinationen“, aber das mehrstufige Denken (mehr als dreistufige Tool-Aufrufkette) weist offensichtliche Mängel auf. Auch tatsächliche Tests in der chinesischen Community bestätigen dies: Bonsai 27B kann auf einer alten 8-GB-Grafikkarte (nur 3,8 GB sind erforderlich) mit guter Geschwindigkeit und Genauigkeit laufen, allerdings muss der Denkmodus aktiviert sein, um die Ausgabequalität sicherzustellen.
-
Bonsai 27B ist vollständig Open Source unter dem Apache 2.0-Protokoll. Die Gewichte können kostenlos von Hugging Face heruntergeladen werden und die kommerzielle Nutzung ist ohne Genehmigung gestattet. PrismML bietet außerdem eine zeitlich begrenzte kostenlose Entwickler-Vorschau-API (über Together.ai), um Entwicklern die Überprüfung von Prototypen zu erleichtern, bevor sie Gewichte ziehen. Diese Geschäftsstrategie ähnelt der frühen Entwickler-Ökosystem-Strategie von Apple: Durch Open Source kann das Modell in mehr Produkte und Ökosysteme eindringen, und eine offene Haltung kann genutzt werden, um Industriestandards und Entwicklerbindung zu etablieren. Der Kernwert des geräteseitigen Modells besteht darin, dass die Inferenz kostenlos ist und die Daten das Gerät nicht verlassen, was für datenschutzrelevante Bereiche und Offline-Szenarien sehr attraktiv ist.
-
Echtes Feedback aus der Community zeigt, dass die Entwickler den Bonsai 27B insgesamt positiv bewerten, insbesondere, dass er „das tut, was andere Modelle nicht können“ – nämlich die Ausführung von Modellen der 27B-Klasse auf Mobiltelefonen. Ein Entwickler, der auf RTX 3090 getestet hat, hat die Vor- und Nachteile detailliert analysiert: Die Klassifizierungspipeline, die strukturierte Extraktion und die Einzelrunden-RAG-Szenarien seien „vollständig produktionsbereit“, und die Lizenz sei Apache 2.0, was bedeutet, dass „sie ohne rechtliche Prüfung bereitgestellt werden kann, was viel wichtiger ist als ein paar Punkte im Benchmark.“ Er wies jedoch auch darauf hin, dass das Modell in komplexen Agentenschleifenszenarien aufgrund der spärlichen MoE dazu neigt, in mehr als drei Schritten der Argumentationsketten Hinweise zu verlieren und den vorherigen Schritt zu wiederholen, anstatt weiter voranzukommen. In einem ausführlichen Testartikel der chinesischen Nuggets-Community wurde außerdem darauf hingewiesen, dass die Aufrufdimension des Agentic-Tools den größten Rückgang aufweist (17,5 % Rückgang in der 1-Bit-Version) und dass der Rückgang der Benutzerfreundlichkeit bei tatsächlichen Tests möglicherweise erheblicher ist als die Zahlen. Der auf RTX 2070 8GB basierende Test von Toutiao liefert ein intuitives „IQ-Ranking“: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. Die Kernbewertung lautet „extrem einfache Bereitstellung, gute Geschwindigkeit, Ehrlichkeit und kein Unsinn“, aber der Denkmodus muss eingeschaltet sein.
-
Die Berichterstattung der Branchenmedien über Bonsai 27B konzentriert sich auf die „Meilenstein“-Ebene. Die allgemeine Ansicht ist, dass die wahre Bedeutung dieses Modells nicht im einzelnen Benchmark-Score liegt, sondern in dem, was es „normalisiert“: ein multimodales Modell der 27B-Ebene, das auf Consumer-Hardware mit einer losen Lizenz läuft und offline verfügbar ist. CoinDesk wies aus Sicht der Krypto-Finanzierung darauf hin, dass endseitige KI das Problem der Verschlüsselungsbranche beseitigt, der Cloud-Infrastruktur zu vertrauen: Benutzerdaten müssen das Gerät nicht verlassen, was eine sinnvolle Verbesserung der Privatsphäre für Krypto-Wallets, DeFi-Schnittstellen und Handelstools darstellt. Die Diskussionen in der Hacker News-Community sind pragmatischer: Sie würdigen technologische Durchbrüche und erinnern gleichzeitig immer wieder daran, dass die Mängel extremer Quantifizierung in realen technischen Szenarien nicht ignoriert werden können. Der unabhängige Analyseblog Sean Kim urteilte am deutlichsten: „Laufen auf einem Mobiltelefon“ und „Anpassen an ein Modell mit voller Präzision“ sind nicht dasselbe. Ein sinnvolles Modell ist eine Hybridbereitstellung: Das lokale geräteseitige Modell übernimmt einfache, datenschutzrelevante Aufgaben und komplexe Überlegungen werden der Cloud überlassen. Im Wettbewerbsumfeld fördern Apple, Google und Qualcomm allesamt End-Side-KI, der Mainstream bleibt jedoch bei Modellen mit einer Parameterskala von 3–7 Milliarden. Bonsai 27B erhöht die Parameterskala direkt um fast das Vierfache und eröffnet damit die Wettbewerbsdimension „intelligente Dichte“. Der von PrismML vorgeschlagene Indikator für die Intelligenzdichte (Fähigkeitswert pro GB) zeigt, dass 1-Bit-Bonsai 27B 0,53/GB beträgt, was mehr als dem Zehnfachen der Basislinie mit voller Präzision entspricht.
-
Die Hauptkontroverse rund um Bonsai 27B dreht sich um das Ausmaß, in dem extreme Quantifizierung die Fähigkeiten von Agenten untergräbt. Der offizielle Benchmark zeigt, dass die 1-Bit-Version in der Tool-Call-Dimension um 17,5 % gesunken ist, aber Community-Tests gehen davon aus, dass der tatsächliche Rückgang möglicherweise noch deutlicher ausfällt. Einige Entwickler wiesen darauf hin, dass das Modell dazu neigt, nach der dritten Inferenzschicht „die Kette fallen zu lassen“, was ausreicht, um den gesamten Prozess in schwerwiegenden Agentenszenarien unbrauchbar zu machen. Ein weiterer Diskussionspunkt ist, dass „Bonsai 27B kein neues Modell, sondern ein Paket“ ist. Kritiker glauben, dass PrismML kein eigenes Grundmodell trainiert, sondern eine quantitative Verpackung auf Basis von Qwen3.6 durchgeführt hat. Obwohl die Komprimierungstechnologie selbst bahnbrechend ist, bleibt abzuwarten, wie hoch die technischen Hürden sind und ob andere Teams ähnliche Effekte schnell reproduzieren können. Fragen zur visuellen Fähigkeit können nicht ignoriert werden: Die 1-Bit-Version von MMMU Pro/OCRBench erreichte nur 59,6, ein deutlicher Rückgang gegenüber dem Ausgangswert von 72,6, was darauf hindeutet, dass extreme Quantisierung einen größeren Einfluss auf das visuelle Verständnis hat als Textaufgaben.
-
Bonsai 27B eignet sich für folgende Entwickler: Entwickler mobiler Anwendungen, die Offline-KI-Funktionen vor Ort benötigen; Datenschutzsensible Szenarien (medizinische, rechtliche, finanzielle Dokumentenverarbeitung); Forscher, die Modelle der 27B-Ebene auf Grafikkarten der Verbraucherklasse (8–12 GB VRAM) ausführen müssen; und Textverarbeitungspipelines, die keine hohe Tool-Aufrufgenauigkeit erfordern. Die Verwendung in den folgenden Szenarien wird nicht empfohlen: Produktionssysteme, die stabile mehrstufige Agentenfunktionen, hochpräzise visuelle Verständnispipelines und komplexe mathematische Argumentationsaufgaben erfordern. Die derzeit sinnvollste Bereitstellungsstrategie ist eine Hybridarchitektur: Bonsai 27B (Ternary-Version) dient als Hauptkraft auf der lokalen Clientseite und wird für Aufgaben mit datenschutzrelevanten Anforderungen und geringen Latenzanforderungen verwendet. Das große Cloud-Modell verarbeitet komplexe Überlegungen und Szenarien, die eine hohe Genauigkeit erfordern. Dieser Stack wird erst im Jahr 2026 wirklich realisierbar sein – weil die lokale Seite endlich über ein ausreichend starkes Modell verfügt.
-
Bonsai 27B ist ein ikonischer Knotenpunkt in der Entwicklung geräteseitiger KI: Es ermöglicht die Installation von „27B-Level-Modellen auf Mobiltelefonen“, von theoretisch diskutierbar bis hin zu tatsächlich herunterladbar und ausführbar. Die Genauigkeitserhaltung bei strukturierten Werkstücken wie Mathematik und Programmierung ist akzeptabel, aber auch die Mängel bei Agenten- und visuellen Aufgaben sind offensichtlich genug. Als Open-Source-Client-Modell von Apache 2.0 bietet es Entwicklern eine neue Stack-Ebene – keinen umfassenden Ersatz, sondern eine neue Option, die es zuvor nicht gab. Ab Juli 2026 ist es der größte Schritt auf dem Weg zur geräteseitigen KI, aber nicht der letzte.
Nutzerbewertungen
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。