Bonsai 27B
スマートフォン上でローカル動作する初の27Bクラス・マルチモーダル大規模モデル。アリババのQwen3.6 27Bをベースに極限量子化で3.9GBまで圧縮
詳細レポート
-
2026 年 7 月 14 日、カリフォルニア工科大学での経歴を持つ AI スタートアップ企業である PrismML は、スマートフォン上でローカルに実行できる世界初の 27B レベルのマルチモーダル大型モデルである Bonsai 27B をリリースしました。このモデルは、Alibaba Qwen3.6 27B ベースをベースに、極低ビット量子化により 3.9GB (1 ビット バージョン) と 5.9GB (3 値バージョン) に圧縮されています。ベンチマーク パフォーマンスの約 90 ~ 95% を維持しながら、270 億のパラメーター レベルの推論機能が、Apache 2.0 オープン ソース プロトコルの下で初めてコンシューマー ハードウェアで無料で利用できるようになりました。
-
PrismML は、カリフォルニア工科大学 (カリフォルニア工科大学) の電気工学および計算数学の教授である Babak Hassibi によって共同設立されました。コア チームには、カリフォルニア工科大学の Sahin Lale、Omead Pooladzandi、Reza Sadri も含まれています。同社の中核技術は、ニューラル ネットワーク圧縮に焦点を当てた同校の長年にわたる数学理論研究に由来しています。 Hassibi 教授は、1990 年代にはすでにニューラル ネットワークの枝刈り手法である Optimal Brain Surgeon の提案に参加しており、モデルの単純化において豊富な経験を持っています。 PrismML は、シリコンバレーの有名なベンチャー キャピタル会社である Khosla Ventures が主導し、Cerberus Capital とカリフォルニア工科大学の参加を得て、SAFE ラウンドとシード ラウンドで総額 1,625 万米ドルを調達しました。 Google と Samsung もコンピューティング能力と業界サポートを提供しました。投資家のヴィノッド・コスラ氏は、このテクノロジーを「別の小さなモデルではなく、数学的なブレークスルー」と表現し、AIの将来はデータセンターの規模ではなく、単位エネルギー消費量とコストあたりのインテリジェンスの密度によって決まると信じている。 同社は2026年3月にステルスモードを終了し、最初の製品である1ビットBonsai 8Bをリリースし、続いて5月にBonsai Image 4Bをリリースした。 Bonsai 27B は、Bonsai シリーズのフラッグシップ モデルで、コンプレッション ルートをより高いレベルの能力に進化させました。伝えられるところによると、Apple は初期の技術評価に向けて PrismML と協議中です。
-
Bonsai 27B は、ゼロからトレーニングされた基本モデルではなく、Alibaba Qwen3.6 27B に基づいて高度に量子化されたバージョンです。これは、262K トークンの超長いコンテキスト ウィンドウ、マルチモーダルな視覚的理解 (4 ビット HQQ ビジョン タワー)、構造化ツール呼び出し、コンピューター操作のエージェント ループ、推論を高速化するための投機的デコードなどの完全な機能セットを保持しながら、非常に圧縮されています。 このモデルには 2 つの定量化バリアントが用意されています。3 値バージョンでは、3 値の重み {-1、0、+1} と FP16 グループ スケーリングが使用され、有効ビットは 1.71、ボリュームは 5.9GB です。ノートブックのシナリオを重視し、品質を第一に追求します。 1 ビット バージョンでは、バイナリの重み {-1, +1}、有効ビット 1.125、およびボリューム 3.9 GB が使用されます。携帯電話の使用シーンを重視し、ボリュームを第一に追求しました。 2 つの主な違いは次のとおりです。1 ビット バージョンを選択すると、エージェント ツールの呼び出し、視覚的な理解、および複雑な数学的推論の精度がより大幅に低下することを受け入れることになります。 携帯電話への適応に関しては、12GBメモリのiPhone 17 Proで実際に利用可能なシングルアプリケーションメモリは約6GBです。 1 ビット バージョンの 3.9GB に KV キャッシュとアクティベーション値を加えれば、この予算にちょうど収まります。公式の測定データによると、iPhone 17 Pro Max の 1 ビット バージョンは約 11 トークン/秒で、約 672 トークンがバッテリーの 1% を消費します。デスクトップでは、RTX 5090 で 1 ビット バージョンは 163 トークン/秒に達し、3 進バージョンは 134 トークン/秒に達します。 M5 Max Mac では、1 ビット バージョンは 87 トークン/秒に達し、3 進バージョンは 58 トークン/秒に達します。 独立系開発者からの実際のフィードバック (Q4_K_M GGUF バージョンを実行している RTX 3090 に基づく) では、コンシューマー グレードのグラフィック カードでこの程度の速度は満足のいくものであることが示されています。4K コンテキストでは約 28 トークン/秒、16K コンテキストでは依然として 19 トークン/秒です。構造化 JSON 抽出とシングルラウンド RAG のパフォーマンスは「安定しており、幻覚はありません」が、マルチステップ推論 (3 ステップ以上のツール呼び出しチェーン) には明らかな欠点があります。中国コミュニティでの実際のテストでもこれが確認されています。Bonsai 27B は古い 8GB グラフィックス カード (3.8GB のみが必要) で良好な速度と精度で実行できますが、出力品質を確保するには思考モードをオンにする必要があります。
-
Bonsai 27B は、Apache 2.0 プロトコルに基づく完全なオープンソースです。ウェイトはHugging Faceから無料でダウンロードでき、商用利用は許可なく許可されています。 PrismML は、開発者が重みを引き出す前にプロトタイプの検証を容易にするために、期間限定の無料の開発者プレビュー API (Togetter.ai 経由) も提供します。 このビジネス戦略は、Apple の初期の開発者エコシステム戦略に似ています。オープンソースを通じて、このモデルをより多くの製品やエコシステムに浸透させることができ、オープンな姿勢を利用して業界標準と開発者の粘り強さを確立することができます。デバイス側モデルの核となる価値は、推論が無料であり、データがデバイスの外に流出しないことです。これは、プライバシーが重視される分野やオフライン シナリオにとって非常に魅力的です。
-
コミュニティからの実際のフィードバックは、Bonsai 27B に対する開発者の全体的な評価が肯定的であり、特に「他のモデルができないことを実行する」、つまり 27B クラスのモデルを携帯電話で実行できることを示しています。 RTX 3090 でテストした開発者は、長所と短所の詳細な分析を提供しました。分類パイプライン、構造化抽出、およびシングルラウンド RAG シナリオは「完全に実稼働対応」であり、ライセンスは Apache 2.0 です。これは、「法的審査なしで導入できることを意味します。これは、ベンチマークのいくつかのポイントよりもはるかに重要です」。しかし、複雑なエージェント ループ シナリオでは、MoE が希薄であるため、モデルは推論チェーンの 3 ステップを超えるステップで手がかりを失い、前進し続けるのではなく前のステップを繰り返す傾向があるとも指摘しました。 Nuggets の中国語コミュニティに関する詳細なテスト記事では、Agentic ツール呼び出しのディメンションが最も大きく低下しており (1 ビット バージョンでは 17.5% の低下)、実際のテストでのユーザビリティの低下は数値よりも重大である可能性があると指摘しています。 RTX 2070 8GB に基づく Toutiao のテストでは、直感的な「IQ ランキング」が得られます: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B。核となる評価は「展開が非常にシンプル、スピードが良く、誠実でナンセンスがない」ですが、思考モードをオンにする必要があります。
-
Bonsai 27B に関する業界メディアの報道は、「マイルストーン」レベルに焦点を当てています。主流の見解は、このモデルの真の重要性は単一のベンチマーク スコアにあるのではなく、それが「正規化」するもの、つまり緩やかなライセンスを持つ消費者グレードのハードウェア上に存在し、オフラインで利用できる 27B レベルのマルチモーダル モデルにあるというものです。 CoinDeskは、暗号通貨金融の観点から、エンドサイドAIはクラウドインフラを信頼するという暗号化業界の問題点を解消すると指摘した。つまり、ユーザーデータがデバイスから流出する必要がなく、これは暗号通貨ウォレット、DeFiインターフェース、取引ツールにとって有意義なプライバシーアップグレードとなる。 Hacker News コミュニティの議論はより現実的であり、技術的なブレークスルーを認めながら、実際のエンジニアリング シナリオにおける極端な定量化の欠点は無視できないことを繰り返し思い出させます。 独立系分析ブログの Sean Kim は、「携帯電話上で実行する」ことと「完全精度のモデルを一致させる」ことは同じ命題ではない、と最も直接的な判断を下しました。合理的なモデルはハイブリッド展開です。ローカルのデバイス側モデルは軽量でプライバシーに配慮したタスクを処理し、複雑な推論はクラウドに任せられます。 競争環境から見ると、Apple、Google、Qualcomm はいずれもエンドサイド AI を推進していますが、主流は依然として 3 ~ 7B のパラメーター スケール モデルです。 Bonsai 27B はパラメータのスケールを 4 倍近く直接増加させ、「インテリジェントな密度」という競争力の次元を開拓します。 PrismML によって提案された知能密度指標 (GB あたりの能力値) は、1 ビット Bonsai 27B が 0.53/GB であることを示しており、これは完全精度ベースラインの 10 倍以上です。
-
Bonsai 27B を巡る主な論争は、極端な定量化がエージェントの能力をどの程度まで侵食するかに焦点が当てられています。公式ベンチマークは、1 ビット バージョンがツール呼び出しの次元で 17.5% 低下したことを示していますが、コミュニティ テストでは実際の低下はさらに大きい可能性があると考えられています。一部の開発者は、このモデルには推論の 3 番目の層の後に「チェーンがドロップされる」傾向があり、これにより、深刻なエージェント シナリオではプロセス全体が使用できなくなるのに十分であると指摘しました。 もう一つの論点は、「Bonsai 27Bは新型ではなくパッケージである」ということ。批評家は、PrismML は独自の基本モデルをトレーニングせず、Qwen3.6 に基づいて定量的なパッケージングを行ったと考えています。圧縮技術自体は画期的なものですが、技術的な障壁がどれほど高いのか、また他のチームが同様の効果をすぐに再現できるかどうかはまだわかりません。 視覚能力に関する疑問は無視できません。MMMU Pro/OCRBench の 1 ビット バージョンのスコアはわずか 59.6 で、ベースラインの 72.6 から大幅に低下しました。これは、極端な量子化がテキスト タスクよりも視覚理解に大きな影響を与えることを示しています。
-
Bonsai 27B は次の開発者に適しています。オフラインのローカル AI 機能を必要とするモバイル アプリケーション開発者。プライバシーに配慮したシナリオ (医療、法律、財務文書の処理)。消費者向けグラフィックス カード (8 ~ 12GB VRAM) で 27B レベルのモデルを実行する必要がある研究者。高いツール呼び出し精度を必要としないテキスト処理パイプライン。 次のシナリオでは使用しないことをお勧めします: 安定したマルチステップのエージェント機能、高精度の視覚的理解パイプライン、および複雑な数学的推論タスクを必要とする運用システム。 現時点で最も合理的な展開戦略はハイブリッド アーキテクチャです。Bonsai 27B (Ternary バージョン) はローカル クライアント側の主力として機能し、プライバシーに配慮した低遅延要件のタスクに使用されます。クラウドの大規模モデルは、高精度が必要な複雑な推論とシナリオを処理します。このスタックが実際に実現可能になるのは 2026 年になってからです。なぜなら、ローカル エンドが十分に強力なモデルをようやく手に入れたからです。
-
Bonsai 27B は、デバイス側 AI の開発における象徴的なノードです。これにより、「27B レベルのモデルを携帯電話にインストール」することが理論的に可能になり、実際にダウンロードして実行できるようになります。数学やプログラミングなどの構造化されたワークピースの精度保持は許容範囲内ですが、エージェントや視覚的なタスクにおける欠点も十分に明らかです。 Apache 2.0 のオープンソースのクライアント側モデルとして、開発者に新しいスタック レベルを提供します。これは、包括的な置き換えではなく、以前には存在しなかった新しいオプションです。 2026 年 7 月の時点では、これはデバイス側 AI への道における最大の一歩ですが、最後ではありません。
ユーザーレビュー
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。