Bonsai 27B

Model besar multimodal kelas 27B pertama yang berjalan lokal di ponsel, dikompresi menjadi 3,9 GB dari Qwen3.6 27B Alibaba melalui kuantisasi ekstrem

Laporan mendalam

  • Pada tanggal 14 Juli 2026, PrismML, sebuah startup AI dengan latar belakang Caltech, merilis Bonsai 27B, model besar multi-modal tingkat 27B pertama di dunia yang dapat dijalankan secara lokal di ponsel pintar. Berdasarkan basis Alibaba Qwen3.6 27B, model ini dikompresi menjadi 3,9 GB (versi 1-bit) dan 5,9 GB (versi tiga nilai) melalui kuantisasi bit rendah yang ekstrem. Sambil mempertahankan sekitar 90-95% kinerja benchmark, 27 miliar kemampuan penalaran tingkat parameter tersedia secara gratis pada perangkat keras konsumen untuk pertama kalinya di bawah protokol sumber terbuka Apache 2.0.

  • PrismML didirikan bersama oleh Babak Hassibi, profesor teknik elektro dan matematika komputasi di California Institute of Technology (Caltech), dan tim inti juga terdiri dari Sahin Lale, Omead Pooladzandi, dan Reza Sadri, semuanya dari Caltech. Teknologi inti perusahaan berasal dari penelitian teori matematika sekolah selama bertahun-tahun, dengan fokus pada kompresi jaringan saraf. Profesor Hassibi berpartisipasi dalam mengusulkan metode pemangkasan jaringan saraf Optimal Brain Surgeon sejak tahun 1990-an, dan memiliki pengalaman mendalam dalam penyederhanaan model. PrismML mengumpulkan total US$16,25 juta dalam SAFE dan putaran awal, yang dipimpin oleh Khosla Ventures, sebuah firma modal ventura terkenal di Silicon Valley, dengan partisipasi dari Cerberus Capital dan California Institute of Technology. Google dan Samsung juga menyediakan kekuatan komputasi dan dukungan industri. Investor Vinod Khosla menggambarkan teknologi ini sebagai "terobosan matematis, bukan model kecil lainnya" dan percaya bahwa masa depan AI tidak ditentukan oleh ukuran pusat data, namun oleh kepadatan kecerdasan per unit konsumsi energi dan biaya. Perusahaan mengakhiri mode siluman pada Maret 2026 dan merilis produk pertamanya, Bonsai 8B 1-bit, diikuti oleh Bonsai Image 4B pada bulan Mei. Bonsai 27B adalah model unggulan dari seri Bonsai, yang menandai kemajuan jalur kompresinya ke tingkat kemampuan yang lebih tinggi. Apple dilaporkan sedang melakukan pembicaraan dengan PrismML untuk evaluasi teknologi awal.

  • Bonsai 27B bukanlah model dasar yang dilatih dari awal, melainkan versi yang sangat terkuantisasi berdasarkan Alibaba Qwen3.6 27B. Ini sangat terkompresi sambil mempertahankan rangkaian fitur lengkap: jendela konteks ultra-panjang token 262 ribu, pemahaman visual multi-modal (Menara Visi HQQ 4-bit), panggilan alat terstruktur, loop agen yang dioperasikan komputer, dan decoding spekulatif untuk mempercepat inferensi. Model ini menyediakan dua varian kuantifikasi: versi Ternary menggunakan bobot tiga nilai {-1, 0, +1} ditambah penskalaan grup FP16, dengan bit efektif 1,71 dan volume 5,9 GB. Ini berorientasi pada skenario notebook dan mengutamakan kualitas; versi 1-bit menggunakan bobot biner {-1, +1}, bit efektif 1,125 dan volume 3,9 GB. Ini berorientasi pada skenario ponsel dan mengejar volume terlebih dahulu. Perbedaan utama antara keduanya adalah: Memilih versi 1-bit berarti menerima hilangnya presisi yang lebih signifikan dalam panggilan alat Agentic, pemahaman visual, dan penalaran matematika yang kompleks. Dalam hal adaptasi ponsel, sebenarnya memori aplikasi tunggal yang tersedia pada memori 12GB iPhone 17 Pro adalah sekitar 6GB. Versi 1-bit 3,9 GB ditambah cache KV dan nilai aktivasi dapat disesuaikan dengan anggaran ini. Data pengukuran resmi menunjukkan bahwa versi 1-bit pada iPhone 17 Pro Max menghasilkan sekitar 11 token/dtk, dan sekitar 672 token menghabiskan 1% baterai. Di desktop, versi 1-bit dapat mencapai 163 token/s pada RTX 5090, dan versi ternary dapat mencapai 134 token/s; pada M5 Max Mac, versi 1-bit dapat mencapai 87 token/s, dan versi ternary dapat mencapai 58 token/s. Masukan aktual dari pengembang independen (berdasarkan RTX 3090 yang menjalankan versi Q4_K_M GGUF) menunjukkan bahwa kecepatan sebesar ini pada kartu grafis tingkat konsumen cukup memuaskan: sekitar 28 token/dtk dalam konteks 4K, dan masih 19 token/dtk dalam konteks 16K. Ekstraksi JSON terstruktur dan kinerja RAG satu putaran "stabil dan tanpa halusinasi", tetapi penalaran multi-langkah (lebih dari rantai panggilan alat 3 langkah) memiliki kekurangan yang jelas. Pengujian aktual di komunitas Tiongkok juga menegaskan hal ini: Bonsai 27B dapat berjalan pada kartu grafis 8GB lama (hanya diperlukan 3,8GB), dengan kecepatan dan akurasi yang baik, tetapi mode berpikir harus diaktifkan untuk memastikan kualitas keluaran.

  • Bonsai 27B sepenuhnya open source di bawah protokol Apache 2.0. Anak timbangan dapat diunduh gratis dari Hugging Face, dan penggunaan komersial diperbolehkan tanpa izin. PrismML juga menyediakan API pratinjau pengembang gratis dalam waktu terbatas (melalui Together.ai) untuk memfasilitasi pengembang melakukan verifikasi prototipe sebelum melakukan bobot. Strategi bisnis ini mirip dengan strategi ekosistem pengembang awal Apple: melalui sumber terbuka, model tersebut dapat ditembus ke lebih banyak produk dan ekosistem, dan sikap terbuka dapat digunakan untuk menetapkan standar industri dan keterikatan pengembang. Nilai inti model sisi perangkat adalah inferensi bebas dan data tidak keluar dari perangkat, sehingga sangat menarik untuk bidang sensitif privasi dan skenario offline.

  • Masukan nyata dari komunitas menunjukkan bahwa evaluasi keseluruhan pengembang terhadap Bonsai 27B adalah positif, terutama karena Bonsai 27B “melakukan apa yang tidak dapat dilakukan oleh model lain” – memungkinkan model kelas 27B untuk dijalankan di ponsel. Pengembang yang menguji RTX 3090 memberikan analisis mendetail mengenai kelebihan dan kekurangan: pipeline klasifikasi, ekstraksi terstruktur, dan skenario RAG putaran tunggal "sepenuhnya siap produksi", dan lisensinya adalah Apache 2.0, yang berarti "dapat diterapkan tanpa tinjauan hukum, yang jauh lebih penting daripada beberapa poin pada tolok ukur." Namun dia juga menunjukkan bahwa dalam skenario loop agen yang kompleks, karena ketersebaran MoE, model tersebut cenderung kehilangan petunjuk di lebih dari 3 langkah rantai penalaran dan mengulangi langkah sebelumnya alih-alih terus maju. Artikel pengujian terperinci di komunitas Nuggets Cina juga menunjukkan bahwa dimensi panggilan alat Agentic memiliki penurunan terbesar (penurunan 17,5% dalam versi 1-bit), dan penurunan kegunaan dalam pengujian sebenarnya mungkin lebih signifikan daripada angkanya. Tes Toutiao berdasarkan RTX 2070 8GB memberikan “peringkat IQ” yang intuitif: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. Evaluasi intinya adalah “penyebaran yang sangat sederhana, kecepatan yang baik, jujur, dan tidak omong kosong”, tetapi mode berpikir harus diaktifkan.

  • Liputan media industri tentang Bonsai 27B berfokus pada tingkat “tonggak sejarah”. Pandangan umum adalah bahwa signifikansi sebenarnya dari model ini tidak terletak pada skor benchmark tunggal, namun pada apa yang “dinormalisasi”: model multi-modal tingkat 27B yang hidup pada perangkat keras tingkat konsumen dengan lisensi longgar dan tersedia secara offline. CoinDesk menunjukkan dari perspektif keuangan kripto bahwa AI sisi akhir menghilangkan kesulitan industri enkripsi dalam mempercayai infrastruktur cloud: data pengguna tidak harus keluar dari perangkat, yang merupakan peningkatan privasi yang berarti untuk dompet kripto, antarmuka DeFi, dan alat perdagangan. Diskusi komunitas Hacker News lebih bersifat pragmatis: mengakui terobosan teknologi sambil berulang kali mengingatkan bahwa kekurangan kuantifikasi ekstrem dalam skenario rekayasa nyata tidak dapat diabaikan. Blog analisis independen Sean Kim memberikan penilaian paling langsung: "Berjalan di ponsel" dan "mencocokkan model dengan presisi penuh" bukanlah proposisi yang sama. Model yang masuk akal adalah penerapan hibrid: model sisi perangkat lokal menangani tugas-tugas ringan dan sensitif terhadap privasi, dan pertimbangan rumit diserahkan ke cloud. Dari lanskap persaingan, Apple, Google, dan Qualcomm semuanya mempromosikan AI sisi akhir, namun arus utama tetap pada model skala parameter 3-7 miliar. Bonsai 27B secara langsung meningkatkan skala parameter hampir 4 kali lipat, membuka dimensi kompetitif "kepadatan cerdas". Indikator kepadatan intelijen (nilai kemampuan per GB) yang diusulkan oleh PrismML menunjukkan bahwa 1-bit Bonsai 27B adalah 0,53/GB, yang lebih dari 10 kali lipat dari garis dasar presisi penuh.

  • Kontroversi utama seputar Bonsai 27B berpusat pada sejauh mana kuantifikasi ekstrem mengikis kemampuan Agentic. Tolok ukur resmi menunjukkan bahwa versi 1-bit mengalami penurunan sebesar 17,5% dalam dimensi panggilan alat, namun pengujian komunitas meyakini bahwa penurunan sebenarnya mungkin lebih signifikan. Beberapa pengembang menunjukkan bahwa model memiliki kecenderungan untuk "menjatuhkan rantai" setelah inferensi lapisan ketiga, yang cukup untuk membuat seluruh proses tidak dapat digunakan dalam skenario agen yang parah. Pokok bahasan lainnya adalah “Bonsai 27B bukanlah model baru, melainkan sebuah paket”. Kritikus percaya bahwa PrismML tidak melatih model dasarnya sendiri, tetapi melakukan pengemasan kuantitatif berdasarkan Qwen3.6. Meskipun teknologi kompresinya sendiri merupakan terobosan, masih harus dilihat seberapa tinggi hambatan teknisnya dan apakah tim lain dapat dengan cepat mereproduksi efek serupa. Pertanyaan tentang kemampuan visual tidak dapat diabaikan: MMMU Pro/OCRBench versi 1-bit hanya mendapat skor 59,6, penurunan yang signifikan dari baseline 72,6, yang menunjukkan bahwa kuantisasi ekstrem memiliki dampak lebih besar pada pemahaman visual dibandingkan tugas teks.

  • Bonsai 27B cocok untuk pengembang berikut: pengembang aplikasi seluler yang membutuhkan kemampuan AI lokal offline; skenario sensitif privasi (pemrosesan dokumen medis, hukum, keuangan); peneliti yang perlu menjalankan model level 27B pada kartu grafis tingkat konsumen (VRAM 8-12GB); dan alur pemrosesan teks yang tidak memerlukan akurasi panggilan alat yang tinggi. Tidak disarankan untuk digunakan dalam skenario berikut: sistem produksi yang memerlukan kemampuan Agentic multi-langkah yang stabil, pipeline pemahaman visual presisi tinggi, dan tugas penalaran matematis yang kompleks. Strategi penerapan yang paling masuk akal saat ini adalah arsitektur hybrid: Bonsai 27B (versi Ternary) berfungsi sebagai kekuatan utama di sisi klien lokal dan digunakan untuk tugas-tugas dengan persyaratan sensitif privasi dan latensi rendah; model cloud besar menangani penalaran dan skenario kompleks yang memerlukan akurasi tinggi. Tumpukan ini hanya akan benar-benar layak pada tahun 2026 - karena pihak lokal akhirnya memiliki model yang cukup kuat.

  • Bonsai 27B adalah simpul ikonik dalam pengembangan AI di sisi perangkat: memungkinkan "model tingkat 27B dipasang di ponsel" dari yang secara teoritis dapat didiskusikan hingga benar-benar dapat diunduh dan dijalankan. Retensi akurasi pada benda kerja terstruktur seperti matematika dan pemrograman dapat diterima, namun kekurangan pada tugas agenik dan visual juga cukup jelas. Sebagai model sisi klien open source dari Apache 2.0, ini memberi pengembang tingkat tumpukan baru - bukan pengganti yang komprehensif, tetapi opsi baru yang belum pernah ada sebelumnya. Pada Juli 2026, ini merupakan langkah terbesar menuju AI di sisi perangkat, namun bukan yang terakhir.

Ulasan pengguna

  • avatar
    Richard112
    终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。

  • avatar
    SMartinez_66
    部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。

  • avatar
    TMorgan_20248
    用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。

  • avatar
    BettyLopez007
    我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。

  • avatar
    BAndersonK
    实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。

  • avatar
    月光_17
    Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。

  • avatar
    Jesse_Foster_66
    说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。

  • avatar
    GEbel
    用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。

  • avatar
    StephanieFoster369
    和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。

  • avatar
    Ryan_RussellQ
    苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。

  • avatar
    云烟_6
    弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。

  • avatar
    Billy.Green
    运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。

  • avatar
    海浪_21
    最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。

  • avatar
    Mason.TorresSr
    说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。

  • avatar
    Michelle_RussellQ
    在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。

  • avatar
    Jonathan196
    Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。

  • avatar
    Karen.Rodriguez007
    我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。

  • avatar
    Jennifer.Kelly_99
    视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。

  • avatar
    Lydia.MendozaX
    对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。

  • avatar
    Arthur90
    最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。

  • avatar
    Matthew.MurphyK
    用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。

  • avatar
    KathleenRoberts_Plus1
    刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。

  • avatar
    GregoryNelson_66
    好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。

  • avatar
    DPrice007
    从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。

  • avatar
    NWrightIII
    17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。