Bonsai 27B
스마트폰에서 로컬로 구동되는 최초의 27B급 멀티모달 대형 모델. 알리바바 Qwen3.6 27B를 극한 양자화로 3.9GB까지 압축
심층 리포트
-
2026년 7월 14일, Caltech 출신의 AI 스타트업 PrismML은 스마트폰에서 로컬로 실행할 수 있는 세계 최초의 27B급 멀티모달 대형 모델인 Bonsai 27B를 출시했습니다. Alibaba Qwen3.6 27B 기반을 기반으로 모델은 극도의 낮은 비트 양자화를 통해 3.9GB(1비트 버전), 5.9GB(3값 버전)로 압축됩니다. 벤치마크 성능의 약 90~95%를 유지하면서 270억 개의 매개변수 수준 추론 기능은 Apache 2.0 오픈 소스 프로토콜에서 처음으로 소비자 하드웨어에서 무료로 사용할 수 있습니다.
-
PrismML은 캘리포니아 공과대학(Caltech)의 전기 공학 및 계산 수학 교수인 Babak Hassibi가 공동 창립했으며 핵심 팀에는 Caltech 출신의 Sahin Lale, Omead Pooladzandi 및 Reza Sadri도 포함되어 있습니다. 이 회사의 핵심 기술은 신경망 압축에 초점을 맞춘 학교의 수년간의 수학적 이론 연구에서 비롯되었습니다. Hassibi 교수는 1990년대 초 신경망 가지치기 방법 Optimal Brain Surgeon 제안에 참여했으며 모델 단순화에 대한 풍부한 경험을 가지고 있습니다. PrismML은 실리콘 밸리의 유명 벤처 캐피탈 회사인 Khosla Ventures가 주도하고 Cerberus Capital과 California Institute of Technology가 참여하여 SAFE 및 시드 라운드에서 총 1,625만 달러를 모금했습니다. Google과 Samsung도 컴퓨팅 성능과 산업 지원을 제공했습니다. 투자자 비노드 코슬라(Vinod Khosla)는 이 기술을 “또 하나의 작은 모델이 아닌 수학적 혁신”이라고 설명하며 AI의 미래는 데이터센터의 규모가 아니라 단위당 에너지 소비량과 비용당 지능의 밀도에 의해 정의된다고 믿었습니다. 이 회사는 2026년 3월에 스텔스 모드를 종료하고 첫 번째 제품인 1비트 Bonsai 8B를 출시했고, 이어 5월에 Bonsai Image 4B를 출시했습니다. Bonsai 27B는 Bonsai 시리즈의 주력 모델로 압축 경로를 더 높은 수준의 기능으로 발전시켰습니다. 애플은 초기 기술 평가를 위해 PrismML과 협의 중인 것으로 알려졌다.
-
Bonsai 27B는 처음부터 훈련된 기본 모델이 아니라 Alibaba Qwen3.6 27B를 기반으로 하는 고도로 양자화된 버전입니다. 262K 토큰의 매우 긴 컨텍스트 창, 다중 모드 시각적 이해(4비트 HQQ Vision Tower), 구조화된 도구 호출, 컴퓨터로 작동되는 에이전트 루프 및 추론을 가속화하는 추측 디코딩 등 전체 기능 세트를 유지하면서 극도로 압축되었습니다. 모델은 두 가지 수량화 변형을 제공합니다. Ternary 버전은 유효 비트가 1.71이고 볼륨이 5.9GB인 세 가지 값 가중치 {-1, 0, +1}와 FP16 그룹 스케일링을 사용합니다. 노트북 시나리오를 지향하며 품질을 최우선으로 추구합니다. 1비트 버전은 이진 가중치 {-1, +1}, 유효 비트 1.125 및 3.9GB의 볼륨을 사용합니다. 휴대폰 시나리오를 지향하며 볼륨을 최우선으로 추구합니다. 둘 사이의 주요 차이점은 다음과 같습니다. 1비트 버전을 선택한다는 것은 Agentic 도구 호출, 시각적 이해 및 복잡한 수학적 추론에서 정밀도가 더 크게 손실된다는 것을 의미합니다. 휴대폰 적응 측면에서 12GB 메모리 iPhone 17 Pro의 실제 사용 가능한 단일 애플리케이션 메모리는 약 6GB입니다. 3.9GB의 1비트 버전과 KV 캐시 및 활성화 값이 이 예산에 딱 맞습니다. 공식 측정 데이터에 따르면 iPhone 17 Pro Max의 1비트 버전은 약 11개 토큰/초이며, 약 672개 토큰이 배터리의 1%를 소모하는 것으로 나타났습니다. 데스크톱에서 1비트 버전은 RTX 5090에서 초당 163개의 토큰에 도달할 수 있고, 삼항 버전은 초당 134개의 토큰에 도달할 수 있습니다. M5 Max Mac에서 1비트 버전은 초당 87개 토큰에 도달할 수 있고, 삼항 버전은 초당 58개 토큰에 도달할 수 있습니다. 독립 개발자의 실제 피드백(Q4_K_M GGUF 버전을 실행하는 RTX 3090 기반)은 소비자급 그래픽 카드에서 이 정도 속도가 만족스럽다는 것을 보여줍니다. 4K 컨텍스트에서는 약 28토큰/초, 16K 컨텍스트에서는 여전히 19토큰/초입니다. 구조화된 JSON 추출 및 단일 라운드 RAG 성능은 "안정적이고 환각이 없습니다". 그러나 다단계 추론(3단계 도구 호출 체인 이상)에는 명백한 단점이 있습니다. 중국 커뮤니티의 실제 테스트에서도 이 사실이 확인되었습니다. Bonsai 27B는 오래된 8GB 그래픽 카드(3.8GB만 필요)에서 좋은 속도와 정확성으로 실행될 수 있지만 출력 품질을 보장하려면 사고 모드를 켜야 합니다.
-
Bonsai 27B는 Apache 2.0 프로토콜에 따른 완전한 오픈 소스입니다. 분동은 Hugging Face에서 무료로 다운로드할 수 있으며, 승인 없이 상업적인 사용이 허용됩니다. PrismML은 또한 개발자가 가중치를 적용하기 전에 프로토타입 검증을 수행할 수 있도록 제한된 시간 동안 무료 개발자 미리보기 API(Together.ai를 통해)를 제공합니다. 이 비즈니스 전략은 Apple의 초기 개발자 생태계 전략과 유사합니다. 오픈 소스를 통해 모델이 더 많은 제품과 생태계에 침투할 수 있고, 개방적인 태도를 사용하여 업계 표준과 개발자 끈기를 확립할 수 있습니다. 장치 측 모델의 핵심 가치는 추론이 무료이고 데이터가 장치를 떠나지 않는다는 것입니다. 이는 개인 정보 보호에 민감한 분야 및 오프라인 시나리오에 매우 매력적입니다.
-
커뮤니티의 실제 피드백은 Bonsai 27B에 대한 개발자의 전반적인 평가가 긍정적이라는 것을 보여줍니다. 특히 "다른 모델이 할 수 없는 일을 수행"하여 27B급 모델을 휴대폰에서 실행할 수 있다는 점을 보여줍니다. RTX 3090에서 테스트한 개발자는 장점과 단점에 대한 자세한 분석을 제공했습니다. 분류 파이프라인, 구조화된 추출 및 단일 라운드 RAG 시나리오는 "완전히 생산 준비"되어 있으며 라이센스는 Apache 2.0입니다. 이는 "법적 검토 없이 배포할 수 있으며 이는 벤치마크의 몇 가지 사항보다 훨씬 더 중요합니다." 그러나 그는 또한 복잡한 에이전트 루프 시나리오에서 MoE의 희소성으로 인해 모델이 3단계 이상의 추론 체인에서 단서를 잃고 계속해서 발전하는 대신 이전 단계를 반복하는 경향이 있다는 점을 지적했습니다. 너겟츠 중국 커뮤니티의 상세한 테스트 기사에서도 Agentic 도구 호출 차원이 가장 큰 감소(1비트 버전에서 17.5% 감소)를 보였으며, 실제 테스트에서의 사용성 감소는 숫자보다 더 클 수 있다고 지적했습니다. RTX 2070 8GB를 기반으로 한 Toutiao의 테스트는 직관적인 "IQ 순위"를 제공합니다: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B. 핵심 평가는 “매우 간단한 배포, 좋은 속도, 정직하고 헛소리 없음”이지만 사고 모드가 켜져 있어야 합니다.
-
Bonsai 27B에 대한 업계 언론의 보도는 "이정표" 수준에 초점을 맞추고 있습니다. 주류의 견해는 이 모델의 진정한 의미가 단일 벤치마크 점수가 아니라 "정규화"하는 것, 즉 느슨한 라이선스로 소비자급 하드웨어에 존재하고 오프라인에서 사용할 수 있는 27B 수준 다중 모드 모델에 있다는 것입니다. CoinDesk는 암호화폐 금융의 관점에서 엔드사이드 AI가 클라우드 인프라를 신뢰해야 하는 암호화 업계의 문제점을 제거한다고 지적했습니다. 즉, 사용자 데이터가 장치 외부로 나갈 필요가 없으며 이는 암호화폐 지갑, DeFi 인터페이스 및 거래 도구에 대한 의미 있는 개인 정보 보호 업그레이드입니다. Hacker News 커뮤니티 토론은 더욱 실용적입니다. 기술적 혁신을 인정하는 동시에 실제 엔지니어링 시나리오에서 극단적인 정량화의 단점은 무시할 수 없다는 점을 반복적으로 상기시킵니다. 독립 분석 블로그 Sean Kim이 가장 직접적인 판단을 내렸습니다. "휴대폰으로 달리는 것"과 "정밀도 모델을 일치시키는 것"은 동일한 제안이 아닙니다. 합리적인 모델은 하이브리드 배포입니다. 로컬 장치 측 모델은 가볍고 개인 정보 보호에 민감한 작업을 처리하고 복잡한 추론은 클라우드에 맡겨집니다. 경쟁 환경에서 Apple, Google, Qualcomm은 모두 최종 AI를 장려하고 있지만 주류는 여전히 3~7B 매개변수 규모 모델입니다. Bonsai 27B는 매개변수 규모를 거의 4배까지 직접적으로 증가시켜 "지능형 밀도"라는 경쟁 차원을 열었습니다. PrismML이 제안한 지능 밀도 지표(GB당 성능 값)는 1비트 Bonsai 27B가 0.53/GB로 전체 정밀도 기준의 10배가 넘는 것으로 나타났습니다.
-
Bonsai 27B를 둘러싼 주요 논쟁은 극단적인 정량화가 Agentic 기능을 어느 정도 약화시키는가에 집중되어 있습니다. 공식 벤치마크에서는 1비트 버전이 도구 호출 차원에서 17.5% 감소한 것으로 나타났지만, 커뮤니티 테스트에서는 실제 감소가 더 클 수 있다고 믿습니다. 일부 개발자는 모델이 세 번째 추론 계층 이후에 "체인을 삭제"하는 경향이 있는데, 이는 심각한 에이전트 시나리오에서 전체 프로세스를 사용할 수 없게 만드는 데 충분하다고 지적했습니다. 또 다른 논의점은 "분재 27B는 신모델이 아니라 패키지"라는 것이다. 비평가들은 PrismML이 자체 기본 모델을 훈련시키지 않고 Qwen3.6을 기반으로 정량적 패키징을 수행했다고 믿습니다. 압축 기술 자체는 획기적이지만 기술 장벽이 얼마나 높은지, 다른 팀이 유사한 효과를 빠르게 재현할 수 있는지는 아직 알 수 없습니다. 시각적 능력에 대한 질문은 무시할 수 없습니다. MMMU Pro/OCRBench의 1비트 버전은 기준점인 72.6보다 크게 떨어진 59.6점을 얻었습니다. 이는 극단적인 양자화가 텍스트 작업보다 시각적 이해에 더 큰 영향을 미친다는 것을 나타냅니다.
-
Bonsai 27B는 다음 개발자에게 적합합니다: 오프라인 로컬 AI 기능이 필요한 모바일 애플리케이션 개발자; 개인 정보 보호에 민감한 시나리오(의료, 법률, 금융 문서 처리) 소비자급 그래픽 카드(8~12GB VRAM)에서 27B 수준 모델을 실행해야 하는 연구원 높은 도구 호출 정확도를 요구하지 않는 텍스트 처리 파이프라인. 안정적인 다단계 에이전트 기능, 고정밀 시각적 이해 파이프라인 및 복잡한 수학적 추론 작업이 필요한 프로덕션 시스템과 같은 시나리오에서는 사용하지 않는 것이 좋습니다. 현재 가장 합리적인 배포 전략은 하이브리드 아키텍처입니다. Bonsai 27B(Ternary 버전)는 로컬 클라이언트 측에서 주력 역할을 하며 개인 정보 보호에 민감하고 대기 시간이 짧은 작업에 사용됩니다. 클라우드 대규모 모델은 높은 정확성이 요구되는 복잡한 추론과 시나리오를 처리합니다. 이 스택은 2026년에만 실제로 실현 가능합니다. 왜냐하면 로컬 엔드가 마침내 충분히 강력한 모델을 갖게 되었기 때문입니다.
-
Bonsai 27B는 장치 측 AI 개발의 상징적인 노드입니다. 이를 통해 "27B 수준 모델을 휴대폰에 설치할 수 있습니다"는 이론적 논의부터 실제로 다운로드 및 실행 가능까지 가능합니다. 수학 및 프로그래밍과 같은 구조화된 작업의 정확성 유지는 허용되지만 에이전트 및 시각적 작업의 단점도 충분히 명백합니다. Apache 2.0의 오픈 소스 클라이언트 측 모델로서 개발자에게 새로운 스택 수준을 제공합니다. 이는 포괄적인 대체가 아니라 이전에는 존재하지 않았던 새로운 옵션입니다. 2026년 7월 현재 이는 기기 측 AI로 향하는 가장 큰 단계이지만 마지막 단계는 아닙니다.
사용자 리뷰
-
Richard112—终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。 -
SMartinez_66—部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。 -
TMorgan_20248—用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。 -
BettyLopez007—我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。 -
BAndersonK—实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。 -
月光_17—Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。 -
Jesse_Foster_66—说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。 -
GEbel—用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。 -
StephanieFoster369—和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。 -
Ryan_RussellQ—苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。 -
云烟_6—弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。 -
Billy.Green—运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。 -
海浪_21—最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。 -
Mason.TorresSr—说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。 -
Michelle_RussellQ—在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。 -
Jonathan196—Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。 -
Karen.Rodriguez007—我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。 -
Jennifer.Kelly_99—视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。 -
Lydia.MendozaX—对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。 -
Arthur90—最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。 -
Matthew.MurphyK—用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。 -
KathleenRoberts_Plus1—刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。 -
GregoryNelson_66—好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。 -
DPrice007—从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。 -
NWrightIII—17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。