Bonsai 27B

โมเดลใหญ่มัลติโหมดระดับ 27B ตัวแรกที่รันบนมือถือแบบโลคัลได้ บีบอัดจาก Qwen3.6 27B ของ Alibaba เหลือ 3.9GB ด้วยการควอนไทซ์ขั้นสุด

รายงานเชิงลึก

  • เมื่อวันที่ 14 กรกฎาคม 2026 PrismML ซึ่งเป็นสตาร์ทอัพด้าน AI ซึ่งมีพื้นฐานมาจาก Caltech ได้เปิดตัว Bonsai 27B ซึ่งเป็นโมเดลขนาดใหญ่หลายรูปแบบระดับ 27B ตัวแรกของโลกที่สามารถเรียกใช้ในเครื่องบนสมาร์ทโฟนได้ อิงตามฐาน Alibaba Qwen3.6 27B โมเดลนี้ได้รับการบีบอัดเป็น 3.9GB (เวอร์ชัน 1 บิต) และ 5.9GB (เวอร์ชัน 3 ค่า) ผ่านการหาปริมาณบิตต่ำมาก ในขณะที่ยังคงรักษาประสิทธิภาพการวัดประสิทธิภาพไว้ประมาณ 90-95% ความสามารถในการให้เหตุผลระดับพารามิเตอร์ 27 พันล้านพร้อมให้ใช้งานฟรีบนฮาร์ดแวร์สำหรับผู้บริโภคเป็นครั้งแรกภายใต้โปรโตคอลโอเพ่นซอร์ส Apache 2.0

  • PrismML ก่อตั้งโดย Babak Hassibi ศาสตราจารย์ด้านวิศวกรรมไฟฟ้าและคณิตศาสตร์คอมพิวเตอร์ที่สถาบันเทคโนโลยีแคลิฟอร์เนีย (Caltech) และทีมงานหลักยังรวมถึง Sahin Lale, Omead Pooladzandi และ Reza Sadri ซึ่งทั้งหมดนี้มาจาก Caltech เทคโนโลยีหลักของบริษัทมีต้นกำเนิดมาจากการวิจัยทางทฤษฎีทางคณิตศาสตร์เป็นเวลาหลายปีของโรงเรียน โดยมุ่งเน้นไปที่การบีบอัดโครงข่ายประสาทเทียม ศาสตราจารย์ฮาสซิบีมีส่วนร่วมในการเสนอวิธีการตัดแต่งโครงข่ายประสาทเทียม Optimal Brain Surgeon ในช่วงต้นทศวรรษ 1990 และมีประสบการณ์อย่างลึกซึ้งในการลดความซับซ้อนของแบบจำลอง PrismML ระดมทุนได้ทั้งหมด 16.25 ล้านดอลลาร์สหรัฐจาก SAFE และรอบ Seed Round ซึ่งนำโดย Khosla Ventures บริษัทร่วมลงทุนชื่อดังในซิลิคอนแวลลีย์ โดยมีส่วนร่วมจาก Cerberus Capital และ California Institute of Technology Google และ Samsung ยังมอบพลังการประมวลผลและการสนับสนุนอุตสาหกรรมอีกด้วย นักลงทุน Vinod Khosla อธิบายว่าเทคโนโลยีนี้เป็น "ความก้าวหน้าทางคณิตศาสตร์ ไม่ใช่โมเดลขนาดเล็ก" และเชื่อว่าอนาคตของ AI ไม่ได้ถูกกำหนดโดยขนาดของศูนย์ข้อมูล แต่โดยความหนาแน่นของสติปัญญาต่อหน่วยการใช้พลังงานและต้นทุน บริษัทยุติโหมดซ่อนตัวในเดือนมีนาคม พ.ศ. 2569 และเปิดตัวผลิตภัณฑ์แรกคือบอนไซ 8B ขนาด 1 บิต ตามด้วยบอนไซอิมเมจ 4B ในเดือนพฤษภาคม บอนไซ 27B เป็นรุ่นเรือธงของซีรีส์บอนไซ ซึ่งแสดงถึงความก้าวหน้าของเส้นทางการบีบอัดไปสู่ระดับความสามารถที่สูงขึ้น มีรายงานว่า Apple กำลังเจรจากับ PrismML เพื่อประเมินเทคโนโลยีเบื้องต้น

  • Bonsai 27B ไม่ใช่โมเดลพื้นฐานที่ได้รับการฝึกตั้งแต่ต้น แต่เป็นเวอร์ชันที่มีปริมาณมากโดยอิงจาก Alibaba Qwen3.6 27B มันถูกบีบอัดอย่างมากในขณะที่ยังคงชุดคุณลักษณะทั้งหมดไว้: หน้าต่างบริบทที่ยาวเป็นพิเศษของโทเค็น 262K, การทำความเข้าใจภาพหลายรูปแบบ (HQQ Vision Tower 4 บิต), การเรียกเครื่องมือที่มีโครงสร้าง, ลูปเอเจนต์ที่ดำเนินการด้วยคอมพิวเตอร์ และการถอดรหัสแบบเก็งกำไรเพื่อเร่งการอนุมาน โมเดลนี้มีตัวแปรเชิงปริมาณสองแบบ: เวอร์ชันแบบ Ternary ใช้น้ำหนักสามค่า {-1, 0, +1} บวกกับการปรับขนาดกลุ่ม FP16 โดยมีบิตประสิทธิผล 1.71 และปริมาตร 5.9GB โดยเน้นไปที่สถานการณ์โน้ตบุ๊กและให้ความสำคัญกับคุณภาพเป็นอันดับแรก เวอร์ชัน 1 บิตใช้น้ำหนักไบนารี {-1, +1} บิตที่มีประสิทธิภาพ 1.125 และปริมาตร 3.9GB โดยมุ่งเน้นที่สถานการณ์โทรศัพท์มือถือและเน้นปริมาณการใช้งานเป็นอันดับแรก ข้อแตกต่างที่สำคัญระหว่างทั้งสองคือ: การเลือกเวอร์ชัน 1 บิตหมายถึงการยอมรับการสูญเสียความแม่นยำที่สำคัญมากขึ้นในการเรียกเครื่องมือ Agentic ความเข้าใจด้วยภาพ และการให้เหตุผลทางคณิตศาสตร์ที่ซับซ้อน ในแง่ของการปรับใช้โทรศัพท์มือถือ หน่วยความจำแอปพลิเคชันเดียวที่มีอยู่จริงของหน่วยความจำ 12GB iPhone 17 Pro คือประมาณ 6GB เวอร์ชัน 1 บิตของ 3.9GB พร้อมแคช KV และมูลค่าการเปิดใช้งานสามารถรองรับงบประมาณนี้ได้ ข้อมูลที่วัดอย่างเป็นทางการแสดงให้เห็นว่าเวอร์ชัน 1 บิตบน iPhone 17 Pro Max มีค่าประมาณ 11 โทเค็น/วินาที และโทเค็นประมาณ 672 โทเค็นใช้แบตเตอรี่ 1% บนเดสก์ท็อป เวอร์ชัน 1 บิตสามารถเข้าถึง 163 โทเค็น/วินาที บน RTX 5090 และเวอร์ชันไตรภาคสามารถเข้าถึง 134 โทเค็น/วินาที บน M5 Max Mac เวอร์ชัน 1 บิตสามารถเข้าถึง 87 โทเค็น/วินาที และเวอร์ชันแบบไตรภาคสามารถเข้าถึง 58 โทเค็น/วินาที ความคิดเห็นจริงจากนักพัฒนาอิสระ (อิงจาก RTX 3090 ที่ใช้เวอร์ชัน Q4_K_M GGUF) แสดงให้เห็นว่าความเร็วขนาดนี้บนกราฟิกการ์ดระดับผู้บริโภคเป็นที่น่าพอใจ: ประมาณ 28 โทเค็น/วินาทีในบริบท 4K และยังคงเป็น 19 โทเค็น/วินาทีในบริบท 16K การแยก JSON ที่มีโครงสร้างและประสิทธิภาพของ RAG รอบเดียวนั้น "เสถียรและปราศจากอาการประสาทหลอน" แต่การใช้เหตุผลหลายขั้นตอน (สายการเรียกเครื่องมือมากกว่า 3 ขั้นตอน) มีข้อบกพร่องที่ชัดเจน การทดสอบจริงในชุมชนชาวจีนยังยืนยันสิ่งนี้อีกด้วย: Bonsai 27B สามารถทำงานบนการ์ดกราฟิก 8GB เก่าได้ (ต้องใช้เพียง 3.8GB เท่านั้น) ด้วยความเร็วและความแม่นยำที่ดี แต่ต้องเปิดโหมดการคิดเพื่อให้มั่นใจในคุณภาพผลลัพธ์

  • Bonsai 27B เป็นโอเพ่นซอร์สอย่างสมบูรณ์ภายใต้โปรโตคอล Apache 2.0 ตุ้มน้ำหนักสามารถดาวน์โหลดได้ฟรีจาก Hugging Face และอนุญาตให้นำไปใช้ในเชิงพาณิชย์โดยไม่ได้รับอนุญาต PrismML ยังมี API ตัวอย่างสำหรับนักพัฒนาฟรีในระยะเวลาจำกัด (ผ่าน Together.ai) เพื่ออำนวยความสะดวกให้นักพัฒนาทำการตรวจสอบต้นแบบก่อนที่จะดึงน้ำหนัก กลยุทธ์ทางธุรกิจนี้คล้ายกับกลยุทธ์ระบบนิเวศสำหรับนักพัฒนาในยุคแรกๆ ของ Apple นั่นคือ โมเดลสามารถเจาะเข้าไปในผลิตภัณฑ์และระบบนิเวศได้มากขึ้นผ่านโอเพ่นซอร์ส และทัศนคติที่เปิดกว้างสามารถนำมาใช้เพื่อสร้างมาตรฐานอุตสาหกรรมและความเหนียวแน่นของนักพัฒนาได้ ค่านิยมหลักของโมเดลฝั่งอุปกรณ์คือการอนุมานนั้นไม่มีค่าใช้จ่าย และข้อมูลจะไม่หลุดออกจากอุปกรณ์ ซึ่งน่าสนใจมากสำหรับสาขาที่คำนึงถึงความเป็นส่วนตัวและสถานการณ์ออฟไลน์

  • ผลตอบรับที่แท้จริงจากชุมชนแสดงให้เห็นว่าการประเมินโดยรวมของนักพัฒนาต่อบอนไซ 27B นั้นเป็นไปในเชิงบวก โดยเฉพาะอย่างยิ่ง “ทำในสิ่งที่รุ่นอื่นไม่สามารถทำได้” – ทำให้โมเดลคลาส 27B สามารถทำงานบนโทรศัพท์มือถือได้ นักพัฒนาที่ทดสอบบน RTX 3090 ได้ให้การวิเคราะห์โดยละเอียดเกี่ยวกับข้อดีและข้อเสีย: ไปป์ไลน์การจำแนกประเภท การแยกโครงสร้าง และสถานการณ์ RAG แบบรอบเดียวนั้น "พร้อมสำหรับการผลิตเต็มรูปแบบ" และใบอนุญาตคือ Apache 2.0 ซึ่งหมายความว่า "สามารถใช้งานได้โดยไม่ต้องมีการตรวจสอบทางกฎหมาย ซึ่งมีความสำคัญมากกว่าจุดสองสามจุดในเกณฑ์มาตรฐาน" แต่เขายังชี้ให้เห็นว่าในสถานการณ์ที่ซับซ้อนของเอเจนต์ลูป เนื่องจากความกระจัดกระจายของ MoE โมเดลจึงมีแนวโน้มที่จะสูญเสียเบาะแสในห่วงโซ่การให้เหตุผลมากกว่า 3 ขั้นตอน และทำซ้ำขั้นตอนก่อนหน้าแทนที่จะดำเนินการต่อไป บทความทดสอบโดยละเอียดเกี่ยวกับชุมชนชาวจีนของ Nuggets ยังชี้ให้เห็นว่ามิติการเรียกเครื่องมือ Agentic มีการลดลงมากที่สุด (ลดลง 17.5% ในเวอร์ชัน 1 บิต) และความสามารถในการใช้งานที่ลดลงในการทดสอบจริงอาจมีนัยสำคัญมากกว่าตัวเลข การทดสอบของ Toutiao บน RTX 2070 8GB ให้ “การจัดอันดับ IQ” ที่ใช้งานง่าย: Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B การประเมินหลักคือ “การใช้งานที่ง่ายมาก ความเร็วที่ดี ซื่อสัตย์ และไม่ไร้สาระ” แต่จะต้องเปิดโหมดการคิด

  • การรายงานข่าวของสื่ออุตสาหกรรมเกี่ยวกับบอนไซ 27B มุ่งเน้นไปที่ระดับ "เหตุการณ์สำคัญ" มุมมองกระแสหลักคือความสำคัญที่แท้จริงของโมเดลนี้ไม่ได้อยู่ที่คะแนนเกณฑ์มาตรฐานเพียงคะแนนเดียว แต่อยู่ที่สิ่งที่ "ทำให้เป็นมาตรฐาน": โมเดลหลายรูปแบบระดับ 27B ที่ทำงานบนฮาร์ดแวร์ระดับผู้บริโภคพร้อมใบอนุญาตแบบหลวม ๆ และพร้อมใช้งานแบบออฟไลน์ CoinDesk ชี้ให้เห็นจากมุมมองของการเงินคริปโตว่า AI ฝั่งปลายทางขจัดปัญหาของอุตสาหกรรมการเข้ารหัสในการไว้วางใจโครงสร้างพื้นฐานคลาวด์ ข้อมูลผู้ใช้ไม่จำเป็นต้องออกจากอุปกรณ์ ซึ่งเป็นการอัปเกรดความเป็นส่วนตัวที่มีความหมายสำหรับกระเป๋าเงินคริปโต อินเทอร์เฟซ DeFi และเครื่องมือการซื้อขาย การอภิปรายในชุมชน Hacker News นั้นเน้นการปฏิบัติมากขึ้น: การยอมรับความก้าวหน้าทางเทคโนโลยีในขณะเดียวกันก็เตือนซ้ำ ๆ ว่าข้อบกพร่องของการระบุปริมาณที่รุนแรงในสถานการณ์ทางวิศวกรรมที่แท้จริงนั้นไม่สามารถละเลยได้ บล็อกการวิเคราะห์อิสระ Sean Kim ให้วิจารณญาณโดยตรงที่สุด: "การทำงานบนโทรศัพท์มือถือ" และ "การจับคู่โมเดลที่มีความแม่นยำเต็มรูปแบบ" ไม่ใช่ข้อเสนอเดียวกัน โมเดลที่สมเหตุสมผลคือการปรับใช้แบบไฮบริด: โมเดลฝั่งอุปกรณ์ภายในจะจัดการงานที่ไม่ซับซ้อนและละเอียดอ่อนต่อความเป็นส่วนตัว และการใช้เหตุผลที่ซับซ้อนจะถูกปล่อยให้เป็นหน้าที่ของคลาวด์ จากภูมิทัศน์การแข่งขัน Apple, Google และ Qualcomm ต่างก็ส่งเสริม AI ฝั่งปลายทาง แต่กระแสหลักยังคงอยู่ที่แบบจำลองขนาดพารามิเตอร์ 3-7B Bonsai 27B เพิ่มขนาดพารามิเตอร์โดยตรงเกือบ 4 เท่า เปิดมิติการแข่งขันของ "ความหนาแน่นอัจฉริยะ" ตัวบ่งชี้ความหนาแน่นของสติปัญญา (ค่าความสามารถต่อ GB) ที่เสนอโดย PrismML แสดงให้เห็นว่าบอนไซ 27B ขนาด 1 บิตคือ 0.53/GB ซึ่งมากกว่า 10 เท่าของค่าพื้นฐานที่แม่นยำทั้งหมด

  • ข้อโต้แย้งหลักเกี่ยวกับบอนไซ 27B มีศูนย์กลางอยู่ที่ขอบเขตที่การกำหนดปริมาณอย่างมากจะกัดกร่อนความสามารถของเอเจนติก เกณฑ์มาตรฐานอย่างเป็นทางการแสดงให้เห็นว่าเวอร์ชัน 1 บิตลดลง 17.5% ในมิติการเรียกเครื่องมือ แต่การทดสอบโดยชุมชนเชื่อว่าการลดลงจริงอาจมีนัยสำคัญมากกว่า นักพัฒนาบางคนชี้ให้เห็นว่าโมเดลนี้มีแนวโน้มที่จะ "ปล่อยห่วงโซ่" หลังจากการอนุมานเลเยอร์ที่สาม ซึ่งเพียงพอที่จะทำให้กระบวนการทั้งหมดไม่สามารถใช้งานได้ในสถานการณ์ตัวแทนที่รุนแรง ประเด็นที่น่าอภิปรายอีกประการหนึ่งคือ "Bonsai 27B ไม่ใช่รุ่นใหม่ แต่เป็นแพ็คเกจ" นักวิจารณ์เชื่อว่า PrismML ไม่ได้ฝึกโมเดลพื้นฐานของตัวเอง แต่ทำบรรจุภัณฑ์เชิงปริมาณตาม Qwen3.6 แม้ว่าเทคโนโลยีการบีบอัดข้อมูลจะก้าวล้ำหน้า แต่ก็ยังต้องรอดูว่าอุปสรรคทางเทคนิคจะสูงเพียงใด และทีมอื่นๆ จะสามารถสร้างเอฟเฟกต์ที่คล้ายกันได้อย่างรวดเร็วหรือไม่ คำถามเกี่ยวกับความสามารถด้านการมองเห็นไม่สามารถมองข้ามได้: MMMU Pro/OCRBench เวอร์ชัน 1 บิตได้คะแนนเพียง 59.6 ซึ่งลดลงอย่างมากจากระดับพื้นฐานที่ 72.6 ซึ่งบ่งชี้ว่าการหาปริมาณมากมีผลกระทบต่อความเข้าใจด้านภาพมากกว่างานข้อความ

  • Bonsai 27B เหมาะสำหรับนักพัฒนาดังต่อไปนี้: นักพัฒนาแอปพลิเคชั่นมือถือที่ต้องการความสามารถ AI ท้องถิ่นแบบออฟไลน์; สถานการณ์ที่มีความอ่อนไหวต่อความเป็นส่วนตัว (ทางการแพทย์ กฎหมาย การประมวลผลเอกสารทางการเงิน) นักวิจัยที่ต้องการใช้โมเดลระดับ 27B บนกราฟิกการ์ดระดับผู้บริโภค (8-12GB VRAM) และไปป์ไลน์การประมวลผลข้อความที่ไม่ต้องการความแม่นยำในการเรียกเครื่องมือสูง ไม่แนะนำให้ใช้ในสถานการณ์ต่อไปนี้: ระบบการผลิตที่ต้องการความสามารถ Agentic แบบหลายขั้นตอนที่เสถียร ไปป์ไลน์การทำความเข้าใจด้วยภาพที่มีความแม่นยำสูง และงานการให้เหตุผลทางคณิตศาสตร์ที่ซับซ้อน กลยุทธ์การปรับใช้ที่สมเหตุสมผลที่สุดในปัจจุบันคือสถาปัตยกรรมไฮบริด: Bonsai 27B (เวอร์ชัน Ternary) ทำหน้าที่เป็นกำลังหลักในฝั่งไคลเอ็นต์ในพื้นที่ และใช้สำหรับงานที่มีข้อกำหนดด้านความเป็นส่วนตัวและมีเวลาแฝงต่ำ โมเดลขนาดใหญ่บนคลาวด์จัดการการใช้เหตุผลที่ซับซ้อนและสถานการณ์ที่ต้องการความแม่นยำสูง สแต็กนี้จะเป็นไปได้อย่างแท้จริงในปี 2569 เท่านั้น เนื่องจากในที่สุดท้องถิ่นก็มีโมเดลที่แข็งแกร่งเพียงพอแล้ว

  • Bonsai 27B เป็นโหนดที่โดดเด่นในการพัฒนา AI ฝั่งอุปกรณ์: ช่วยให้ "รุ่นระดับ 27B สามารถติดตั้งบนโทรศัพท์มือถือ" จากการพูดคุยทางทฤษฎีไปสู่การดาวน์โหลดและรันได้จริง การรักษาความแม่นยำของชิ้นงานที่มีโครงสร้าง เช่น คณิตศาสตร์และการเขียนโปรแกรม เป็นที่ยอมรับได้ แต่ข้อบกพร่องในงานด้านเอเจนต์และงานภาพก็ชัดเจนเพียงพอเช่นกัน เนื่องจากเป็นโมเดลฝั่งไคลเอ็นต์แบบโอเพ่นซอร์สของ Apache 2.0 จึงทำให้นักพัฒนามีระดับสแต็กใหม่ ซึ่งไม่ใช่การทดแทนที่ครอบคลุม แต่เป็นตัวเลือกใหม่ที่ไม่เคยมีมาก่อน ในเดือนกรกฎาคม ปี 2026 นี่ถือเป็นก้าวที่ยิ่งใหญ่ที่สุดบนเส้นทางสู่ AI ฝั่งอุปกรณ์ แต่ไม่ใช่ก้าวสุดท้าย

รีวิวจากผู้ใช้

  • อวาตาร์
    Richard112
    终于有个 27B 模型能在手机上跑了,下载完试了下,3.8GB 确实小得离谱。日常写写文案、做做总结完全够用,但别指望它像云端模型那样聪明,开 thinking 模式才稳,这个要注意。

  • อวาตาร์
    SMartinez_66
    部署是真的很简单,LM Studio 下搜一下就能用,门槛低到离谱,这点做得比很多开源模型好。我 8G 老卡也能跑,虽然必须开 thinking 模式。

  • อวาตาร์
    TMorgan_20248
    用 RTX 3090 跑了一下,Q4_K_M 版本 16GB 单卡就能跑,28 tok/s 的生成速度对于日常聊天完全够了。做结构化 JSON 提取贼稳,没有幻觉,这点好评。

  • อวาตาร์
    BettyLopez007
    我在 iPhone 17 Pro 上试了 1-bit 版本,速度确实只有 11 tok/s 左右,但考虑到是本地跑 27B 的模型,这个表现已经超出预期了。电池消耗还行,不会明显发热。

  • อวาตาร์
    BAndersonK
    实测发现它做工具调用的时候不太行,多步 agent 流程到了第三步就开始掉链子,格式也飘了。当聊天模型用可以,做自动化 agent 还差点意思。

  • อวาตาร์
    月光_17
    Apache 2.0 开源协议是真香,部署不需要法务审查,直接下载就能用。这一点比 benchmark 上的分数重要多了,商用省心。

  • อวาตาร์
    Jesse_Foster_66
    说它是 DeepSeek 时刻有点过了,毕竟它只是 Qwen 3.6 的量化打包,没有训练自己的基础模型。但压缩技术本身确实有两把刷子。

  • อวาตาร์
    GEbel
    用 M5 Max 跑 ternary 版本,58 tok/s 的速度已经能当日常主力了。262K 上下文窗口是真的大,加载一整本技术书进去做问答,记忆没丢。

  • อวาตาร์
    StephanieFoster369
    和 Gemma-4-26B 对比了一下,智商确实不如人家,但 Bonsai 的代价最小,3.8GB 就能跑,生成速度还快一倍,就看你在意什么了。

  • อวาตาร์
    Ryan_RussellQ
    苹果在和 PrismML 谈评估我觉得是好事,如果未来 iPhone 能本地跑 27B 的模型,Siri 应该能支棱起来吧。现在手机上的端侧模型才 3B,差距太大了。

  • อวาตาร์
    云烟_6
    弱智吧测试翻车了哈哈,问它洗车店离 30 米是开车去还是走路去,它真在那分析油耗。不过这种脑筋急转弯本来也不是大模型的强项。

  • อวาตาร์
    Billy.Green
    运行在手机上和匹配全精度模型不是一回事,这个清醒的认识很重要。用之前先想清楚你的场景是哪一类,需要 agent 能力就选 ternary 5.9GB 版。

  • อวาตาร์
    海浪_21
    最让我惊讶的是它的智慧密度概念。54GB 压到 3.9GB,保留 90% 的能力,这在数学和编程任务上确实做到了。视觉能力掉得有点多,MMMU 才 59.6,看图还是差点。

  • อวาตาร์
    Mason.TorresSr
    说实话我对这个模型最大的期待是离线翻译和文档处理,出差坐飞机也能用。试了下把一份 30 页的 PDF 丢进去做总结,效果还行,就是加载慢了点。

  • อวาตาร์
    Michelle_RussellQ
    在 Together.ai 上试了 preview API,不用下载就能测,这点很友好。回复质量的确定位在「够用」级别,和 GPT 4.5 肯定比不了,但看在免费的份上,很香了。

  • อวาตาร์
    Jonathan196
    Hacker News 上讨论挺热烈的,大家最担心的还是极端量化对 agentic 能力的侵蚀。数学掉 2% 无所谓,但 tool calling 掉 17.5% 在真实场景里影响太大了。

  • อวาตาร์
    Karen.Rodriguez007
    我看到的观点是混合部署才合理,本地模型处理隐私敏感和轻量任务,复杂推理留到云端。Bonsai 让本地这端终于有足够强的模型了,不用所有事都上云。

  • อวาตาร์
    Jennifer.Kelly_99
    视觉塔需要额外下载 900MB,而且不开 thinking 模式图片识别不准。但日常看图读文档识别验证码还是挺快的,0.5 秒就出结果。

  • อวาตาร์
    Lydia.MendozaX
    对于搞本地 AI 的开发者来说,这是今年夏天最有意思的发布。它把手机端侧的门槛从 3-8B 的小模型推进到了 27B 级别,质的飞跃。

  • อวาตาร์
    Arthur90
    最大的亮点是真正离线可用,数据不出设备。对于处理敏感信息的场景,比如律师看合同、医生看病例,这个价值比 benchmark 分数重要得多。

  • อวาตาร์
    Matthew.MurphyK
    用 Locally AI 这个 App 直接就能在 iPhone 上跑,不需要折腾环境配置。不过下载模型最好用 WiFi,13GB 的数据量用流量扛不住。

  • อวาตาร์
    KathleenRoberts_Plus1
    刚下载就翻车了,没有 Hugging Face 的 token 认证的话 27B 的仓库下载不了,要先申请访问权限。还好小的模型可以直接下,建议先试试 8B 版本。

  • อวาตาร์
    GregoryNelson_66
    好奇它和常规 4-bit 量化的本质区别,看了技术文档才发现是贯穿到所有层的低比特设计,不留高精度逃生舱。这也是它能压到 3.9GB 的原因。

  • อวาตาร์
    DPrice007
    从 54GB 到 3.9GB,14 倍的压缩比,还能保持 90% 的智力保留,不管怎么说都是技术奇迹。微软苹果谷歌都该紧张一下了。

  • อวาตาร์
    NWrightIII
    17.5% 的工具调用精度损失在多步场景里会被指数放大,每一步 95% 成功率,跑 10 步就剩 60% 了。生产环境用的话还是得配云端兜底。