AI 新创PrismML 于9 月17 日发表Bonsai 2 27B,这是其三元量化模型家族的最新版本。这款模型基于阿里巴巴的开源模型Qwen3.8 27B,通过将模型权重压缩到仅需+1、-1、0 三种数值(即「三元权重」),将原本需要约54 GB 记忆体的模型缩小到5.9 GB,体积减少约9 倍,同时在综合基准测试中保留98.2% 的原始效能。这代表一颗27B 等级的推理模型,现在能在个人电脑甚至高阶智慧型手机上执行。对于一直在等待「装置端AI」走向成熟的开发者与使用者而言,这是一个关键的技术突破。
从加州理工实验室走出来的压缩技术
PrismML 由加州理工学院(Caltech)的研究团队创立,执行长Babak Hassibi 是该校教授,专精压缩技术领域。公司的顾问阵容同样亮眼,Ion Stoica 是Databricks 的共同创办人,同时也是加州大学柏克莱分校Sky Computing Lab 的主任,该实验室孕育了Letta、SGLang 等多个知名技术专案与新创公司。投资方包括Khosla Ventures、Cerberus Capital 以及加州理工学院本身。

三元权重的运作原理
一般大型语言模型的每个权重需要16 位元来储存。 PrismML 的做法是将每个权重简化为三个可能的数值:+1、-1 或0。这种「三元」表示法每个权重只需log₂(3) ≈ 1.585 位元,加上每128 个权重共用一个FP16 缩放因子(额外增加16/128 位元),实际每个权重约1.71 位元。相比标准的16 位元,这是约9.4 倍的压缩率。
这种压缩方式贯穿了模型中所有矩阵运算密集的元件,嵌入层、注意力投影、MLP 投影以及语言模型输出头。只有少量的正规化与缩放参数维持较高精度。 PrismML 强调,Bonsai 系列属于对既有开源模型的低位元重新表示,并非从头预训练。
Bonsai 2 27B 基准测试成绩:压缩的代价有多大?
根据PrismML 公布的数据,Bonsai 2 27B 在15 项基准测试(思考模式)中的表现如下:
- 数学:93.40(原始Qwen 为95.33)
- 程式码:85.96(原始88.74)
- 知识与推理:76.96(原始83.15)
- 代理与工具呼叫:74.01(原始80.00)
- 指令遵循:71.77(原始78.47)
- 视觉:65.19(原始72.61)

整体来看,三元版本保留了原始模型约94.6% 的效能。相较之下,PrismML 同时提供的一位元(binary)版本体积进一步缩小到3.9 GB,但效能保留率降至89.5%。
传统的低位元量化方式(如Q4_K_XL、IQ2_XXS)在某些基准测试上会出现选择性崩溃。以IQ2_XXS(2-bit)为例,它在AIME26 数学测试上跌至57.5 分、LiveCodeBench 跌至56.4 分,但在MMLU-Redux 上仍有88.93 分,短期问答类的基准测试掩盖了它在复杂推理任务上的严重退化。 PrismML 的三元压缩方式在这方面的衰减则相对平缓。
记忆体才是核心瓶颈
要在手机上执行模型,储存空间只是其中一个考量。 iOS 系统对单一应用程式的记忆体使用量有硬性限制,大约是实体记忆体的一半。一台12 GB 记忆体的iPhone,实际上只能给单一App 使用约6 GB。
KV 快取是另一个关键预算,Bonsai 27B 架构中只有16/64 层使用完整的注意力快取,FP16 下每token 约需64 KiB。在262K token 的上下文视窗下,KV 快取需要约17.2 GB;使用4-bit KV 快取可压缩到约4.3 GB。
在不同硬体平台上的吞吐量测试结果:
- M5 Max(Binary):生成66.4 tok/s,预填充874 tok/s
- M5 Pro(Ternary):生成26.2 tok/s,预填充393 tok/s
- iPhone 17 Pro Max(Binary):生成11.0 tok/s,预填充111 tok/s
- H100 GPU(Binary):生成104.8 tok/s,预填充2,755 tok/s
官网同时标榜Bonsai 2 相较原始模型有8 倍吞吐量提升与5 倍能耗降低。
不只压缩大小,代理能力是重点突破
Bonsai 2 相较第一代最大的变化是整体效能保留率从95% 提升到98.2%,但在特定领域的进步更为关键。 PrismML 特别强调,新模型在代理式程式码撰写(agentic coding)、多模态推理以及长时间跨度的工具使用(long-horizon tool use)三个面向有明显改善。
这三个能力恰好是当前AI Agent 生态系最需要的:撰写与修改程式码、理解图片与文字的混合输入、在多步骤任务中维持上下文。过去量化模型最大的弱点往往是这类复杂推理任务,压缩后的模型在简单问答上表现不错,但一旦涉及多步骤逻辑就会严重退化。 Bonsai 2 在这方面的改善,让它具备了作为装置端Agent 大脑的实力。
在工具呼叫的基准测试中,Bonsai 2 的三元版本达到74.01 分(满分100),虽然与原始模型的80.00 分有差距,但已远高于传统2-bit 量化方式在同类测试中的表现。一位GitHub 使用者MiaAI-Lab 的独立评估也验证了这一点:三元版本在简单与中等难度的工具使用任务上分别达到95.2% 与88.4% 的原始水准。不过X 上也有使用者反应PrismML 夸大了Bonsai 2 的能力,他实际使用表现并不如官方所宣称优异。
谁在用?实际应用场景
PrismML 为Bonsai 2 规划了四个主要应用场景:
- 笔记本端代理:三元版本可在笔记本上完整处理262K token 上下文的程式码仓库分析,适合需要在本地环境工作的开发者
- 手机端推理:一位元版本可塞进iPhone 等装置,白皮书测量在iPhone 上每消耗1% 电池电量可产生672 个token
- 隐私敏感与离线工作流:所有资料留在装置上,完全不经过云端
- 单GPU 服务:搭配4-bit KV 快取,27B 等级的品质可在24 GB 显示记忆体的显示卡上提供服务
下载量已破千万,下一步是百亿参数等级
PrismML 的第一代Bonsai 模型(今年3 月发布)已累计超过1,100 万次下载,加上其他更小型号的260 万次,整个家族的总下载量已突破1,360 万次。第一代Bonsai 的基准测试保留率为95%,Bonsai 2 将这个数字提升到98.2%,显示压缩技术仍在持续进步。
PrismML 计划在未来几个月内发布数百亿参数等级的压缩模型。 「模型越大,压缩时保留智慧的空间就越大。对于更大的模型,更容易逼近100% 的效能保留。」PrismML 的技术路线是建立一套从小到大的完整压缩模型产品线,而非仅仅做出一两个能跑的手机模型。
Bonsai 2 27B 已在Hugging Face上架,采用Apache 2.0 授权,支援llama.cpp(CUDA、Metal)和苹果的MLX 推理框架。
