Bonsai 2 把 27B 模型压到 5.9GB,接近原版不等于无损
PrismML 的新品公告宣布推出 Ternary Bonsai 2 27B:基于 Qwen3.8 27B,将模型体积压到 5.9GB,并声称保留全精度版本 98.2% 的综合基准表现。两个数字放在一起很吸引人,但它们分别回答存储和评测问题,并不等于任何电脑都能无损运行完整工作流。
作者:林岚|OC 开发者生态编辑
PrismML 的新品公告宣布推出 Ternary Bonsai 2 27B:基于 Qwen3.8 27B,将模型体积压到 5.9GB,并声称保留全精度版本 98.2% 的综合基准表现。两个数字放在一起很吸引人,但它们分别回答存储和评测问题,并不等于任何电脑都能无损运行完整工作流。
一句话结论:这次进展是用接近上一代的体积承载更强底座;真正的部署价值,要看具体任务损失、运行内存和持续性能。
与上一代相比,新增的不是“能塞进去”
OC 在7 月 15 日的报道中已经讨论过 Bonsai 27B 的压缩路线,以及模型进入手机内存预算后仍需面对的速度与发热问题。此次新增事实,是 Bonsai 2 更换了底座,并公布新的能力保留和运行结果,而不是第一次证明 27B 权重可以缩小。
三值权重只保留负一、零和正一,再配合分组缩放信息。这种表示方式能显著减少权重占用,但“数值只剩三个取值”和“模型文件每参数恰好占某个理论比特数”不是一回事。缩放、打包及运行内核都参与最终的工程结果。
这里也要与 OC 9 月 17 日报道的 BITCOS 区分:一个是模型发布和量化结果,一个是利用零值分布改进存储布局的研究。它们讨论相邻问题,不能把两边最漂亮的数字拼成同一个产品规格。
98.2% 是综合分数,不是逐题一致
综合基准会把不同任务汇总,方便观察整体变化。但一个平均值可能掩盖个别能力的退步,也无法说明所有输出是否与原版一致。将这种结果称作“接近原版”可以理解,直接写成严格无损则不准确。
对编程助手来说,一次长任务会经过检索、改代码、运行工具和解释结果。某个局部差异未必重要,也可能影响后面每一步。因此,采用方应检查自己的关键任务,而不只是看综合分数损失是否很小。
厂商公布的测试是一个起点,不是独立验收。尤其不能把基准保留率换算成“只有这么多用户会出错”,因为任务分布、错误后果和评测单位都不相同。

文件大小只是运行预算的一部分
5.9GB 有助于降低权重装载门槛,但推理还需要上下文缓存、临时缓冲和运行环境。模型声明支持较长上下文,不意味着较小内存设备可以在这个上限下保持同样吞吐。
从使用体验看,短问题持续输出很快,与先读完一大批材料再回答,是不同负载。首个输出的等待时间、上下文增长后的速度,以及长时间运行后的功耗,都会影响是否适合常驻助手。
公告列出 CUDA 与 Apple MLX 等运行路径。这意味着专用低比特内核是方案的一部分,而不是下载权重后交给任何通用运行时都能自动得到相同性能。格式兼容、内核维护和硬件支持,也属于部署成本。
本地能力扩大,数据边界仍取决于应用
本地推理可以减少把输入交给远端模型的需要,但围绕它构建的应用还可能搜索网页、调用外部工具或同步历史。模型在本机,不能替整个产品作出“数据绝不外传”的承诺。
比较方案时,适合同时记录任务成功率、等待时间、内存峰值和数据去向。只有这些条件满足实际需求,压缩才从技术展示变成使用价值。更小的权重为设备端打开空间,却没有替应用完成全部工程。
关键事实
- 来源:PrismML 新品公告;性能数据为厂商报告。
- 新版本:Bonsai 2 27B,基于 Qwen3.8 27B,模型体积 5.9GB。
- 数字边界:98.2% 为综合基准表现保留率,不是逐输出无损保证。
- 旧稿关系:追踪上一代 Bonsai,不重复苹果接触传闻。
OC 判断
低比特模型值得关注的不是压缩口号,而是同一设备预算能否完成更多真实任务。Bonsai 2 提供了更强候选,但长期上下文、特定任务和运行内核仍需要单独验收。
为什么重要
对开发者,本地可用模型的选择正在扩大;对用户,是否真能离线、流畅且稳定工作,比模型文件能否下载到手机更重要。
评论
围绕这篇文章补充信息、提出问题或分享观察。