Administrator
Published on 2026-07-28 / 1 Visits
0
0

"Bonsai 27B 上 iPhone:1-bit 口径审计"

“27B 模型只有 3.9GB”可以同时准确又具有误导性。它准确描述了 PrismML 的原生二进制语言权重,却不能代表 MLX 下载包、完整多模态资源、应用峰值内存或长上下文所需内存。

真正值得关注的不是标题里的一个数字,而是 Bonsai 27B 似乎跨过了一条真实的部署边界:27B 级模型可以在高端手机上交互式运行。但产品选型仍取决于四套预算:权重存储、常驻内存、运行峰值和任务可靠性。

下文涉及的 Bonsai 性能数字均来自 PrismML,另有说明的计算除外。截至 2026 年 7 月 28 日,我没有找到使用同一台 iPhone、同一模型文件、同一运行时和同一提示集完成的受控独立复测。

阅读时间:约 12 分钟|正文约 5,000 字

30 秒摘要

  • 1.125 bit 的计算与 3.9GB 原生语言权重口径内部自洽。
  • 公开 MLX 包是 5.13GB,真实运行峰值从 4K 上下文的 5.9GB 上升到压缩 KV cache 后完整 262K 窗口的约 9.4GB。
  • 每秒 11 token 和基准结果均是厂商测量,还不是受控独立复测。
  • 89.5% 是 15 项基准平均分之比,工具调用、指令遵循和视觉的保留程度更低。

1.125 bit/weight 为什么算得通

Bonsai 27B 模型卡把权重格式称为 Binary g128。每个权重保存 1 个符号位,每 128 个权重共享 1 个 FP16 scale。

有效位宽因此是:

1 个符号位 + 16 个 scale 位 / 128 个权重 = 1.125 bit/weight

用 270 亿权重乘以 1.125 bit,得到约 3.8GB 的十进制原始权重。加上少量高精度参数和封装开销,PrismML 给出的原生语言模型体积为 3.9GB。二者在数学上相容。

这至少说明“1-bit”并非把多数层留在高精度、只给少数层贴上低比特标签。PrismML 称二进制表示覆盖 embedding、attention projection、MLP projection 和 LM head,只有少量 normalization 与 scale 参数保留高精度。

内部自洽不等于独立验证,但它回答了一个基础问题:3.9GB 与声明的权重表示并不明显矛盾。

3.9GB 只是多套内存口径之一

模型卡公开的信息足以把部署层次拆开:

层次 PrismML 给出的数字 实际含义
原生二进制语言权重 3.9GB 紧凑语言模型表示
公开 MLX 磁盘包 5.13GB 包含 MLX 格式开销和 vision tower 的 safetensors
MLX 在 4K 上下文的峰值 5.9GB 权重、activation、cache 和运行时开销
MLX 在 10K 上下文的峰值 6.3GB 更长上下文下的运行预算
MLX 在 100K 上下文的峰值 12.2GB 未压缩 KV cache 的口径
完整 262K 窗口 约 9.4GB 启用 4-bit KV cache 后的厂商估计

MLX 包更大,是因为当前 grouped low-bit 格式每组同时保存 scale 和 bias,而 PrismML 的原生表示只需 scale。公开 MLX 文件还把 vision tower 打包在同一个文件里。

运行时又是另一层。权重变成二进制,不会让 activation、buffer 和 KV cache 消失。PrismML 估计,长上下文开始主导之前,各后端的运行时 buffer 约需 1.3GB。

这也修正了发布叙事里最容易混淆的一点:模型支持 262K 上下文,不等于同一台手机能在完整 262K 窗口下运行。PrismML 自己的表格显示,即使启用 4-bit KV cache,完整窗口的峰值仍约为 9.4GB。如果按照 PrismML 发布文中对 12GB iPhone 的描述,应用实际可用内存约为 6GB,就不能假定“手机运行”与“完整上下文”可以同时成立。

架构可以支持 262K,具体设备的实用窗口却可能小得多。产品文档应公布设备级上下文上限,而不是只重复模型最大值。

权重压缩后,瓶颈转移到运行时

压缩权重改变了系统瓶颈,却没有消灭瓶颈。

在短上下文中,二进制权重主导内存预算,并让手机部署成为可能。上下文增长后,KV cache 和运行时开销开始主导。持续生成时,内存带宽、热状态和电池又成为约束。进入多模态场景后,还要加入 vision tower 与图像处理路径。

因此,下载完成或加载成功的截图不是充分的部署测试。一套有用的测试至少要记录:

  1. 精确的模型文件与运行时 commit;
  2. 加载后的常驻内存;
  3. 目标上下文长度下的峰值内存;
  4. 首 token 延迟与持续生成速度;
  5. 长时间运行中的热状态和电量变化;
  6. 相同条件下的任务完成质量。

当模型已经能装进去,真正的问题会变成:上下文变长、手机变热后,它是否仍然有用?

每秒 11 token 测量了什么

PrismML 称 Bonsai 27B 在 iPhone 17 Pro Max 的 MLX Swift 运行时上,tg128 达到每秒 11.0 token。tg128 测的是连续生成 128 个 token 的速度,不是 prompt processing,也不能代表长文档的首 token 延迟。

白皮书还提供了一次持续电池测试:

  • 持续生成速度:每秒 10.82 token;
  • 时长:约 5.2 分钟;
  • 电量变化:100% 降至 95%;
  • 每 1% 电量生成约 672 token;
  • 热状态:从 nominal 变为 fair,厂商描述为轻微降频。

这比冷启动后的短暂峰值更有价值,但仍然是厂商测试。白皮书明确说,手机能耗来自电量百分比估计,不是硬件功率仪表测量。约五分钟的测试也不足以代表长期本地 Agent 会话。

合适的结论应保持克制:PrismML 公布了清晰的方法,并在一台旗舰手机上测得可交互速度。这个结果仍需要在不同应用状态、环境温度、上下文长度和持续负载下独立复现。

89.5% 是基准平均分之比

PrismML 用 15 项 thinking-mode 基准比较 FP16 参考模型和 1-bit 模型:

  • FP16 平均分:85.07;
  • 1-bit 平均分:76.11;
  • 二者比值:89.5%。

把它称为“保留 89.5% 的智能”会把异质结果压缩成一个营销数字。分项平均更能说明问题:

能力类别 FP16 1-bit Bonsai 27B
数学 95.33 91.66
编码 88.74 81.88
知识与推理 83.15 73.39
指令遵循 78.47 65.74
Agent 与工具调用 80.00 66.03
视觉 72.61 59.57

数学类别保留约 96% 的分数,编码约为 92%。Agent 与工具调用约为 83%,视觉约为 82%。如果产品依赖反复的结构化工具调用,就不能把总体 89.5% 当作可靠性估计。

这套评测仍有价值,因为 PrismML 在白皮书里公开了基准列表、参数、逐项结果和部分评测方法。但它依然是厂商评测,部分任务使用未固定 seed 的选项打乱,而且 15 项基准无法代表所有语言、领域和多步应用。

真正缺少的是同预算的小模型对照

发布材料主要比较:一个 27B FP16 模型经过极限压缩后还能保留多少能力。开发者实际面对的选项通常不同:

  • 使用定制 kernel 的 1-bit 27B;
  • 或者在相近内存预算下,使用运行时更成熟的较小 4-bit 模型。

参数量不是产品结果。真正指标是单位设备预算内能成功完成多少任务。

较小模型可能加载更快、给上下文留出更多空间、运行更凉,并兼容更多前端。Bonsai 可能保留更多知识容量或推理能力。两种优势都不能只凭参数量推断。

选型应使用真实工作负载。做本地 Agent,就测试多轮工具调用、错误参数、工具失败后的恢复和长会话漂移。做私密文档分析,就测检索准确率、首 token 延迟和真实文档长度下的峰值内存。做多语言产品,就测试目标语言,不要直接继承英文基准平均分。

一套可执行的验收方法

上线前固定一个模型文件和一个运行时 commit,再做四道门槛。

内存门槛:记录下载包、常驻权重,以及 4K、16K 和产品最大上下文下的峰值内存。文本和视觉分别测试。

持续性能门槛:至少连续运行 20 分钟,测首 token、prompt processing 和 decode。记录热状态、电量变化和波动,不只保留最快一次。

质量门槛:在相同峰值内存预算下,与较小 4-bit 模型比较。评估任务是否完成,而不是哪段文字更讨喜。数学、编码、指令遵循和工具调用应分开计分。

失败门槛:测试内存压力升高、上下文接近上限、工具返回错误或应用进入后台时会发生什么。本地模型只有在外围应用能安全恢复时,才构成产品能力。

结论

Bonsai 27B 最有力的主张,不是 3.9GB 能代表整个应用,而是端到端二进制表示配合定制 kernel,让 27B 级模型进入了手机内存预算中的交互运行区间。

这是有意义的工程边界,但还不是普适的部署结论。

公开材料支持 1.125 bit 的计算,也提供了少见的详细内存与评测表格。它们同时暴露了代价:MLX 封装更大,长上下文会迅速主导内存,持续手机性能受热约束,不同任务的能力保留率差异明显。

可以把这次发布视为很强的试点候选。在相同模型文件和运行时得到独立复测前,应继续把性能数字标记为厂商测量。

如果 Bonsai 已进入你的部署候选清单,下一步就是在目标设备上运行前述四道验收门槛,并与同内存预算的较小 4-bit 模型对照。

常见问题

Bonsai 27B 真的是 1-bit 模型吗?

它的语言网络使用二进制权重,每 128 个权重共享一个 FP16 scale,有效位宽为 1.125 bit/weight。PrismML 称低比特表示覆盖主要语言模型层。

整个模型在 iPhone 上只占 3.9GB 吗?

不是。3.9GB 描述原生语言权重。MLX 包、运行时 buffer、activation、KV cache 和可选视觉组件还需要额外存储或内存。

iPhone 能使用完整 262K 上下文吗?

架构支持 262K,但 PrismML 估计启用 4-bit KV cache 后,完整窗口峰值约为 9.4GB。实际可用上下文取决于设备及应用内存上限。

89.5% 能力保留意味着答案有 89.5% 那么好吗?

不是。它是 15 项基准平均分之比。不同能力类别保留程度不同,真实应用还可能遇到其他失败模式。

开发者应把它与什么比较?

应与相同峰值内存预算下的较小 4-bit 模型比较,并在目标设备上测持续延迟、任务成功率、工具调用可靠性、能耗和上下文容量。

参考资料


Comment