返回 文章 学习 CMS 文章

PrismML 用三值权重把 27B 大模型压到 5.9GB,瞄准端侧 AI

PrismML 用三值权重压缩技术,把 27B 大模型塞进 5.9GB,让强推理模型跑在个人设备上。

PrismMLBonsai 2模型压缩三值权重
成长分 / 100 69 综合收获、行动、留存与影响

PrismML 用三值权重把 27B 大模型压到 5.9GB,瞄准端侧 AI
为什么值得读了解 LLM 压缩技术的最新进展:三值权重(+1/-1/0)如何把每个权重从 16 位大幅缩减。

看到端侧 AI 的可行性信号:5.9GB 的 27B 模型可装进 PC 甚至高端手机,兼顾隐私与免费。

关键洞察
  1. Bonsai 2 27B 将 Qwen3.8 27B 压缩到 5.9GB,内存减少 9 到 10 倍,达到原始模型综合基准分数的 98%。
  2. 压缩性能逐代提升:第一代 Bonsai 达到 95%,Bonsai 2 提升至 98%,原始模型已被下载超 1100 万次,更小模型被下载 260 万次。
  3. 核心技术是三值权重,把每个权重简化为 +1、-1 或 0 三种取值,从而大幅减少存储空间。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:4705

如果 AI 实验室 PrismML 还没有进入你的视野,那它应该被关注——不是因为它融了巨额资金(它还没有,只融了 2225 万美元种子轮),而是因为参与其中的技术人才以及它正在开发的可能改变行业的技术。

PrismML 押注的是:能力强、性能高、具备推理能力的大语言模型,实际上并不一定要很大。

它正在把推理模型做得小到可以装进 PC 和智能手机。(甚至有传言称它正在与苹果洽谈,不过 CEO Babak Hassibi 拒绝对 TechCrunch 置评此事。)

周四,PrismML 发布了 Bonsai 2 27B,这是其模型家族中的最新成员,它将 Qwen3.8 27B——阿里巴巴一个被广泛使用的开源模型——压缩到了 5.9 GB。这足够小,可以装进一台 PC,也可能装进一部高端智能手机。与原始模型相比,内存减少了 9 到 10 倍。

PrismML 由一群加州理工学院的研究人员创立,由 Hassibi 领导,他是加州理工学院教授,也是压缩技术领域的专家。这家初创公司还邀请 Ion Stoica 担任顾问。Stoica 是 Databricks(以及其他公司)的联合创始人,也是伯克利著名的 Sky Computing Lab 的主任,该实验室孕育了许多技术和初创公司,从 LettaSGLang

PrismML 还获得了投资者 Khosla Ventures、Cerberus Capital 和加州理工学院的支持。

这家初创公司当然不是唯一一家研究 LLM 压缩技术的公司。由西班牙 Donostia 国际物理中心一位知名教授创立的 Multiverse Computing 是另一家。(而且 Multiverse Computing 已经融到了巨额资金。)

但 Hassibi 表示,PrismML 的压缩技术之所以独特,是因为其 LLM 与原始模型相比几乎没有损失性能。Bonsai 2 达到了 Qwen 综合基准测试分数的 98%。这比几个月前、也就是 3 月发布的第一代 Bonsai 有所提升,后者达到了 95%。该公司称,那个原始模型已经被下载超过 1100 万次,而 PrismML 更小的模型又被下载了 260 万次。

所以这表明 PrismML 的压缩结果在一次次的发布中不断改进。它是否最终能达到 100% 的基准性能持平,还有待观察。Hassibi 说,压缩很可能总会产生某种影响。

不过,完美的基准持平其实相当学术化。LLM 在未压缩状态下也没有那么准确,基准测试也没有那么完美地反映实际任务,因此 2% 的性能下降不太可能对模型在实际使用中的表现产生实质性影响。(此外,周边软件——模型运行所在的测试框架——在准确性方面也很重要。)

PrismML 表示,它通过缩小构成模型的“权重”来实现这一点——权重本质上是模型在训练过程中学习并存储的信息。通常,每个权重需要 16 位。PrismML 的方法被称为“三值”权重,将其简化为三种取值:+1、−1 或 0。由于每个权重需要存储的数值小得多,模型占用的空间也大幅减少。(如需深入了解这种压缩技术,可参阅该项目的 Hugging Face 页面。)

这家初创公司的下一个目标是将这种压缩技术应用于更大的模型。Hassibi 告诉 TechCrunch:“我们接下来将发布的模型,有望在未来几个月内推出,将处于数千亿参数级别,我预计在那里更容易保留智能。”

他补充说,随着模型规模增长,“在不损失智能的情况下压缩它们的空间就更大。所以我想说,作为一个总体趋势,对于更大的模型,更容易达到 100%。”

Stoica 告诉我们,他对这项技术感到兴奋,因为它使先进模型能够在用户设备上运行。“智能将触手可及,而且它将免费,因为它运行在你已经购买的设备上。它也将是私密的,因为你不会把它发送到云端。”