计算机科学 > 人工智能
[提交于 2026年9月14日]
标题:打破三值大语言模型的 1.58 比特壁垒
摘要:三值大语言模型(LLM)将每个权重存储为三个符号 之一,因此三值模型的成本通常参照信息论的每权重 比特来衡量。主流的部署格式将五个三值权重打包进一个字节(五三进制打包),而由于实践中使用的二次幂分组大小,这会向上取整为每权重 比特。这种有效存储位宽将三个符号 视为等概率。我们测量了 29 个三值 LLM 模型的实际符号分布,发现零最多占全部权重的 。受此发现启发,我们提出了 BITCOS,一种简单的分布自适应布局,由稠密的存在位图加上压缩的符号向量组成,在模型权重的零密度为 时,每个权重元素的成本为 比特。在 29 个测试模型中的 26 个里,BITCOS 比五三进制打包更紧凑地存储权重,并在其中最稀疏的模型上达到每权重 比特。BITCOS 适合在现代处理器和 GPU 上高效解包,我们为 AVX-512、AVX2 和 Intel Xe2 GPU 提供了优化的解包序列。与生产级最先进的三值矩阵-向量乘法内核相比,在真实世界三值模型所表现出的零密度下,我们提出的布局所实现的增益最高达 。最后,我们展示了在 5 个不同平台(客户端和服务器 CPU、集成和独立 Xe2 GPU)上的端到端 LLM 推理结果,其中解码吞吐量在 CPU 上最高提升 ,在 GPU 上最高提升 。
提交历史
来自:Evangelos Georganas [查看邮件]
[v1]2026年9月14日星期一 20:54:24 UTC(144 KB)
参考文献与引用
加载中...
文献与引用工具
Bibliographic Explorer
Connected Papers
Litmaps
scite Smart Citations
(什么是 Smart Citations?)# 与本文相关的代码、数据和媒体
alphaXiv
CatalyzeX Code Finder for Papers
DagsHub
Gotit.pub
Hugging Face
ScienceCast
(什么是 ScienceCast?)# 演示
推荐与搜索工具
Influence Flower
CORE Recommender
(什么是 CORE?)# arXivLabs:与社区合作者的实验性项目
arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
与 arXivLabs 合作的个人和组织都认同并接受了我们开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。
有能为 arXiv 社区增添价值的项目想法吗?了解有关 arXivLabs 的更多信息。
