研究发现三值大模型中零权重占比高达 51.5%,新存储格式 BITCOS 利用这一分布将实际存储密度从 1.625 bits 降至 1.485 bits/参数,在 29 个测试模型中的 26 个上优于传统五三进制打包。
三值大语言模型(Ternary LLM)将每个权重存储为 -1、0、+1 三种值之一,理论信息熵上限约 1.585 bits/参数,因此业界常以"1.58 bits"标称三值模型的存储成本。然而,实际部署中通行的"五三进制打包"格式(5 个三值权重打入 1 字节)因需对齐 2 的幂次组大小,实际存储成本达到 1.625 bits/参数——已高于理论上限。
来自 arXiv(arXiv:2609.16338)的研究测量了 29 个三值 LLM 的真实权重分布,发现零权重的占比最高可达 51.5%。这意味着三值模型的权重远非等概率分布,而传统打包格式完全忽略了这一统计特性。
研究者基于上述发现,提出 BITCOS(分布自适应存储布局),结构分两部分:
给定零权重密度 z,BITCOS 的存储成本为 (2−z) bits/参数。当 z=51.5% 时,理论成本约 1.485 bits/参数。实测 26/29 个模型上,BITCOS 优于传统五三进制打包,最优模型实际达到 1.485 bits/参数。
三值 LLM 目前以 BitNet 系列为代表,面向资源受限的端侧推理场景。更紧凑的存储格式可以直接减少内存占用并提升推理吞吐,且 BITCOS 无需改变模型架构,只调整权重布局,迁移成本较低。
该论文已在 arXiv 公开摘要,详细代码和实现尚待发布。研究者同期还发布了另一篇关于 AMD 矩阵核精度建模的论文(arXiv:2609.14845),从硬件侧为三值模型的精确推理提供数值基础。
随着端侧 AI 推理成为各家厂商的竞争焦点,存储效率的每一点改进都会直接影响部署成本和推理速度,BITCOS 的思路值得业界关注。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断