三星研究院发布LittleBit-2(ICML 2026),通过潜在几何对齐技术将大语言模型压缩至0.1比特每权重。在不改变推理结构的前提下,通过低秩因子分解+二值化方案,实现极限压缩并支持LLaMA、Qwen、Gemma等主流模型。
三星研究院(Samsung Labs)发布了LittleBit-2,一篇发表于ICML 2026的研究成果,目标是将大语言模型压缩到亚1比特范围——包括最极端的0.1比特每权重。
LittleBit系列的基本思路是:将每个密集权重矩阵分解为低秩潜在因子,对这些因子进行二值化,然后通过轻量级的可学习尺度恢复幅度信息。这个框架在推理阶段不改变原始模型架构,使其在硬件部署上更具可行性。
LittleBit-2相比原始LittleBit(NeurIPS 2025)的改进点在于:发现了量化感知训练(QAT)阶段存在的潜在几何错位问题。SVD分解得到的潜在因子与二元超立方体(binary hypercube)之间存在几何上的不对齐,导致量化精度损失。
LittleBit-2引入了**内部潜在旋转与联合迭代量化(Joint-ITQ)**技术,在初始化阶段将潜在因子对齐到二元超立方体。关键设计是:这个对齐只发生在初始化阶段,不引入任何额外的推理开销。
根据GitHub仓库(SamsungLabs/LittleBit),当前代码库支持:
Joint-ITQ通过--use_itq参数作为可选项启用,向后兼容。
1比特以下量化的研究价值在于:当前大模型的参数规模使得在边缘设备或内存受限环境中部署存在根本性的存储瓶颈。如果0.5或0.1比特有效,意味着在同等硬件上可以运行大得多的模型。
但也需要注意的是:亚1比特量化目前主要在学术基准上验证,量化感知训练本身仍需要完整的GPU资源,只是最终的推理权重更小。LittleBit-2论文尚未报告完整的端对端推理性能基准,实际部署加速比还待验证。
来源:GitHub (SamsungLabs/LittleBit),ICML 2026
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断