Multiverse Computing 提出一种全新大模型剪枝思路,将结构化层裁剪建模为统计物理中的伊辛优化问题。该方法通过全局考量层间协同交互,突破了传统贪心算法的局部限制,在相同压缩率下大幅保留模型性能。
大语言模型的参数规模不断突破极限,随之而来的是高昂的推理成本与显存占用。在各类模型轻量化技术中,剪枝(Pruning)一直是研究热点。然而,直接剪除网络层(Block/Layer Removal)往往面临一个棘手难题:如何选出最该被删掉的那几层?
AI 计算公司 Multiverse Computing 近日在 Hugging Face 发布研究,换了一种物理学视角的解法:将大语言模型的层裁剪问题,形式化为统计物理学中经典的伊辛模型(Ising Model)优化问题。
相比细粒度的权重量化或非结构化稀疏,**整层裁剪(Block Removal)**能直接减少 Transformer 堆叠层数,无需依赖专用硬件加速库即可线性降低推理延迟和显存消耗。
但在选择裁剪哪些层时,业界通常采用启发式指标(如计算层间相似度、注意力熵)或贪心算法(逐层评估并移除影响最小的一层)。这种做法存在明显的局限性:
Multiverse Computing 的研究团队将该问题映射到了自旋玻璃与组合优化领域。
在统计物理中,伊辛模型通过描述相互耦合的自旋粒子系统(每个粒子自旋向上或向下)来寻找能量最低的基态。类似地,模型中的每一层也可以看作一个二值变量:
整个裁剪问题因此被转化为**无约束二值二次规划(QUBO)**问题:
当整个系统的哈密顿量(目标能量函数)构建完成后,寻找“最优裁剪方案”就等价于求解伊辛模型的基态(能量最低态)。
将架构转化为伊辛模型后,求解工具箱变得极为丰富。研究团队既可以调用经典的启发式算法(如模拟退火 Simulated Annealing、张量网络算法),也可以直接部署在量子退火机或量子模拟硬件上运行。
实验结果表明,相较于传统的逐层贪心筛选法,基于伊辛优化的层裁剪方案具备显著优势:
从物理视角看待深度学习已成为近期前沿研究的重要趋势。Multiverse Computing 的这项工作证明,统计力学与量子算法不仅能用于解释神经网络的内部机理,还能直接转化为高效的工程工具,为端侧大模型部署和超大规模 LLM 的结构化压缩提供了全新的思路。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断