[2025 年 4 月 29 日提交 (v1),最后修订于 2026 年 7 月 29 日(本版本,v2)]

查看 PDF HTML(实验性)

摘要:深度学习推动了计算系统的新浪潮,并触发了对日益复杂问题的自动化。特别是,大型语言模型(LLM)显著推进了认知任务,常常达到甚至超越人类水平的性能。然而,其庞大的参数导致高计算成本和缓慢的推理速度,对在资源受限的环境中的部署构成了挑战。在克服上述挑战的策略中,剪枝作为一种成功的机制脱颖而出,因为它在保持预测能力的同时减小了模型大小。在本文中,我们介绍了 AMP:注意力头与 MLP 剪枝,这是一种新颖的结构化剪枝方法,通过移除多头注意力(MHA)和多层感知机(MLP)中不太关键的结构来高效地压缩 LLM。通过将输入数据投影到权重上,AMP 评估结构重要性,并克服了现有技术在灵活性或效率方面往往不足的局限。特别是,AMP 在常识推理任务上比当前最先进水平高出高达 1.49 个百分点,在剪枝比例为 30% 的情况下对零样本任务性能的影响最小。此外,AMP 还提高了推理速度,使其非常适合在资源受限的环境中部署。我们在不同系列的 LLM 上验证了 AMP 的灵活性,包括 LLaMA 和 Phi。

提交历史

来自:Leandro Giusti Mugnaini [查看邮件]
[v1] 2025 年 4 月 29 日 UTC 20:50:08 (113 KB)
[v2] 2026 年 7 月 29 日 UTC 21:06:04 (109 KB)