[Submitted on 29 Apr 2025 (v1), last revised 29 Jul 2026 (this version, v2)]
Abstract:深度學習推動了運算系統的新一波發展,並促使越來越複雜問題的自動化。其中,大型語言模型(LLMs)已大幅推進認知任務的處理能力,常能達到甚至超越人類水準。然而,其龐大的參數量導致高運算成本與緩慢推論速度,為資源受限環境的部署帶來挑戰。在克服上述挑戰的策略中,剪枝因能縮減模型大小同時維持預測能力而成為有效的機制。本文提出 AMP:注意力頭部與 MLP 剪枝,一種創新的結構化剪枝方法,透過移除多頭注意力(MHA)與多層感知器(MLP)中較不重要的結構,有效壓縮大型語言模型。AMP 將輸入資料投影至權重,以評估結構重要性,並克服現有技術在靈活性或效率上的不足。特別是,AMP 在常識推理任務上超越目前最先進方法最高 1.49 個百分點,在剪枝率達 30% 時對零樣本任務效能的影響極小。此外,AMP 亦提升推論速度,非常適合部署於資源受限環境。我們在包含 LLaMA 與 Phi 在內的不同大型語言模型家族上驗證了 AMP 的靈活性。
Submission history
From: Leandro Giusti Mugnaini [view email]
[v1]
Tue, 29 Apr 2025 20:50:08 UTC (113 KB)
[v2]
Wed, 29 Jul 2026 21:06:04 UTC (109 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.