[Submitted on 29 Apr 2025 (v1), last revised 29 Jul 2026 (this version, v2)]
Abstract:ディープラーニングはコンピューティングシステムに新たな波を引き起こし、ますます複雑な問題の自動化を促しています。特に、大規模言語モデル(LLM)は認知タスクを大幅に進化させ、人間レベルの性能に匹敵するか、時には上回ることもあります。しかし、その膨大なパラメータは高い計算コストと遅い推論を引き起こし、リソースに制約のある環境への展開に課題をもたらしています。上記の課題を克服するための戦略の中で、プルーニングは予測能力を維持しつつモデルサイズを削減する成功したメカニズムとして浮上しています。本論文では、AMP:アテンションヘッドとMLPのプルーニングを紹介します。これはMulti-Head Attention(MHA)とMultilayer Perceptron(MLP)内の重要度の低い構造を除去することでLLMを効率的に圧縮する新しい構造化プルーニング手法です。AMPは入力データを重みに投影することで構造的重要性を評価し、柔軟性や効率性でしばしば不足する既存手法の限界を克服します。特に、AMPは常識推論タスクで最先端を最大1.49パーセントポイント上回り、ゼロショットタスク性能への影響を最小限に抑えつつ30%のプルーニング率を達成します。さらに、AMPは推論速度も向上させ、リソース制約のある環境への展開に適しています。AMPの柔軟性はLLaMAやPhiを含む異なるファミリーのLLMで確認されています。
Submission history
From: Leandro Giusti Mugnaini [view email]
[v1]
Tue, 29 Apr 2025 20:50:08 UTC (113 KB)
[v2]
Wed, 29 Jul 2026 21:06:04 UTC (109 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.