[Submitted on 28 Jul 2026]
Abstract:從人類回饋中進行強化學習(RLHF)是讓大型語言模型與人類偏好對齊的標準方法,但其品質受限於靜態且與任務無關的獎勵模型。這種不匹配導致學習訊號稀疏且對齊效果不佳。我們提出 MeRLa(Meta-Learned Reward Shaping),一個在 RLHF 訓練前先透過輔助任務元學習任務感知塑形函數 Φ(x,y;ϕ) 的原則性框架。所學到的塑形會產生一個複合獎勵,既保留策略最優性,又能提供任務特定的學習訊號。我們的元目標結合任務辨識、熵正則化,以及基於勢能的守恆以確保穩定收斂。我們提供策略不變性的理論保證、分析表徵漂移敏感度,並正式探討熵最大化所導致之激勵錯位的問題。在 LLaMA-3-8B 模型上橫跨四個基準的實驗顯示,相較於 PPO、DPO、GRPO 與 DAPO,MeRLa 均有穩定提升:在 AlpacaEval 2.0 達到 90.8% 的長度控制勝率,在 MT-Bench 獲得 9.14 分,且訓練不穩定性降低 41%。即使與基於流程或基於評分標準的增強獎勵結合,MeRLa 仍能維持其優勢。
Submission history
From: Yunpeng Chu [view email]
[v1]
Tue, 28 Jul 2026 02:09:26 UTC (344 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.