[Submitted on 28 Jul 2026]

View PDF HTML (experimental)

Abstract:人类反馈强化学习(RLHF)是对齐大型语言模型与人类偏好的标准方法,但其质量受限于静态且与任务无关的奖励模型。这种不匹配导致学习信号稀疏且对齐效果不佳。我们提出 MeRLa(Meta-Learned Reward Shaping,元学习奖励塑形),一个在 RLHF 训练前跨辅助任务元学习任务感知塑形函数 Φ(x,y;φ) 的原则性框架。学习到的塑形产生复合奖励,同时保留策略最优性并提供任务特定的学习信号。我们的元目标结合了任务判别、熵正则化和基于势能的保守性,以实现稳定收敛。我们为策略不变性提供理论保证,分析表示漂移敏感性,并正式解决熵最大化带来的激励错位问题。在 LLaMA-3-8B 上进行的四个基准实验显示,相较于 PPO、DPO、GRPO 和 DAPO 均有持续改进,在 AlpacaEval 2.0 上实现了 90.8% 的长度控制胜率,在 MT-Bench 上得分 9.14,训练不稳定性降低 41%。MeRLa 与基于过程和基于量表的增强奖励结合时仍能保持优势。

Submission history

From: Yunpeng Chu [view email]
[v1] Tue, 28 Jul 2026 02:09:26 UTC (344 KB)