[2026年7月28日投稿]

PDFを表示 HTML (experimental)

Abstract:Reinforcement Learning from Human Feedback (RLHF) は、人間の好みに大規模言語モデルを適合させるための標準的なアプローチですが、その品質は静的でタスク非依存な報酬モデルによって制限されています。このミスマッチは、スパースな学習信号と最適でないアライメントを引き起こします。私たちは MeRLa (Meta-Learned Reward Shaping) を導入します。これは、RLHF 学習の前に補助タスク群にわたってタスク認識型の整形関数 Φ(x,y;φ) をメタ学習する、原則的なフレームワークです。学習された整形は、方策の最適性を保持しつつ、タスク特有の学習信号を提供する複合報酬を生成します。私たちのメタ目的関数は、タスク識別、エントロピー正則化、およびポテンシャルベースの保存を組み合わせ、安定した収束を実現します。方策不変性の理論的保証を提供し、表現ドリフトの感度を分析し、エントロピー最大化によるインセンティブの不整合を正式に扱います。LLaMA-3-8B を用いた 4 つのベンチマーク実験では、PPO、DPO、GRPO、DAPO を一貫して上回り、AlpacaEval 2.0 で 90.8% の length-controlled 勝率、MT-Bench で 9.14 のスコアを達成し、学習の不安定さを 41% 低減しました。MeRLa は、プロセスベースおよびルーブリックベースの拡張報酬と組み合わせてもその利点を保持します。

投稿履歴

投稿者: Yunpeng Chu [メールを表示]
[v1] 2026年7月28日 (火) 02:09:26 UTC (344 KB)