[2026年7月29日提出]
Abstract:Group Relative Policy Optimization (GRPO) は、言語モデルのポストトレーニングにおける標準的な強化学習手法となっています。最近の研究では、GRPO がベースモデルの推論能力を低下させ、k が大きい場合に Pass@k でベースモデルを下回ることを示しており、これは推論パスのカバレッジが減少していることを示しています。この低下は、GRPO がベースモデルがすでに高い確率で生成する応答に集中することに関連していることがわかりました。この集中は、GRPO 更新における2つのメカニズムに起因すると考えられます。応答レベルでは、高確率応答が繰り返し出現することでグループ勾配を支配します。トークンレベルでは、GRPO の重要度比が勾配をスケーリングし、現在のポリシー下でより確率が高くなるトークンをさらに強化します。ReCo は、これらの両方の効果に対処する再重み付け手法を提案します。応答の寄与はロールアウトグループ内での期待出現回数で正規化され、トークンレベルの重要度比は、代替トークン選択の余地が残る非飽和決定点により大きな更新スケールを与える分散ベースの比に置き換えられます。Qwen2.5-Math-1.5B/7B および Llama-3.1-8B-Instruct を5つの数学的推論ベンチマークで評価したところ、ReCo は k の大きい値で Pass@k を改善し、k の小さい値では GRPO と同等でした。
Submission history
From: Junoh Park [view email]
[v1]
Wed, 29 Jul 2026 12:45:55 UTC (1,917 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.