[2026年7月29日提交]
摘要:Group Relative Policy Optimization(GRPO)已成为语言模型后训练的标准强化学习方法。最近的研究表明,GRPO 可能会降低基础模型的推理能力,并在 k 值较大时在 Pass@k 指标上表现不如基础模型,表明推理路径的覆盖范围缩小。我们发现这种下降与 GRPO 集中于基础模型已以高概率生成响应的现象有关。我们将这种集中现象追溯到 GRPO 更新中的两种机制。在响应层面,高概率响应通过重复出现主导群体梯度。在令牌层面,GRPO 的重要性比率会缩放梯度,进一步强化当前策略下更可能出现的令牌。我们提出 ReCo,这是一种解决这两种效应的重加权方法。响应贡献通过其在 rollout 组内的预期出现次数进行归一化,令牌层面的重要性比率被替换为基于方差的比率,为替代令牌选择仍可行的非饱和决策点提供更大的更新幅度。在五个数学推理基准上,对 Qwen2.5-Math-1.5B/7B 和 Llama-3.1-8B-Instruct 进行的测试表明,ReCo 在 k 值较大时提升了 Pass@k 指标,在 k 值较小时与 GRPO 相当。
提交历史
来自:Junoh Park [查看邮箱]
[v1]
2026年7月29日,周三 12:45:55 UTC (1,917 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.