[Submitted on 29 Jul 2026]

View PDF HTML (experimental)

Abstract:群組相對策略最佳化 (GRPO) 已成為語言模型後訓練的標準強化學習方法。近期研究指出 GRPO 可能降低基礎模型的推理能力,並在 Pass@k(k 較大時)表現不如基礎模型,顯示推理路徑覆蓋率下降。我們發現此降低與 GRPO 集中於基礎模型已高機率產生的回應有關。我們追溯此集中性至 GRPO 更新中的兩種機制。在回應層級,高機率回應透過重複出現主導群組梯度。在 token 層級,GRPO 的重要性比率會縮放梯度,進一步強化在目前策略下更有可能的 token。我們提出 ReCo,一種重新加權方法,同時處理這兩種效應。回應貢獻依其在 rollout 群組內的預期出現次數進行正規化,而 token 層級的重要性比率則替換為基於變異數的比率,對仍存在多種 token 選擇的非飽和決策點給予較大的更新幅度。在五個數學推理基準上,針對 Qwen2.5-Math-1.5B/7B 與 Llama-3.1-8B-Instruct,ReCo 改善了大 k 值的 Pass@k,同時在小 k 值時與 GRPO 表現相當。

Submission history

From: Junoh Park [view email]
[v1] Wed, 29 Jul 2026 12:45:55 UTC (1,917 KB)