[Submitted on 28 Jul 2026]
Abstract:通过强化学习(RL)训练的大型推理模型在数学推理任务上越来越明显地优于其监督微调(SFT)对应模型;然而这种优势的机制基础仍不清楚。因此我们提出问题,是什么内部表征差异使RL模型具有更优性能?我们的工作提供了两条相互印证的证据:首先,在逐层隐藏状态上训练的线性探针显示,RL模型在预测答案正确性方面往往比SFT模型达到更高的准确率,表明其表征更具线性可分性和结构化。其次,平均消融研究表明,RL模型发展出一种分层架构,其中更深的层变得越来越关键,而SFT模型则在各层之间均匀分配重要性。综合这些发现表明,RL训练从根本上重构了模型表征和处理推理问题的方式。最后,我们分析了在重复采样下跨问题的token数量变化,以评估自适应计算分配。尽管我们观察到某些RL调优模型比其SFT对应模型具有更高的变异性,但其他模型表现出强烈的稳定性,表明token分配可能更多地取决于整体训练流程,而非仅取决于RL与SFT的区别。我们认为这种token分配变异性揭示了合理在策略推理的分布,突出了哪些模型表现出稳定的策略,哪些模型则是欠定的、可能不可识别的求解行为。
Submission history
From: Aishwarya Balwani [view email]
[v1]
Tue, 28 Jul 2026 17:42:42 UTC (4,100 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.