[Submitted on 28 Jul 2026]
Abstract:強化学習(RL)を通じて訓練された大規模推論モデルは、数学的推論タスクにおいて教師ありファインチューニング(SFT)モデルを上回ることがますます示されていますが、この優位性のメカニズム的基盤は依然として不明です。そこで我々は、RLモデルの優れた性能を可能にする内部表現の違いは何かを問いかけます。本研究では2つの収束する証拠を示します。第一に、層別隠れ状態で訓練された線形プローブは、SFTモデルと比較してRLモデルが回答の正しさを予測する精度が高いことを明らかにし、より線形分離可能で構造化された表現を示していることを示しています。第二に、平均アブレーション研究により、RLモデルは深い層が段階的に重要になる階層的アーキテクチャを発達させる一方、SFTモデルは層全体に均一に重要性を分散させることが示されます。これらの知見は、RL訓練がモデルが推論問題を表現・処理する方法を根本的に再構築することを示しています。最後に、問題全体での繰り返しサンプリング時のトークン数変動を分析し、適応的計算割り当てを評価します。一部のRL調整モデルではSFT対応モデルより高い変動性が見られますが、他のモデルでは強い一貫性が見られ、トークン割り当てはRL対SFTだけでなく全体的な訓練パイプラインに依存する可能性があることを示唆しています。このトークン割り当て変動性は、妥当なオンポリシー推論の広がりを明らかにし、安定したポリシーを示すモデルと、未決定で潜在的に識別不能な解行動を持つモデルを強調すると考えられます。
Submission history
From: Aishwarya Balwani [view email]
[v1]
Tue, 28 Jul 2026 17:42:42 UTC (4,100 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.