[2026年7月29日投稿]
要旨:推論時の思考は大規模言語モデルの性能を向上させるが、集計結果からは、モデルが利用可能な証拠をより効果的に活用しているのか、あるいは将来の意思決定を改善しうる情報を探しているのかは明らかでない。本研究では、これらの反応を区別するため、一致した不確実性の下で行動選好、思考の長さ、および報告された確信度を測定した。10種類のオープンウェイトモデルが、思考モードと非思考モードで一致させたホライズン型2腕バンディット課題を完了させた。認知モデルにより、価値に基づく行動と不確実性に依存しない選択ノイズを、探索の2つの行動的特徴(未知の腕に対するUCB様の選好と、総不確実性に伴って増大するThompson様の選択変動性)から分離した。平均的に、思考は価値に基づく行動を強化し、不確実性に依存しない選択ノイズを低減したが、UCB様の探索を生み出したり、Thompson様の探索を強化したりすることはなかった。行動以外の場面では、観測数が一致させたバランス条件よりも多い情報不均衡な履歴条件において、思考の長さが大きかった。報告された確信度は、決定の難易度に対してより敏感になり、選択された課題証拠とより強く関連するようになった。これらの思考の長さと報告された確信度のパターンは、それぞれメタ認知的制御およびメタ認知的モニタリングと一致すると解釈されるが、いずれの過程も確立するものではない。デコーダのスイープ、特に温度は選択ノイズと思考の長さを変化させたが、出力全体を通じた共同パターンを再現することはなかった。この制御された意思決定設定において、思考はモデルが現在の証拠に基づいて行動する方法を改善したが、いずれの測定された特徴も、より情報探索的な方策への移行を支持するものではなかった。
投稿履歴
投稿者: Hua-Dong Xiong [メールを表示]
[v1]
2026年7月29日(水)12:33:12 UTC (2,413 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.