[2026年7月29日提交]
摘要:推理时思考可提升大语言模型的表现,但聚合结果无法揭示模型是否更有效地利用可用证据,或寻求可能改善未来决策的信息。我们通过在匹配的不确定性下测量动作偏好、思考长度和报告的置信度来区分这些反应。十个开源权重模型在思考模式和非思考模式下完成了匹配的地平线式双臂老虎机试验。认知模型从探索的两个行为特征中分离出价值引导的动作和与不确定性无关的选择噪声:对未知臂的UCB式偏好,以及随总不确定性增加的Thompson式选择变异性。平均而言,思考强化了价值引导的动作,减少了与不确定性无关的选择噪声,但并未产生UCB式探索,也未强化Thompson式探索。在动作之外,信息不平衡的历史条件(同时显示比匹配的平衡条件更多的观测)与更长的思考长度相关。报告的置信度对决策难度更敏感,与所选任务证据的关联也更强。我们将这些思考长度和报告置信度模式分别解释为与元认知控制和元认知监控一致,但并未证实任一过程。解码器扫描(尤其是温度)改变了选择噪声和思考长度,但未能重现联合跨输出模式。在这个受控决策环境中,思考改善了模型如何根据当前证据采取行动,而测量的任何特征均未支持向更具信息寻求策略的转变。
提交历史
来自:熊华东 [查看邮件]
[v1]
2026年7月29日,周三,12:33:12 UTC (2,413 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.