[2026年7月19日投稿 (v1)、最終改訂2026年7月30日(本バージョン、v2)]

PDFを表示 HTML(実験的)

要旨:人間のアンケートデータにおける質問順序効果は、パラメータフリーな予測であるQQ(量子質問)等式を標準的な射影量子質問順序モデルが近似的に満たすことが報告されています。我々はこの等式を自己回帰型大規模言語モデル(LLM)の逐次二値判断を監査する枠組みへと発展させます。理論的には、QQ等式を頑健に満たすメカニズム族を特徴付け、古典的な繰り返しが等式を正確に再現できることを示し、QQをランク2のContextuality-by-Default基準と$|q_{QQ}| \le \mathrm{OSS}$を通じて結合します。これにより、順序感受性、QQ不均衡、残存文脈性を互換性のある特徴として扱うのではなく、分離します。方法論的には、指定された健康ゲートの下で、反転ラベル写像と事前指定された健康ゲートを用いて、次トークン対数確率から順序条件付き結合分布を再構成するコミットされたマルチターン強制分岐プロトコルを導入します。オープウェイトの指示調整済みモデルに対するファーストシグナルパイロットは、中核的な測定問題を明らかにしました。事前指定された健康ゲートはすべて合格したものの、二値条件付き分布は、直接評価フレームワークでは18項目ペア中17ペア、パーソナフレームワークでは8項目ペア中7ペアでほぼ決定論的でした。ラベル割り当ては、いくつかの写像固有のQQ判定に実質的な影響を与え、残存文脈性を持つと認定された項目はありませんでした。したがって、テストされた条件下では、観測されたQQ結果は、飽和しラベル感受性のある測定インターフェースの存在下で応答メカニズムを一意に特定しませんでした。主な示唆は方法論的です:次トークン確率は、十分な分散が確立されるまで調査応答分布として解釈されるべきではありません。したがって、我々はLLM判断の分布レベル監査において、構造的解釈に先立ち、飽和スクリーニングとラベル反転を実施すべきであると主張します。

投稿履歴

投稿者: Pilsung Kang [メールを表示]
[v1] 2026年7月19日(日)12:22:06 UTC (84 KB)
[v2] 2026年7月30日(木)06:44:31 UTC (97 KB)