[Submitted on 19 Jul 2026 (v1), last revised 30 Jul 2026 (this version, v2)]

View PDF HTML (experimental)

Abstract:人類調查數據中的問題順序效應已被報導近似滿足 QQ(quantum question)相等性,這是標準投影式量子問題順序模型的一項無參數預測。我們將此相等性發展為自迴歸大型語言模型(LLM)連續二元判斷的審核框架。理論上,我們描述能穩健滿足 QQ 的機制家族,證明古典重複可精確重現該相等性,並透過 |q_QQ| ≤ OSS 結合 QQ 與秩 2 的「依預設脈絡性」(Contextuality-by-Default)準則。這將順序敏感度、QQ 不平衡以及殘餘脈絡性分離,而非視其為可互換的標誌。方法上,我們提出一項承諾式多回合強制分支協定,藉由反向平衡標籤映射與預先指定的健康閘門,從下一個 token 的對數機率重建條件順序的聯合分佈。針對開源權重指令微調模型的首次訊號試驗揭示了核心測量問題。儘管所有預先指定的健康閘門均通過,但在直接評估框架下,18 對題目中有 17 對的二元條件分佈接近確定性;在角色框架下,8 對中有 7 對亦然。標籤指派明顯改變了多個映射特定的 QQ 判定,且沒有任何題目被認證為具殘餘脈絡性。因此,在測試條件下,觀察到的 QQ 結果無法在飽和且對標籤敏感的測量介面中唯一識別反應機制。主要意涵為方法論上的:在建立足夠分散性之前,不應將下一個 token 的機率解釋為調查反應分佈。因此,我們主張在對 LLM 判斷進行分佈層級的審核時,應先進行飽和度篩選與標籤反向平衡,再進行結構性解釋。

Submission history

From: Pilsung Kang [view email]
[v1] Sun, 19 Jul 2026 12:22:06 UTC (84 KB)
[v2] Thu, 30 Jul 2026 06:44:31 UTC (97 KB)