[Submitted on 8 Feb 2026 (v1), last revised 29 Jul 2026 (this version, v2)]

View PDF HTML (experimental)

Abstract:當語言模型斷言「澳洲的首都是雪梨」時,它知道這是錯的嗎?模型以與事實相同的流暢度斷言錯誤概念,因此無法從輸出不確定性回答這個問題。我們已知殘差流中存在與真實性相關的訊號,但其幾何結構尚不清楚:有多少維度攜帶該訊號、偵測器能有多簡單,以及它是否具有可轉移性。我們在 11 個模型(124M-14B)中描述這種幾何結構,並透過啟動操控、概念擦除與分佈對齊搜尋進行因果測試。該結構很簡單:在 2-8 維子空間中的兩個類別質心與訓練過的線性探測器相符,而 25 個標記範例即可在 GPT-2 上恢復 90% 的完整資料 AUC。操控使六個模型的幻覺率改變 9.1 點,擦除使偵測降至隨機水準,而唯一能限制秩的方法——分佈對齊搜尋——最多將因果維度定位在五個以內。內部優勢具有特定情境:探測器在對抗性錯誤概念上大幅優於 P(True) 與語義熵,但在標準問答上則不相上下。單一資料集的探測器在未經聯合多資料集訓練前,轉移效能接近隨機,經聯合訓練後可恢復 0.73-0.91 AUC。質心距離與探測器效能相符,顯示類別分離是一種均值偏移,使得偵測更具幾何性而非學習性。

Submission history

From: Seonglae Cho [view email]
[v1] Sun, 8 Feb 2026 23:27:10 UTC (606 KB)
[v2] Wed, 29 Jul 2026 23:20:58 UTC (1,111 KB)