[Submitted on 8 Feb 2026 (v1), last revised 29 Jul 2026 (this version, v2)]
Abstract:当语言模型断言“澳大利亚的首都是悉尼”时,它是否知道这是错误的?模型断言错误概念与事实时具有相同的流畅度,因此这个问题无法从输出不确定性中得到解答。已知残差流中存在与真值相关的信号,但其几何结构未知:有多少维度承载该信号,检测器可以有多简单,以及它是否具有迁移性。我们在 11 个模型(124M-14B)中刻画这一几何结构,并通过激活引导、概念擦除和分布式对齐搜索对其进行因果测试。该结构很简单:2-8 维子空间中的两个类质心与训练好的线性探针匹配,并且 25 个标注样本即可在 GPT-2 上恢复全数据 AUC 的 90%。引导将六种模型的幻觉率改变了 9.1 个点,擦除将检测率降至随机水平,而唯一能约束秩的分布式对齐搜索最多定位到五个因果维度。内部优势具有特定机制:探针在对抗性错误概念上远胜 P(True) 和语义熵,但在标准问答上持平。单一数据集的探针迁移性接近随机,直到联合多数据集训练恢复 0.73-0.91 的 AUC。质心距离与探针性能匹配,表明类别分离是一种均值偏移,使得检测是几何性的而非学习到的。
Submission history
From: Seonglae Cho [view email]
[v1]
Sun, 8 Feb 2026 23:27:10 UTC (606 KB)
[v2]
Wed, 29 Jul 2026 23:20:58 UTC (1,111 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.