[Submitted on 28 Jul 2026]
Abstract:指令層級是語言模型部署的核心安全假設:高優先順序的輸入(例如系統提示)應覆蓋來自使用者或工具的衝突低優先順序輸入。然而,前沿大型語言模型經常違反此層級。我們提出 V-Steer,一種無需訓練的推論時方法,透過編輯提示位置的快取 value vector 來恢復特權影響。V-Steer 使用對第一個 next token prediction 的直接 logit attribution,找出低優先順序片段支配特權片段的注意力頭,然後透過對快取 V tensors 的就地乘法編輯,增強特權片段並抑制衝突的低優先順序片段。由於此方法僅作用於快取值,因此與融合注意力後端相容,且僅增加一次性的 prefill 開銷。跨 7B 至 70B 的模型,此基於 attribution 的介入將主要約束準確率從低於 18% 提升至 92%,並在更廣泛的指令層級評估上大幅超越僅使用提示的基線,同時在 3 個規模的 LLM 上達到或超越目前最佳的基於訓練的方法,且對解碼速度的影響可忽略不計。程式碼已於 this https URL 公開。
Submission history
From: Siqi Zeng [view email]
[v1]
Tue, 28 Jul 2026 20:06:31 UTC (489 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.