[Submitted on 30 Jul 2026]

View PDF HTML (experimental)

Abstract:大型視覺語言模型 (LVLM) 經常幻覺出影像中不存在的物件。儘管近期有所進展,現有緩解方法仍缺乏可靠的物件層級 grounding 診斷,因此傾向採用粗粒度干預,這可能損害視覺理解、縮短回應,並降低對真正有 grounding 的物件的覆蓋率。關鍵挑戰在於,在生成過程中偵測每個新出現的物件提及是否獲得可靠的視覺證據支持,以便有選擇性地緩解幻覺。然而,輸出置信度反映的是下一個 token 的合理性,而非視覺支持,使得語言先驗能讓不存在的物件看起來很確定。我們展示了遺漏的診斷證據編碼於 Intrinsic Grounding Signature (IGS),這是一種分散式的帶符號注意力模式,對此類高置信度的幻覺仍具資訊性。基於 IGS,我們提出 Verifier-Guided Decoding (VGD),這是一個解碼框架,其中輕量級驗證器會檢查每個新出現的物件提及,當該提及被識別為高風險時回滾 KV cache、抑制該物件及其同義詞,並重新生成受影響的延續。由於 VGD 僅對被識別為高風險的物件提及進行干預,因此能在降低物件幻覺的同時保留模型原本的視覺理解與有 grounding 的物件覆蓋率。在 CHAIR 與 AMBER-G 上的實驗顯示,VGD 達成物件幻覺降低的最新成果:在 @rec90 下,將 AMBER-G CHAIR 降低 43.6\% 的同時保留 99.6\% 的有 grounding 物件覆蓋率,並將 CHAIR-MSCOCO 的 CHAIR$_i$/CHAIR$_s$ 降低 37.0\%/30.4\% 而不縮短標題。

Submission history

From: Xinze Liu [view email]
[v1] Thu, 30 Jul 2026 08:02:42 UTC (1,485 KB)