[Submitted on 30 Jul 2026]
摘要:大型视觉-语言模型(LVLMs)经常幻觉出图像中不存在的对象。尽管近期有所进展,现有缓解方法仍缺乏可靠的对象级 grounding 诊断,因此往往采用粗粒度干预,这可能损害视觉理解、缩短响应,并降低真实 grounded 对象的覆盖率。关键挑战在于在生成过程中检测每个新出现的对象提及是否得到可靠的视觉证据支持,从而有选择性地缓解幻觉。然而,输出置信度反映的是下一个 token 的合理性,而非视觉支持,这使得语言先验能让不存在的对象看起来确定无疑。我们证明,缺失的诊断证据被编码在 Intrinsic Grounding Signature(IGS)中,这是一种分布式 signed attention 模式,对这类高置信度幻觉仍具有信息价值。基于 IGS,我们提出 Verifier-Guided Decoding(VGD),一种解码框架,其中轻量级验证器检查每个新出现的对象提及,当提及被识别为高风险时回滚 KV cache,抑制该对象及其同义词,并重新生成受影响的后续内容。由于 VGD 仅对被识别为高风险的对象提及进行干预,因此在减少对象幻觉的同时保留了模型原有的视觉理解和 grounded 对象覆盖率。在 CHAIR 和 AMBER-G 上的实验表明,VGD 实现了最先进的幻觉减少:在 @rec90 指标下,将 AMBER-G CHAIR 降低了 43.6\%,同时保留了 99.6\% 的 grounded 对象覆盖率,并将 CHAIR-MSCOCO CHAIR$_i$/CHAIR$_s$ 分别降低了 37.0\%/30.4\%,而没有缩短描述。
Submission history
From: Xinze Liu [view email]
[v1]
Thu, 30 Jul 2026 08:02:42 UTC (1,485 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.