[2026年7月23日提交]
摘要:隨著影片大型語言模型日益部署於真實世界應用,確保其安全對齊已變得至關重要。我們反直覺地發現,有害影片搭配良性查詢的攻擊成功率,高於相同影片搭配明確有害查詢的成功率。為理解此一漏洞的底層機制,我們提出 V-DEAL,一個三層診斷框架,同時從模型行為、理解與內部表徵層面分析此失效。透過逐步排除感知失效並量化模型內部的拒絕傾向,V-DEAL 為分析所觀察到的漏洞底層機制提供全新的診斷視角。我們在三個公開基準上測試六個影片大型語言模型,觀察到模型對有害影片內容的辨識準確率超過 81%,然而在有害影片搭配良性查詢的條件下,平均攻擊成功率仍達 48.33%。隱藏狀態分析進一步顯示,視覺理解所激發的拒絕傾向弱於文字理解。此外,我們引入提示注入干預方法,平均降低攻擊成功率 48.24 個百分點,並達到與先前基於微調方法相當的效能,提供有效且實務可行的手段來因應影片大型語言模型中的此類安全風險。
提交歷史
來自:Honghao Fu [查看電子郵件]
[v1]
2026年7月23日 星期四 10:35:38 UTC (401 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.