[2026年7月23日提出]

PDFを表示 HTML(実験的)

要約:As Video Large Language Models are increasingly deployed in real-world applications, ensuring their safety alignment has become critical. Counterintuitively, we find that harmful videos paired with benign queries achieve higher attack success rates than the same videos paired with explicitly harmful queries. この脆弱性の根本的なメカニズムを理解するために、私たちはV-DEALを提示します。これはモデル行動、理解、および内部表現全体でこの失敗を共同で分析する3段階の診断フレームワークです。知覚失敗を段階的に除外し、モデルの内部拒否傾向を定量化することで、V-DEALは観察された脆弱性の根本的なメカニズムを分析するための新しい診断視点を提供します。私たちは3つの公開ベンチマークで6つのVideo LLMをテストし、モデルが81%を超える精度で有害な動画コンテンツを正しく認識しているにもかかわらず、有害な動画と良性のクエリを組み合わせた条件下で平均攻撃成功率が依然として48.33%に達することを観察しました。隠れ状態分析はさらに、視覚理解がテキスト理解よりも弱い拒否傾向を活性化することを示しています。さらに、私たちは平均48.24パーセントポイント攻撃成功率を削減し、以前のファインチューニングベースの手法に匹敵する性能を達成するプロンプトインジェクション介入手法を導入し、Video LLMにおけるこのような安全リスクに対処するための効果的で実用的な手段を提供します。

提出履歴

投稿者: Honghao Fu [メールを表示]
[v1] 2026年7月23日 木曜日 10:35:38 UTC (401 KB)