[2026年7月23日投稿]

PDFを表示 HTML(実験的)

Abstract:オフライン強化学習(RL)エージェントは固定された行動軌道で学習されるため、学習後に特定のデータを削除する必要がある場合には、軌道レベルの削除が重要になる。この削除を評価することは難しく、メンバーシップスコアの低下は、軌道の削除、別の攻撃からも観測可能な残存記憶化、あるいは有用な行動を破壊するポリシーの崩壊のいずれかを反映する可能性がある。我々は、オフラインRLにおける軌道レベルの記憶化とアンラーニング(TOUR)のベンチマークを導入する。このベンチマークは、軌道レベルの分割、一致した非メンバー対照、再学習リファレンス、保持性能アンカー、および多攻撃プライバシー監査を組み合わせたものである。D4RL locomotion実験および探索的AntMaze拡張全体において、TOURは一般的な削除ベースラインが環境依存のプライバシー-ユーティリティ挙動を示すことを明らかにする。再学習およびファインチューニングは、しばしば一様なGA+Refitよりも強力な保持ユーティリティリファレンスを提供し、TrajDeleterは有用な比較対象として残るが、同じ監査下では一様に強いわけではない。Reference-model、threshold、deviation、equivalence、action-error、representation-based、およびquery-limited攻撃は、単一の尤度ベースのメンバーシップスコアが削除品質を過大評価する可能性があることをさらに示す。評価された設定において、オフラインRLアンラーニングに関する結論は、単一スコア監査の下では安定していない。したがって、それらは一致した非メンバー構築、再学習相対キャリブレーション、攻撃ファミリー、保持ユーティリティ、および診断アーキテクチャまたはコンポーネントレベル証拠の明示的な範囲に依存する。

投稿履歴

From: Chaofan Pan [view email]
[v1] 2026年7月23日木曜日 09:40:40 UTC (235 KB)