[2026年7月25日提交 (v1),最后修订于2026年7月29日(本版本,v3)]

查看 PDF HTML(实验性)

摘要:随着约束学习日益普及,模型在明确的约束条件下进行训练,以强制实现公平性、安全性、鲁棒性、正则化以及物理或逻辑约束。理解训练样本如何影响模型解(例如学习到的参数)对于可解释性和鲁棒性至关重要。经典影响函数(IF)通过局部敏感性分析估计样本贡献,衡量特定训练样本被扰动或移除时解的变化。然而,IF在约束场景下变得不可靠:数据扰动会同时重塑目标函数和可行域,导致估计结果违反可行性约束。为此,我们提出方向影响函数(DIF),一种新颖的估计器,它将这些约束显式地纳入影响估计中。DIF将约束学习的最优性条件表述为变分不等式(VI),并分析训练数据扰动如何影响该VI。我们在约束线性回归上验证了DIF,证明它能恢复留一法重训练结果,而IF和基于惩罚的IF则表现出显著偏差。我们进一步将DIF应用于公平性约束的CNN,DIF能够准确预测数据移除下的测试损失变化,并与实际重训练结果高度一致。我们的结果确立了DIF作为约束学习中高效且可靠的数据归因工具。

提交历史

来自: Xin Wang [查看邮箱]
[v1] 2026年7月25日 22:50:09 UTC (170 KB)
[v2] 2026年7月28日 03:42:07 UTC (1 KB) (已撤回)
[v3] 2026年7月29日 01:25:56 UTC (170 KB)