[2026年7月28日提交]

查看PDF HTML(实验性)

摘要:在复杂场景下的动作识别往往涉及多个并发细粒度动作,这使得建模内部动作结构变得具有挑战性。现有大多数方法依赖整体表示,难以捕捉细微交互和细粒度语义。虽然最近的基于提示的方法引入了解耦,但缺乏明确的语义引导,而仅基于视觉或结构线索的方法仍属于粗粒度。在本文中,我们提出知识引导的原子动作解耦(KDA),利用细粒度语义知识来增强动作表示并实现更精确的解耦。具体而言,我们使用大语言模型(LLM)将动作标签分解为原子动作,提供明确的空间-时间语义。知识注入模块(KIM)首先将原子动作知识整合到视频特征中。基于此增强的表示,知识解耦模块(KDM)进一步解耦原子动作知识,为动作解耦提供更精确的语义引导。我们引入知识解耦损失(KD Loss)以促进KDM中知识组件的更清晰解耦。大量实验表明,KDA提升了特征判别力,并在多标签动作识别基准上取得了最先进性能。此外,KIM和KDM可轻松集成到其他方法中,展示了强大的通用性。

提交历史

来自:Tianci Wu [查看邮箱]
[v1] 2026年7月28日 星期二 03:54:27 UTC (1,265 KB)