[Submitted on 28 Jul 2026]

View PDF HTML (experimental)

Abstract:在複雜場景中的動作辨識通常涉及多個同時發生的細粒度動作,這使得建模內部動作結構變得具有挑戰性。大多數現有方法依賴整體表示,這對於捕捉微妙互動和細粒度語義來說是不足的。雖然近期基於提示的方法引入了解耦,但它們缺乏明確的語義引導,而僅基於視覺或結構化線索的方法則仍然是粗粒度的。在本文中,我們提出知識引導原子動作解耦(KDA),它利用細粒度語義知識來增強動作表示並實現更精確的解耦。具體而言,我們使用大型語言模型(LLM)將動作標籤分解為原子動作,提供明確的空間-時間語義。知識注入模組(KIM)首先將原子動作知識整合到影片特徵中。基於此增強表示,知識解耦模組(KDM)進一步解耦原子動作知識,以產生更精確的語義引導用於動作解耦。我們引入知識解耦損失(KD Loss)來促進KDM內知識成分的更清晰解耦。大量實驗表明,KDA改善了特徵區分能力,並在多標籤動作辨識基準上達到了最先進的性能。此外,KIM和KDM可以輕鬆整合到其他方法中,展示了強大的通用性。

Submission history

From: Tianci Wu [view email]
[v1] Tue, 28 Jul 2026 03:54:27 UTC (1,265 KB)