[2026年7月28日提出]

PDFを表示 HTML(実験的)

要約:複雑なシーンにおける行動認識では、複数の同時進行する細粒度アクションが関与することが多く、内部の行動構造のモデル化が困難になります。既存のほとんどの手法は全体的な表現に依存しており、微妙な相互作用や細粒度の意味を捉えるには不十分です。最近のプロンプトベースのアプローチは分離を導入していますが、明示的な意味的ガイダンスを欠いており、視覚的または構造的な手がかりのみに基づく手法は依然として粗い粒度のままです。本論文では、行動表現を強化し、より精密な分離を実現するために、細粒度の意味的知識を活用する知識誘導型原子アクション分離(KDA)を提案します。具体的には、大規模言語モデル(LLM)を使用して行動ラベルを原子アクションに分解し、明示的な時空間的意味を提供します。知識注入モジュール(KIM)はまず、原子アクションの知識をビデオ特徴に統合します。この強化された表現に基づき、知識分離モジュール(KDM)はさらに原子アクションの知識を分離し、行動分離のためのより精密な意味的ガイダンスを生成します。知識分離損失(KD Loss)は、KDM内の知識コンポーネントのより明確な分離を促進するために導入されます。広範な実験により、KDAが特徴の識別性を向上させ、マルチラベル行動認識ベンチマークで最先端の性能を達成することを示します。さらに、KIMとKDMは他の手法に容易に統合可能であり、強い汎用性を示します。

投稿履歴

投稿者: Tianci Wu [メールを表示]
[v1] 2026年7月28日火曜日 03:54:27 UTC (1,265 KB)