[2026年7月28日提出]

PDFを表示 HTML (experimental)

要約:複雑な照明、多様な影の外観、および限定的な学習データのため、実世界におけるビデオ影除去は依然として困難である。多数のビジョンおよびグラフィックスアプリケーションにとって重要であるにもかかわらず、制約のない実世界シナリオではほとんど探索されていない。このギャップに対処するため、LoRAファインチューニングにより事前学習済みビデオ拡散モデルを適応させたWildShadowRemoverを提案する。凍結されたVAEデコーダに詳細注入モジュールを追加し、影マスク誘導の周波数分解変調モジュールを導入することで、モデルの強力な生成事前情報を保持しつつ、細部を保持しながら高周波テクスチャを選択的に復元し、影のアーティファクトを抑制する。さらに、Depth Anything 3由来の単眼深度事前情報が、困難な照明条件下でのジオメトリ認識ガイダンスを提供する。また、多様な合成シーンをカバーする大規模なペアビデオ影除去データセットおよびベンチマークであるWildShadowを構築した。広範な実験により、本手法は既存手法を影除去品質と時間的一貫性で上回り、優れた視覚品質と実世界の困難なシナリオにおける強力な汎化能力を持つ時間的にコヒーレントな影なしビデオを生成することを示した。

提出履歴

投稿者: Jiamin Xu [メールを表示]
[v1] 2026年7月28日(火) 19:08:26 UTC (4,852 KB)