[2025年11月13日投稿]

PDFを表示 HTML(実験的)

要旨:画像のデブラリングはコンピュータビジョンにおいて重要であり、動きや手ぶれによって生じたぼやけた画像から鮮明な画像を復元することを目指します。CNNやVision Transformer(ViT)などの深層学習手法は、この分野を進展させてきましたが、複雑または高解像度のぼやけや計算量の要求に苦戦することがよくあります。本稿では、Vision Transformerと周波数領域のFFT-ReLUモジュールを統合した新しいデュアルドメインアーキテクチャを提案し、空間的なアテンションモデリングと周波数のスパース性を明示的に橋渡しします。この構造では、ViTバックボーンが局所的および大域的な依存関係を捉え、FFT-ReLUコンポーネントが周波数領域のスパース性を強制して、ぼやけに関連するアーティファクトを抑制し、細部を保持します。ベンチマークデータセットにおける広範な実験により、このアーキテクチャは最先端モデルと比較して優れたPSNR、SSIMおよび知覚品質を達成することを示します。定量的な指標、質的な比較、および人間の嗜好評価は、いずれもその有効性を確認し、実世界の画像復元に対する実用的かつ汎用的なパラダイムを確立します。

投稿履歴

投稿者: Syed Mumtahin Mahmud [メールを表示]
[v1] 2025年11月13日(木) 21:19:57 UTC (2,004 KB)