[Submitted on 13 Nov 2025]
Abstract:影像去模糊在電腦視覺中扮演關鍵角色,旨在從因運動或相機晃動造成的模糊影像中恢復清晰畫面。雖然 CNN 與 Vision Transformer(ViT)等深度學習方法已推動此領域發展,但它們在處理複雜或高解析度模糊,以及運算需求方面仍常遭遇困難。我們提出一個全新的雙域架構,將 Vision Transformer 與頻率域的 FFT-ReLU 模組整合,明確橋接空間注意力建模與頻率稀疏性。在此架構中,ViT 主幹捕捉局部與全局依賴關係,而 FFT-ReLU 組件則在頻率域強制稀疏性,以抑制與模糊相關的假影並保留細節。對基準資料集的大量實驗顯示,此架構在 PSNR、SSIM 以及感知品質方面均優於現有最先進模型。定量指標、質性比較以及人類偏好評估均證實其效能,確立了一個適用於真實世界影像修復的實用且可泛化典範。
Submission history
From: Syed Mumtahin Mahmud [view email]
[v1]
Thu, 13 Nov 2025 21:19:57 UTC (2,004 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.