[Submitted on 13 Nov 2025]

View PDF HTML (experimental)

Abstract:图像去模糊在计算机视觉中至关重要,旨在从因运动或相机抖动造成的模糊图像中恢复清晰图像。尽管诸如CNN和视觉Transformer(ViT)等深度学习方法推动了该领域的发展,但它们往往难以应对复杂或高分辨率模糊以及计算需求。我们提出了一种新的双域架构,将视觉Transformer与频域FFT-ReLU模块统一起来,明确地将空间注意力建模与频率稀疏性联系起来。在该结构中,ViT主干捕获局部和全局依赖关系,而FFT-ReLU组件则强制执行频域稀疏性以抑制与模糊相关的伪影并保留精细细节。在基准数据集上的大量实验表明,该架构在PSNR、SSIM和感知质量方面均优于最先进的模型。定量指标、定性比较和人类偏好评估均证实了其有效性,为现实世界图像恢复建立了一种实用且可泛化的范式。

Submission history

From: Syed Mumtahin Mahmud [view email]
[v1] Thu, 13 Nov 2025 21:19:57 UTC (2,004 KB)