LKFN:高效单图像超分辨率的大核频率增强网络

LKFN:高效单图像超分辨率的大核频率增强网络

Large Kernel Frequency-enhanced Network for Efficient Single Image Super-Resolution

高效单图像超分辨率的大核频率增强网络

https://openaccess.thecvf.com/content/CVPR2024W/NTIRE/papers/Chen_Large_Kernel_Frequency-enhanced_Network_for_Efficient_Single_Image_Super-Resolution_CVPRW_2024_paper.pdf

https://github.com/ThediidehT/LKFN

CVPRW 2024

摘要

  • 问题:大多数注意力图都是直接从空间域获得的,由于空间卷积的局部性和有限的感受野,限制了其上限

  • 方法:将焦点转移到频域,因为频域的自然全局属性可以解决这个问题

    • 提出了一种新的频域注意力机制,频率增强像素注意(frequency-enhanced pixel attention FPA)
    • 使用大核卷积核部分卷积来提高提取深度特征的能力,同时保持轻量级设计
  • 结果:提出了一个模型尺寸更小,计算效率更高的大型内核频率增强网络(LKFN)。可以有效地捕获整幅图像中像素之间的长距离依赖关系,并在现有的高效超分辨率中实现最先进的性能

  • 主要贡献

    • 在基本特征提取块中引入更大的卷积核,在保持轻量级的同时提供更大的感受野
    • 提出了一种新的注意力机制,完全基于频域处理,可以真正实现整个图像的全局视图,对于不同尺度更加灵活
    • 提出的 LKFN 以更简洁高效的方式实现了更好的超分辨率性能

1. 引言

2. 相关工作

2.1 探索高效超分辨率

2.2 大核卷积的复兴

LKSR、LKA、VAPSR、MAN、LKDN 都是讲大核卷积纳入注意力机制,以增强特征表示。

我们提出的 LKFN 发现,在特征提取过程中直接使用大核卷积也取得显著的改进。

2.3 CV中的频域方法

FFC 将 CNN 中的卷积替换成局部傅里叶单元,并在频域中进行卷积,可以互补地处理不同尺度。受 FFC 的启发,SwinFIR 将频域快速傅里叶与空间域卷积集成为互补的双分支结构模块,并将其嵌入到 SwinIR 中。

ShuffleMixer 和 SAFMN,不同于直接在模型结构中添加频域处理模块,而是在损失函数中添加频域约束。

我们的 LKFN 探索了结合频域方法和注意力机制,提出了一种频率增强的像素注意力,并解释了为什么在传统频域操作不适合超分辨任务。

3. 方法

3.1 重新思考频域操作


空间域的卷积运算等价于频域的元素相乘

我们研究了傅里叶单元的具体操作,发现了问题所在。当对实数进行傅里叶变换时,频域特征映射的每个元素都是由实部和虚部组成的二元元组。由于主流深度学习框架不支持对复数的直接操作,因此傅里叶单元采用在通道方向上叠加实部和虚部的方法,然后使用1 ×1卷积跨双通道进行处理(图4中的左侧部分)。问题就出在这里。 这种处理方法造成实部和虚部之间的数据交换, 极大地破坏了相位角,从根本上破坏了图像的空间结构和特征定位。通过这种方式获得的超分辨率图像,会出现明显的类似百叶窗的伪影,如图3 所示。考虑到FFC是为图像分类而设计的,直接应用于sr会导致性能严重下降,因此我们进行了改进,将实部和虚部之间的数据通信隔离,如图图4所示。我们使用相同的卷积分别处理实部和虚部,这也避免了由于通道数加倍而导致的参数增加。超分辨率图像立即恢复正常,伪影消失了。

3.2 频率增强像素注意

通过重新思考和改进SR中的频域操作,我们 可以进一步探索频域方法带来的优势。因此,我 们将频域处理与注意机制相结合,提出了频率增强像素注意(Frequency-enhanced Pixel attention, FPA)。正常情况下,注意力图是从空间域的特征图中提取的。 由于卷积算子的局部性,在空间域中学习像素位置之间的相关性只能覆盖很小的范围,这大大降低了注意力机制的有效性。虽然使用更大的卷积核可以在一定程度上缓解这个问题,但并不能真正实现像self-attention那样的全局注意力,同时带来更大的计算成本和更大的模型尺寸。

在我们的 FPA 中,如图 5 所示,我们首先使用快速傅里叶变换 \(fft(\cdot)\) 将形状为 \(C\times H\times W\) 的空间域特征映射转换到频域,得到形状为 \(C\times H\times \lfloor W/2 \rfloor + l\) 的频域特征映射。因为二维实信号的傅里叶变换是共轭对称的厄米矩阵,所以一半的信息是冗余的。

频域特征图经过一个三层 \(1\times 1\) 卷积,两个 LeakyReLU,并与初始频域特征图添加一个残差连接,然后通过快速傅里叶反变换 \(ifft(\cdot)\) 得到像素注意图,并乘以初始输入。

\[F_{attention} = ifft( fft(F) + fe(fft(F)) ) \\ F_{enhanced} = F_{attention} \otimes F \]

  • \(fe\) : 表示使用 \(1\times 1\) 卷积进行频域增强的模块

3.3 大内核频率增强块

设计了一个大型的内核频率增强块(LKFB),其中集成 FPA 模块。另一方面,受大内核卷积和PConv的启发,我们提出了 部分大内核块(partial large kernel block PLKB)。为了提取层次更丰富的特征图,并对更大的卷积核带来的参数和计算量的增加,我们进一步使用部分卷积来减少通道。通过这种方式获得的细粒度特征映射,结合 FPA 带来的全局关注,使所提出的LKFB能够以轻量级的方式获得相当的性能。

\[PLKB_i(F) = Conv_{1\times1}(Conv_{DW}(F_{split1}), F_{split2}) \]

  • \(Conv_{DW}\) : 表示 \(5\times 5\) 深度卷积

蒸馏层的蒸馏特征和最终的细化输出通过 \(1\times 1\) 卷积进行连接和融合

\[F_{fused} = Conv_{1\times 1}(Concat(F_{d1},F_{d2},F_{d3},F_{d4})) \]

融合后的特征图通过FPA模块进行图像增强,然后进行1×1卷积,最后通过Pixel Normalization进行归一化

\[F_{enhanced} = PixelNorm(Conv_{1\times 1}(FPA(F_{fused}))) \]

最后,将块内的残差连接与输入连接,增强深度模型的学习能力

\[F_{out} = F_{enhanced} + F_{in} \]

3.4 网络体系结构

4. 实验

4.1 数据集和指标

  • 数据集:DIV2K的 800 张图像 和 LSDIR的前 10K 张图像组成

4.2 实现细节

  • LKFN
    • 8 个 lkfb 组成,通道数设置为 56
    • batch_size : 64
    • patch_size : 64 x 64
    • L1 损失函数
    • 优化器:Adan
      • lr :[\(5\times 10^{-3},1\times 10^{-7}\)]
    • iterations : 1000 K
  • LKFN-s
    • 8 个 lkfb 组成,通道数设置为 28
    • 在 lkfb 的第三个 PLKB 中,将 \(5\times 5\) 深度卷积扩张比设置为 3
    • 训练过程包括两个阶段:
      1. 最小化 L1 损失
        • patch_size : 64 x 64
        • batch_size : 64
        • 学习率于标准 LKFN 相同
        • iterations : 1000 K
      2. 最小化 MSE 损失进行微调
        • patch_size : 120 x 120
        • batch_size : 64
        • 学习率 : \(2\times 10^{-5}\)
        • iterations : 150 K

4.3 消融实验

作者认为局部特征在 Set5 中起着更重要的作用

  • FPA模块的有效性:仅用 65% 的参数就获得了相当的性能

图8:LKFN与其他高效SR模型的LAM和DI结果比较

在LKFN的LAM中,除了红框区域外,整个图像的像素几乎有相同的贡献。这验证了从频域获得的注意力图具有全局视角。

a. 没有使用注意力机智,而是添加特征图

b. 放弃 频域过程,在空间域上处理

c. 完全没有注意力机制

4.4 与最先进的方法比较

posted @ 2025-03-31 19:12  致郁系游戏  阅读(165)  评论(0)    收藏  举报