LKFN:高效单图像超分辨率的大核频率增强网络
LKFN:高效单图像超分辨率的大核频率增强网络
Large Kernel Frequency-enhanced Network for Efficient Single Image Super-Resolution
高效单图像超分辨率的大核频率增强网络
https://github.com/ThediidehT/LKFN
CVPRW 2024
摘要
-
问题:大多数注意力图都是直接从空间域获得的,由于空间卷积的局部性和有限的感受野,限制了其上限
-
方法:将焦点转移到频域,因为频域的自然全局属性可以解决这个问题
- 提出了一种新的频域注意力机制,频率增强像素注意(frequency-enhanced pixel attention FPA)
- 使用大核卷积核部分卷积来提高提取深度特征的能力,同时保持轻量级设计
-
结果:提出了一个模型尺寸更小,计算效率更高的大型内核频率增强网络(LKFN)。可以有效地捕获整幅图像中像素之间的长距离依赖关系,并在现有的高效超分辨率中实现最先进的性能
-
主要贡献:
- 在基本特征提取块中引入更大的卷积核,在保持轻量级的同时提供更大的感受野
- 提出了一种新的注意力机制,完全基于频域处理,可以真正实现整个图像的全局视图,对于不同尺度更加灵活
- 提出的 LKFN 以更简洁高效的方式实现了更好的超分辨率性能
1. 引言
2. 相关工作
2.1 探索高效超分辨率
2.2 大核卷积的复兴
LKSR、LKA、VAPSR、MAN、LKDN 都是讲大核卷积纳入注意力机制,以增强特征表示。
我们提出的 LKFN 发现,在特征提取过程中直接使用大核卷积也取得显著的改进。
2.3 CV中的频域方法
FFC 将 CNN 中的卷积替换成局部傅里叶单元,并在频域中进行卷积,可以互补地处理不同尺度。受 FFC 的启发,SwinFIR 将频域快速傅里叶与空间域卷积集成为互补的双分支结构模块,并将其嵌入到 SwinIR 中。
ShuffleMixer 和 SAFMN,不同于直接在模型结构中添加频域处理模块,而是在损失函数中添加频域约束。
我们的 LKFN 探索了结合频域方法和注意力机制,提出了一种频率增强的像素注意力,并解释了为什么在传统频域操作不适合超分辨任务。
3. 方法
3.1 重新思考频域操作


空间域的卷积运算等价于频域的元素相乘
我们研究了傅里叶单元的具体操作,发现了问题所在。当对实数进行傅里叶变换时,频域特征映射的每个元素都是由实部和虚部组成的二元元组。由于主流深度学习框架不支持对复数的直接操作,因此傅里叶单元采用在通道方向上叠加实部和虚部的方法,然后使用1 ×1卷积跨双通道进行处理(图4中的左侧部分)。问题就出在这里。 这种处理方法造成实部和虚部之间的数据交换, 极大地破坏了相位角,从根本上破坏了图像的空间结构和特征定位。通过这种方式获得的超分辨率图像,会出现明显的类似百叶窗的伪影,如图3 所示。考虑到FFC是为图像分类而设计的,直接应用于sr会导致性能严重下降,因此我们进行了改进,将实部和虚部之间的数据通信隔离,如图图4所示。我们使用相同的卷积分别处理实部和虚部,这也避免了由于通道数加倍而导致的参数增加。超分辨率图像立即恢复正常,伪影消失了。
3.2 频率增强像素注意

通过重新思考和改进SR中的频域操作,我们 可以进一步探索频域方法带来的优势。因此,我 们将频域处理与注意机制相结合,提出了频率增强像素注意(Frequency-enhanced Pixel attention, FPA)。正常情况下,注意力图是从空间域的特征图中提取的。 由于卷积算子的局部性,在空间域中学习像素位置之间的相关性只能覆盖很小的范围,这大大降低了注意力机制的有效性。虽然使用更大的卷积核可以在一定程度上缓解这个问题,但并不能真正实现像self-attention那样的全局注意力,同时带来更大的计算成本和更大的模型尺寸。
在我们的 FPA 中,如图 5 所示,我们首先使用快速傅里叶变换 \(fft(\cdot)\) 将形状为 \(C\times H\times W\) 的空间域特征映射转换到频域,得到形状为 \(C\times H\times \lfloor W/2 \rfloor + l\) 的频域特征映射。因为二维实信号的傅里叶变换是共轭对称的厄米矩阵,所以一半的信息是冗余的。
频域特征图经过一个三层 \(1\times 1\) 卷积,两个 LeakyReLU,并与初始频域特征图添加一个残差连接,然后通过快速傅里叶反变换 \(ifft(\cdot)\) 得到像素注意图,并乘以初始输入。
- \(fe\) : 表示使用 \(1\times 1\) 卷积进行频域增强的模块
3.3 大内核频率增强块

设计了一个大型的内核频率增强块(LKFB),其中集成 FPA 模块。另一方面,受大内核卷积和PConv的启发,我们提出了 部分大内核块(partial large kernel block PLKB)。为了提取层次更丰富的特征图,并对更大的卷积核带来的参数和计算量的增加,我们进一步使用部分卷积来减少通道。通过这种方式获得的细粒度特征映射,结合 FPA 带来的全局关注,使所提出的LKFB能够以轻量级的方式获得相当的性能。

- \(Conv_{DW}\) : 表示 \(5\times 5\) 深度卷积
蒸馏层的蒸馏特征和最终的细化输出通过 \(1\times 1\) 卷积进行连接和融合
融合后的特征图通过FPA模块进行图像增强,然后进行1×1卷积,最后通过Pixel Normalization进行归一化
最后,将块内的残差连接与输入连接,增强深度模型的学习能力
3.4 网络体系结构




4. 实验
4.1 数据集和指标
- 数据集:DIV2K的 800 张图像 和 LSDIR的前 10K 张图像组成
4.2 实现细节
- LKFN
- 8 个 lkfb 组成,通道数设置为 56
- batch_size : 64
- patch_size : 64 x 64
- L1 损失函数
- 优化器:Adan
- lr :[\(5\times 10^{-3},1\times 10^{-7}\)]
- iterations : 1000 K
- LKFN-s
- 8 个 lkfb 组成,通道数设置为 28
- 在 lkfb 的第三个 PLKB 中,将 \(5\times 5\) 深度卷积扩张比设置为 3
- 训练过程包括两个阶段:
- 最小化 L1 损失
- patch_size : 64 x 64
- batch_size : 64
- 学习率于标准 LKFN 相同
- iterations : 1000 K
- 最小化 MSE 损失进行微调
- patch_size : 120 x 120
- batch_size : 64
- 学习率 : \(2\times 10^{-5}\)
- iterations : 150 K
- 最小化 L1 损失
4.3 消融实验

作者认为局部特征在 Set5 中起着更重要的作用
- FPA模块的有效性:仅用 65% 的参数就获得了相当的性能

图8:LKFN与其他高效SR模型的LAM和DI结果比较
在LKFN的LAM中,除了红框区域外,整个图像的像素几乎有相同的贡献。这验证了从频域获得的注意力图具有全局视角。


a. 没有使用注意力机智,而是添加特征图
b. 放弃 频域过程,在空间域上处理
c. 完全没有注意力机制
4.4 与最先进的方法比较


近年来,高效轻量的图像超分辨率取得了显著进展,部分原因是设计了几种增强模型表示能力的强大轻量注意力机制。然而,大多数方法的注意力图都是直接从空间域获得的,由于空间卷积的局部性和有限的感受野,限制了它们的上界。在本文中,我们将焦点转移到频域,因为频域的自然全局属性可以解决这个问题。为了从频域角度探索注意力图,我们调查并纠正了现有频域特征处理方法中的一些误解,并提出了一种新的频域注意机制,称为频率增强像素注意(frequen cy-enhanced pixel attention, FPA)。此外,我们使用大核卷积和部分卷积来提高提取深度特征的能力,同时保持轻量级的设计。在这些改进的基础上,我们提出了一个模型尺寸更小、计算效率更高的大型核频率增强网络(LKFN)。它可以有效地捕获整幅图像中像素之间的长程依赖关系,并在现有的高效超分辨率方法中实现最先进的性能。
浙公网安备 33010602011771号