IDN:通过信息蒸馏网络实现快速准确的单图像超分辨率

IDN:通过信息蒸馏网络实现快速准确的单图像超分辨率

Fast and Accurate Single Image Super-Resolution via Information Distillation Network

通过信息蒸馏网络 实现快速准确的单图像超分辨率

https://arxiv.org/abs/1803.09454

https://github.com/Zheng222/IDN-Caffe

CVPR 2018

Abstract

  • 问题:基于 CNN 的超分辨率方法在实践中面临着计算复杂性和内存消耗的挑战
  • 方法:提出了一个深度但紧凑的卷积网络,从原始的低分辨率图像中直接重建高分辨率图像
    • 模型由三部分组成,分别是特征提取块、堆叠信息蒸馏块和重建块
    • 通过将增强单元与压缩单元组合成蒸馏块,可以有效地提取局部长短路径特征
    • 增强单元将两种不同类型的特征混合在一起,压缩单元为顺序块提取了更多有用的信息
  • 结果:实验结果表明,所提方法优于现有方法,特别是在时间性能方面
  • 主要贡献
    • 所提出的 IDN 直接从 LR 图像中提取特征图,并采用多个级联 DBlocks 来生成 HR 空间中的残差表示。在每个 DBlock 中,增强单元尽可能多地收集更多信息,而压缩单元提取更多有用的信息。因此,尽管使用较少数量的卷积层,IDN 仍取得了有竞争力的结果。
    • 由于所提出的 IDN 结构简洁,它比几种基于 CNN 的 SR 方法要快得多。所提出的方法能达到实时速度并保持较好的重建精度。

1. 引言


图2:网络架构

  • 特征提取块(feature extraction block FBlock):从 LR 图像中提取特征
  • 信息蒸馏块(multiple information distillation blocks):逐步蒸馏残差信息
  • 重构块(reconstruction Block RBlcok):将得到的HR残差表示聚合起来,生成残差图像
  • 残差图像 + 双三次插值上采样图像

图3:所提出模型中增强单元的架构。橙色圆圈表示切片操作,紫色圆圈表示通道维度上的串联操作

  • 信息蒸馏块

    • 增强单元(enhancement unit)

      • 主要由两个浅卷积网络组成,每个都有三层 \(3\times 3\) 卷积
        • 局部短路径特征(the local short-path features):第一个模块的特征图是通过短路径(3层)提取的
        • 局部长路径特征(the local long-path features):将部分局部短路径特征发送到第二个模块,第二个模块的特征图就是局部长路径特征
      • 在得到长路径和短路径特征图之后,将两类特征聚合在一起,以获得更丰富、更高效的信息
      • 提高网络的表示能力
    • 压缩单元(compression unit)

      • 采用简单卷积层来压缩增强单元特征中的冗余信息
    • 增强单元可能多地收集更多信息,压缩单元提取更多有用的信息

2. 相关工作

2.1 基于自示例的方法

2.2 基于外部示例的方法

2.3 基于卷积神经网络的方法

3. 方法

3.1 网络结构

  • 特征提取块(FBlock)

    • 利用两个 \(3\times 3\) 卷积层从原始LR图像中提取特征图

    \[B_0 = f(x) \]

    • x : 输入
    • y : 输出
    • \(f\) : 特征提取函数
    • \(B_0\) : 提取的特征
  • 信息蒸馏块(DBlock)

    • 每个块都包含一个增强单元和一个压缩单元

      \[B_k=F_k(B_{k-1}),\ k=1,\cdots,n \]

    • \(F_k\) : 表示第 \(k^{th}\) 个 DBlock 函数

    • \(B_{k-1}\) : 表示第 \(k^{th}\) 个 DBlock 函数的输入

    • \(B_{k}\) : 表示第 \(k^{th}\) 个 DBlock 函数的输出

  • 重构块(RBlock)

    • 采用一个没有激活函数的转置卷积作为RBlock

      \[y = R(F_n(B_{n-1})) + U(x) \]

    • \(R\) : RBlock

    • \(U\) : 双三次插值

3.1.1 损失函数

  • MSE

    \[l_{MSE}=\frac{1}{N}\sum^{N}_{i=1}|| I_i-\hat I_i ||^2_2 \]

  • MAE

    \[l_{MAE} = \frac{1}{N}\sum^N_{i=1}|| I_i - \hat I_i ||_1 \]

  • 平均绝对误差(MAE)损失和基于 FFT 的频率损失函数的组合

    \[\ell = ||I_{SR} - I_{HR}||_1 + \lambda||F(I_{SR}) - F(I_{HR}) )||_1 \tag{2} \]

增强的深度残差网络,可实现单图像超分辨率(Enhanced deep residual networks for single image super-resolution.)实验证明 MSE 损失不是一个好的选择。

我们实验证明,MSE 损失函数可以提高使用 MAE 损失训练的网络的性能。因此,首先用 MAE 损失训练网络,然后通过MSE损失对其进行微调。EfficientSR比赛中,通常使用L1预训练,L2微调。

3.2 增强单元

图3:所提出模型中增强单元的架构。橙色圆圈表示切片操作,紫色圆圈表示通道维度上的串联操作

增强单元分为两个模块,每个模块有 3 个 \(3\times 3\) 卷积,每个卷积后面都跟着一个 LeakyReLU 激活函数。

第一个模块中的通道维度关系可以表示为

\[D_3 - D_1= D_1 - D_2 = d \]

  • \(D_i\) : 第 \(i^{th}\) 层的特征图通道数
  • \(d\) : 表示第一层和第二层或者第一层和第三层之间的差异

第二个模块中的通道维度关系可以表示为:

\[D_6-D_4=D_4-D_5=D \]

  • \(D_4=D_3\)

\[P^k_1 = C_a(B_{k-1}) \]

  • \(B_{k-1}\) : 前一个模块的输出,当前模块的输入
  • \(C_a\) : 第一个模块的链式卷积操作
  • \(P^k_1\) : 表示第 \(k^{th}\) 个增强单元的第一个模块的输出

\(P^k_1\)\(\frac{D_3}{s}\) 维度的特征图和第一卷积层的输入在通道维度中连接。

\[R^k = C(S(P^k_1, 1/s), B_{k-1}) \]

  • \(C\) : 串联运算
  • \(S\) : 切片运算
  • \(S(P^k_1, 1/s)\) : 表示 \(\frac{D_3}{S}\) 维度特征是从 \(P^k_1\) 中获取的
  • \(C(S(P^k_1, 1/s), B_{k-1})\) : 将通道维度连接起来,目的是将以前的信息与一些当前信息结合起来。可以看作是部分保留的局部短路经信息。

将其余的局部短路经信息进一步提取长路径特征图

\[P^k_2 = C_b(S(P^k_1,1-1/s)) \]

  • \(P^k_2\) : 表示第 \(k^{th}\) 个增强单元的第二个模块的输出
  • \(C_b\) : 第二个模块的链式卷积运算

最后,将输入信息、保留的局部短路经信息和局部长路径信息进行汇总。因此,增强单元可以表示为:

\[P^k = P^k_2+R^k=C_b(S(C_a(B_{k-1}), 1-1/s))+C(S(C_a(B_{k-1}), 1/s), B_{k-1}) \]

  • \(P^k\) : 增强单元的输出

3.3 压缩单元

利用 \(1\times 1\) 卷积层来实现压缩机制,该卷积层充当降维或为后续网络提炼相关信息。

\[B_k = f^k_F(P^k)=\alpha ^k_F(W^k_F(P^k)) \]

  • \(f^k_F\) : 表示卷积层的 \(1\times 1\) 卷积
  • \(\alpha^k_F\) : 激活函数
  • \(W^k_F\) : 权重参数

4. 实验

4.1 数据集

4.1.1 训练数据集

4.1.2测试数据集

4.2 实现细节

  • 4个DBlock
  • \(D_3=64,\ d=16,\ s=4\)
  • LReLU = 0.05
  • Adam
  • batch_size = 64
  • lr = 1e-4

4.3 网络分析

图4:Set5数据集中蝴蝶图像的残差图像和数据分布直方图

增强单位的平均特征图

压缩单元的平均特征图

图5:平均特征图的可视化

所提出的具有全局残差结构的模型主要学习残差图像。如图4(a)所示,真实残差图像主要包含细节和纹理信息,其归一化像素值范围为-0.4至0.5。从图4(b)中,我们发现残差图像中存在正值和负值,正像素数与负像素数直观相似。显然,零值及其相邻值的数量最多,这表明残差图像中的平滑区域几乎被消除。因此,我们网络的任务是逐渐减去原始输入图像的平滑区域。为了验证我们的直觉,我们需要检查增强和压缩单元的输出。

具体来说,在这项工作中,我们将考虑特征图在通道维度上的平均值。平均特征图可以粗略地表示整个特征图的情况。为了探究增强单元和压缩单元的功能,我们可视化了每个增强单元和压缩单元的输出。如图5(a)所示,从第一个子图到第三个子图,平均特征图逐渐减小像素值,特别是在平滑区域。根据图5(a),我们可以很容易地看到第一个子图具有较大的像素值,但具有蝴蝶的粗略轮廓。第二和第三个子图显示,后面的增强单元继续降低像素值,以获得具有相对清晰轮廓的特征。此外,最后一个子图明显超过了前一个子图,这为直接连接到RBlock的顺序压缩单元带来了更好的输入。综上所述,增强单元的功能主要增强了输入LR图像的轮廓区域。至于压缩单元的影响,将图5(a)与图5(b)进行比较,我们发现特征的像素值通过压缩单元映射到较小的范围内。从图5(b)的第二个子图和图5(a)的第三个子图中,我们可以看到压缩单元的平均特征图的某些区域被以下增强单元增强了。这表明前三个堆叠块的过程是整体降低像素值,而最后一个块则大大增强了轮廓和平滑区域之间的对比度。

RBlock 是一个转置卷积层,它组装最终 DBlock 的输出以生成残差图像。这种转置卷积的偏置项可以自动调整残差图像数据分布的中心值,以接近真实图像。

4.4 与最先进的技术比较

5. 结论

在本文中,我们提出了一种新的网络,该网络利用蒸馏块逐渐提取丰富而有效的特征,用于HR图像的重建。所提出的方法在PSNR、SSIM和IFC的四个基准数据集上取得了有竞争力的结果。同时,推理时间大大超过了DRRN 和 MemNet 等最先进的方法。这种紧凑的网络将在实践中得到更广泛的应用。未来,将探索这种图像超分辨率方法,以促进其他图像恢复问题,例如减少去粒和压缩伪影。

posted @ 2025-03-24 15:02  致郁系游戏  阅读(91)  评论(0)    收藏  举报