【论文阅读】CamoFormer: Masked Separable Attention for Camouflaged Object Detection
标题
CamoFormer: Masked Separable Attention for Camouflaged Object Detection
CamoFormer:基于掩码可分离注意力的伪装目标检测
引言
本论文方法与最近SOTA方法的视觉对比.
最近的SOTA方法仍在捕捉伪装物体和区分背景方面面临挑战。本文受Transformer中多头自注意力机制的启发,设计了掩码可分离注意力(masked separable attention, MSA),MSA与一个自上而下的decoder协同工作,再加上一个backbone encoder,构成了新模型CamoFormer。
本文方法建立在多头自注意力机制的基础上,但不像传统方法那样简单地利用多个注意力头来增强特征表示,本文尝试利用不同的注意力头来计算不同区域之间的像素相关性。
具体而言,本文方法将自注意头划分为3组,首先使用两组注意力头独立计算前景和背景区域的像素相关性,目标是使用预测前景中预测头生成的注意力分数从全值表示中对伪装目标进行索引,对背景同理。
另一组注意力头用于计算整个特征图的像素相关性,从而从一个全局的视角来区分伪装物体。
主要贡献:
-
本文提出了掩码可分离注意力(MSA),使用不同的注意力头计算不同区域的视觉相似性,同时在前景和背景之间建模了全局依赖。
-
本文提出了一种新的网络架构,即CamoFormer,建立了一个自顶向下的路径,以充分发挥MSA的潜力。实验表明该方法取得了比以往工作更好的表现。
-
本文提出了两个新的简单指标,以评估伪装目标检测在边界区域的表现,并展现了该方法在处理边界区域时的更好的表现。
整体框架
CamoFormer的整体框架.
CamoFormer也采用了编解码结构,其中编码器采用PVTv2,解码器是根据编码器进行设计的。
CamoFormer的编码器
CamoFormer的encoder部分.
编码器采用PVTv2,给定输入图像 \(I\in \mathbb{R}^{H \times W \times 3}\),经过四阶段的PVT得到 \(\{E_i\}^4_{i=1}\),\(E_1\) 尺寸为 \(\frac{H}{4} \times \frac{W}{4}\),\(E_4\) 尺寸为 \(\frac{H}{32} \times \frac{W}{32}\)。
后三个阶段的特征 \(E_2, E_3, E_4\) 聚合后输入卷积块,生成具有高级语义信息的 \(E_5\)。
CamoFormer的解码器
编码器生成的特征 \(\{E_i\}^4_{i=1}\) 输入解码器,逐层生成聚合特征 \(\{D_i\}^4_{i=1}\),其中,\(D_4\) 的生成可描述为:
\(\mathcal{F}_\text{up}(\cdot)\) 是双线性上采样操作。
\(\{D_i\}^3_{i=1}\) 则定义为:
即本文的特征融合操作是基于逐像素乘法和加法,而非concat操作。
损失函数
由解码器生成的预测掩码记为 \(\{P_i\}^5_{i=1}\),在训练期间,每个 \(P_i\) 都会resize到与输入图像相同的大小,且均受 BCE损失 和 IoU损失 的监督。
总体损失形式化为:
其中 \(G\) 是 GT。
掩码可分离注意力
注意力计算方式为:
\(\bold{Q}, \bold{K}, \bold{V}\) 可以通过使用三个独立的 \(1 \times 1\) 卷积和一个 \(3 \times 3\) 的深度卷积生成,\(\alpha\) 是可学习的缩放参数。
MSA中前景注意力头的结构.
本文提出在MSA中引入对应层生成的预测掩码,以作为前景-背景对比的先验信息,以更好地识别伪装物体。为实现这一点,本文将所有注意力头划分为3组:前景头TA(F-TA)、背景头TA(B-TA)和普通TA。
具体而言,给定一个前景预测掩码 \(M_F\),F-TA可形式化为:
\(\bold{Q}_F, \bold{K}_F\) 是掩码查询和键矩阵,最终的 \(\bold{Q}, \bold{K}\) 可以通过将它们与 \(M_F\) 相乘来生成。\(\bold{V}_F\) 是无掩码的值矩阵,以这种方式,可以通过在前景区域之间建立成对(pairwise)关系来细化特征,从而避免可能包含污染信息的背景的影响。
同理,给定背景掩码 \(M_B=1-M_F\),可以得到B-TA:
除 F-TA 和 B-TA 外,第三组注意力头保持与 公式4 一致,用于在前景和背景之间建立关系。
所有注意力头的输出最后会进行concat连接,然后输入一个 \(3 \times 3\) 的卷积层,进行特征聚合,并将通道数映射到 \(C_d\):
\([\cdot \cdot \cdot]\) 表示concat操作。
掩码生成
每级特征会经过一个 \(3 \times 3\) 的卷积层,然后经过一个Sigmoid激活函数,生成该层对应掩码,然后这些掩码会被输入MSA中,这些掩码没有经过二值化,而是保持原有的[0, 1]之间的连续数值。
边界区域评估
--
实验
实现细节:
-
SGD优化器:momentum 0.9,weight decay 2e-4
-
学习率初始化为 5e-3,cosine learning rate
-
训练图像大小384×384
-
batch size 6
-
60 epochs,7 hours
-
一张 NVIDIA V100 GPU
数据集:CAMO、COD10K、NC4K
评价指标:
-
Structure-measure (\(S_m\))
-
平均绝对误差 M
-
weighted F-measure (\(\omega F\))
-
adaptive E-measure (\(\alpha E\))
-
precision-recall (PR) curves
-
\(F_\beta\)-threshold (\(F_\beta\)) curves
-
false negative ratios (FNRs)
定性评估
预测结果可视化
CamoFormer和其他SOTA方法的可视化比较,分割结果用橘色表示.
目标边界质量比较
CamoFormer和其他SOTA方法在边界分割上的可视化比较,GT边界用白色表示,分割结果用橘色表示.
定量评估
目标区域表现
‘-R’: ResNet50; ‘-C’: ConvNext-base; ‘-S’: Swin Transformer-base; ‘-P’: PVTv2-b4; ‘↑’: 指标越高越好; ‘↓’: 指标越低越好.
边界区域表现
‘-R’: ResNet; ‘-C’: ConvNext; ‘-S’: Swin Transformer; ‘-P’: PVTv2; ‘↑’: 指标越高越好; ‘↓’: 指标越低越好.
COD上的PR和\(F_\beta\)曲线
计算代价比较
假阴性比例 False Negative Ratios (FNRs)
消融实验
整体结果
‘Baseline’: Transformer backbone和几个卷积层;‘w/TA only’:Baseline使用TA,并进行迭代细化.
掩码可分离注意力 Masked Separable Attention
特征可视化
渐进融合中的MSA
MSA的泛化性
解码器宽度(通道数)

浙公网安备 33010602011771号