【论文阅读】HINTED: Hard Instance Enhanced Detector with Mixed-Density Feature Fusion for Sparsely-Supervised 3D Object Detection

标题

HINTED: Hard Instance Enhanced Detector with Mixed-Density Feature Fusion for Sparsely-Supervised 3D Object Detection

HINTED:基于混合密度特征融合的硬实例增强检测器的稀疏监督3D目标检测

Abstract

​ 当前的稀疏监督目标检测方法主要依赖于高阈值设置,以从检测器预测结果中提取高质量的伪标签。然而,在点云中,难例(hard instances)通常具有不完整的结构,导致其对应的伪标签置信度较低。以往的方法不可避免地会导致这些实例的正监督信号不足。为了解决这一问题,我们提出了一种新的Hard INsTance Enhanced Detector(HINTED),用于稀疏监督的三维目标检测。首先,我们设计了一种自增强教师(Self-Boosting Teacher, SBT)模型,以生成更多潜在的伪标签,提高信息传递的有效性。其次,我们引入了一种混合密度学生(Mixed-Density Student, MDS)模型,使其在训练过程中聚焦于难例,从而提升检测精度。我们在KITTI数据集上进行了广泛实验,验证了该方法的卓越性能。与领先的稀疏监督方法相比,HINTED在难例检测方面有显著提升,尤其在检测如骑行者等具有挑战性的类别时,甚至优于完全监督方法。此外,在挑战性类别上,HINTED的检测性能也远超最先进的半监督方法。代码可在以下地址获取: https://github.com/xmuqimingxia/HINTED 。

1. Introduction

​ 在自动驾驶场景中,三维目标检测任务的成功在很大程度上依赖于精确的标注信息【1, 6, 10, 15, 28, 29】。然而,获取高质量的标注数据成本巨大,尤其是在大规模户外场景下。作为降低标注成本的一种有效策略,稀疏监督学习(sparsely-supervised learning) 受到广泛关注。稀疏监督的设定意味着仅从整个训练数据集中选择一个子集进行部分标注(partial annotation),其中“部分标注”指的是每帧仅标注一个实例。

图1
图 1. 稀疏监督三维目标检测方法的比较。目前的稀疏监督三维目标检测方法【12, 30】主要依赖于通过高阈值生成的高质量伪标签进行自训练,但这种方式不可避免地导致难例(hard instances)缺乏足够的正监督信号。为了解决这一问题,我们提出 HINTED,在稀疏监督环境下引入教师-学生框架。具体而言,自增强教师(Self-Boosting Teacher, SBT)能够生成更多潜在的伪标签,而混合密度学生(Mixed-Density Student, MDS)通过融合不同的特征表示,提升对模拟难例的预测能力。HINTED 促进了在同一场景中不同密度表示下检测性能的一致性。

​ 如图1所示,当前主流的稀疏监督三维目标检测方法【12, 30】主要采用自训练策略,即使用预训练的检测器挖掘未标注的实例。其中,SS3D【12】通过高置信度阈值从预测结果中生成高质量的伪标签,这一操作使后续的自训练更加可靠。而 CoIn++【30】采用测试时增强(Test-Time Augmentation, TTA)策略,以获得更准确的伪标签。这些方法在稀疏监督环境下对易检测目标(easy objects)取得了良好表现。然而,难例通常具有较低的置信度评分,导致许多正样本预测被忽略。

​ 值得注意的是,难例检测 近年来也成为全监督三维目标检测方法的关注重点。例如,FocalFormer3D【3】在网络训练过程中不断屏蔽易检测样本,从而增加训练对难例的关注,提高其检测能力。SST【5】和 FSD【6】则保持点云的原始分辨率,以确保难例的信息不会丢失。这些全监督方法能够利用真实标注位置(ground-truth locations)引导网络专注于难例的训练。然而,在稀疏监督设定下,由于缺乏完整的标注信息,这些方法无法直接应用于稀疏监督策略。

​ 在许多场景未标注的情况下,一个直观的解决方案是使用教师-学生网络,这一策略常见于半监督方法。例如,DetMatch【19】通过对齐二维(2D)和三维(3D)检测结果,以生成更准确的伪标签。HSS3D【13】则采用分层监督(hierarchical supervision),在教师模型的输出中保留部分低置信度但潜在有效的伪标签。这类教师-学生框架在从未标注场景中高效挖掘伪标签方面取得了成功【14, 23, 24】。然而,正如【12】所指出的,在稀疏标注的场景中,未标注实例的数量众多,这阻碍了有效的信息传递,使得教师-学生框架难以直接应用于稀疏监督三维目标检测。尽管如此,教师-学生网络仍为解决稀疏标注三维目标检测问题提供了新的思路。

​ 基于上述方法,我们提出了一种新策略,以提升教师-学生网络在稀疏标注场景下的信息传递效率,并在训练过程中更加关注难例。具体而言,我们的方法主要由两个核心组件组成:

  1. 自增强教师(Self-Boosting Teacher, SBT):不同于传统的教师-学生网络,我们提出的 SBT 网络能够对稀疏标注帧的伪标签进行持续更新,从而避免因稀疏标注导致的错误监督。
  2. 混合密度学生(Mixed-Density Student, MDS):我们观察到,难例主要分布在远距离、稀疏的点云场景中。为了在训练过程中增强对难例的关注,MDS 通过混合密度特征的一致性预测(consistent prediction)来提高难例的检测性能。

​ 总的来说,我们的贡献主要体现在以下三个方面:

  • 我们设计了一种新的自增强教师(SBT),有效解决了传统教师网络在稀疏标注场景下信息传递效率低下的问题。
  • 我们引入了一种混合密度学生(MDS),鼓励一致性预测混合密度特征,从而提升难例的检测性能。
  • 在稀疏监督设定下,我们的方法达到了最先进(state-of-the-art)的性能,尤其在难例检测方面取得了显著提升,相较于现有方法,行人类别的检测性能提升了32%,骑行者类别的检测性能提升了25%。

2. Related Work

2.1. Sparsely-supervised 3D object detection

​ 近年来,由于标注边界框的成本较低,稀疏监督3D目标检测受到越来越多的关注。与全监督三维目标检测不同,稀疏监督方法仅需要少量的精确标注。因此,在稀疏监督设定下,需要生成伪标签来辅助检测器进行进一步训练。例如,SS3D【12】利用缺失标注实例挖掘(missing-annotated instance mining)和背景挖掘(background mining)来获取伪标签。类似地,CoIn【30】通过对比实例特征挖掘(contrastive instance feature mining)生成特征级别的伪标签。此外,CoIn++【30】结合 CoIn 与自训练框架(self-training framework),使其性能接近全监督方法。

​ 然而,现有方法主要依赖高阈值过滤算法,这导致正监督信息不足(lack of positive supervision information),不利于难例的检测。因此,在本研究中,我们的目标是提升检测器对难例的检测性能,使稀疏监督3D目标检测算法更加完善。

2.2. Weakly/semi-supervised 3D object detection

​ 此外,弱监督和半监督方法也在低标注成本的设定下,对目标检测算法进行了探索。与稀疏监督不同,弱监督方法【17, 26, 35】采用弱标注而非三维边界框标注来降低标注成本。然而,这种策略仍然需要大量实例级标注。

​ 在半监督设定下,已标注帧中的所有实例都被标注,训练通常采用学生-教师网络来从未标注帧中挖掘伪标签。例如,SESS【36】和 3DIoUMatch【24】是最早将半监督学习引入三维目标检测的工作。其中,SESS 提出了一种三重一致性正则化(triple consistency regularization)方法,以优化三维检测提议(3D proposals);而 3DIoUMatch 设计了一种伪标签过滤策略,通过IoU 估计分支(IoU estimation branch)来消除重复伪标签。

​ 后续研究进一步改进了伪标签的质量,而不仅仅依赖于阈值筛选。例如,文献【34】通过迭代重新训练直接优化伪标签的可靠性;DetMatch【19】通过多模态一致性(multi-modal consistency)校正伪标签;最新的 HSSDA【13】采用分层监督(hierarchical supervision)方法挖掘缺失目标,并引入了数据洗牌增强(shuffle data augmentation)策略。

​ 然而,由于实验设定的不同,稀疏监督中的弱标注帧限制了教师-学生网络在信息传递上的有效性。因此,在稀疏监督三维目标检测中,直接引入教师-学生网络仍然面临挑战。

2.3. Hard instance probing in 3D object detection

​ 随着三维目标检测方法的深入研究【2, 22, 25, 27, 31, 33, 37】,越来越多的研究开始关注难例的检测。一种直接的方法是调整网络架构,使其对难例更加敏感。例如,SST【5】采用稀疏区域注意力(sparse region attention),以避免对小目标进行下采样,而 FSD【6】进一步识别稀疏实例,用于远距离目标检测(long-range detection)。

​ 另一类方法采用多阶段网络(multi-stage networks),逐步优化边界框,并改进难例挖掘。例如,文献【3】在多阶段框架(multi-stage framework)的基础上,提出了一个专门用于难例检测的模块(hard instance probing module)。

​ 上述方法均基于全监督策略,在真实标注信息的监督下,算法可以在训练过程中轻松定位难例的位置。然而,这些策略并不适用于稀疏监督三维目标检测,因为缺乏完整的标注信息。

​ 总体而言,难例检测是三维目标检测领域的一个活跃研究方向,并且在全监督三维目标检测中已经取得了重要进展。因此,在稀疏监督设定下探索难例检测同样至关重要。

3. Method

3.1. Preliminary

问题定义(Problem Definition)

​ 我们首先介绍稀疏监督3D目标检测的定义。具体来说,检测器的训练数据包括稀疏标注场景集(sparsely labeled scene set) \(D^l = \{(P^s_i, Y^s_i) |_{i = 1}^{N^l}\}\) 和 未标注场景集(unlabeled scene set) \(D^u = \{ P^u_i | _{i = 1}^{N^u}\}\),其中 \(N^l\) 和 \(N^u\) 分别表示稀疏标注场景数和未标注场景数。对于每个稀疏标注场景 \(P^s_i\),其对应的标注 \(Y^s_i\) 仅包含该场景中一个随机实例的标注。该标注信息包括八维信息(eight-dimensional information),即:

  • 三维空间位置(three-dimensional spatial position)
  • 三维尺寸(three-dimensional size)
  • 方向(orientation)
  • 类别(category)

教师-学生框架(Teacher-Student Framework)

​ 受主流半监督方法【11, 13, 24】的启发,我们同样采用教师-学生框架来进行稀疏监督三维目标检测。该框架包含两个配置相同的检测器,并且我们借鉴以往的研究,选用PV-RCNN【20】和 VoxelRCNN【4】 作为基础模型。教师网络和学生网络之间的信息传递通过指数移动平均(exponential moving average, EMA) 进行更新,以确保教师网络在训练过程中稳定地提供高质量的伪标签。

3.2. Overview

图2

图 2. 所提出的 HINTED 框架概述,该框架由自增强教师(Self-Boosting Teacher, SBT)和混合密度学生(Mixed-Density Student, MDS)组成。在 SBT 模块中,教师网络为学生网络提供包含丰富信息的伪标签。在 MDS 模块中,模型首先通过检测器骨干网络 \(\mathcal{G}(\theta_g)\) 提取两种多尺度 BEV 特征(multi-scale BEV features):\({B_i}\)(用于常规视角 regular view)和 \(B^-_i\)(用于局部下采样视角 local down-sample view)。随后,利用特征融合模块 \(\mathcal{S}(\lambda)\) 生成混合密度特征 \(B^×\)。最后,检测头模块 \(\mathcal{H}(\theta_h)\) 促使不同密度表示的预测结果保持一致性。教师网络的权重 \(\bar{\theta}\) 通过指数移动平均(EMA)由学生网络的权重 \(\theta\) 进行更新。在测试阶段,模型采用原始网络架构(original architecture)和常规输入视角(regular input view)进行推理。

​ 我们的 HINTED 框架 的整体流程如图 2 所示,该框架基于教师-学生互学习(mutual learning)框架进行设计。在预训练阶段,我们采用 CoIn【30】的训练策略,为教师模型和学生模型初始化权重。

​ 在伪标签生成阶段,由于稀疏标注可能会干扰学生网络的训z练,我们引入了一种自增强教师网络(self-boosted teacher network)来缓解这一问题。借鉴文献【13】的方法,我们采用双阈值策略(dual-threshold strategy),以保留更多潜在高质量的伪标签。在学生网络训练阶段,我们提出了一种混合密度学生网络(mixed-density student network),使其聚焦于难例的特征学习,从而提升检测效果。

3.3. Self-boosting Teacher

​ 近年来,教师-学生框架在未标注场景的探索方面展现出了巨大的潜力。然而,与强标注场景(所有实例均已标注)不同,稀疏标注场景中每个场景仅标注一个实例。标注场景中的未标注实例可能会导致特征难以区分,从而阻碍有效的信息传递【30】。为了解决这一问题,我们提出了一种自增强教师网络。与传统的教师-学生框架相比,SBT 能够对标注场景的伪标签进行更新,充分利用实例信息,以消除难以区分的特征。

​ 如 图 2 所示,我们提出的 SBT 网络以稀疏标注点云 \(P^s_i\) 和未标注点云 \(P^u_i\) 作为输入。与传统的三维目标检测流程【21, 32】类似,SBT 首先通过骨干网络从 \(P^s_i\) 和 \(P^u_i\) 中提取三维特征,然后将其映射为二维鸟瞰图(2D BEV)特征:\(\{B^s_i\}\) 和 \(\{B^u_i\}\)。BEV 特征经过检测器后,生成伪标签 \(\bar{Y}^s_i\) 和 \(\bar{Y}^u_i\),分别对应稀疏标注点云和未标注点云。对于 \(\bar{Y}^u_i\),它会直接作为监督信号,用于学生网络后续训练的迭代。对于 \(\bar{Y}^s_i\),我们利用原始的稀疏标注 \(Y^s_i\) 进行过滤,保留真实标注信息,同时去除不准确的冗余伪标签。因此,教师网络输出的最终伪标签集合为:

\[\bar{Y} = \{\bar{Y}^u_i \cup \phi(\bar{Y}^s_i, Y^s_i | \tau)\} \tag{1} \]

​ 其中,过滤函数 \(\phi(\cdot | \tau)\) 受非极大值抑制算法(NMS algorithm)【18】启发,我们计算伪标签集合 \(\bar{Y}^s_i\) 与稀疏真实标注 \(Y^s_i\) 之间的 IoU,并滤出(filter out) IoU 大于阈值 \(\tau = 0.01\) 的伪标签。通过这一简单有效的操作,我们能够高效处理稀疏标注的点云数据。

3.4. Mixed-Density Student

​ 在 SBT 网络 的帮助下,我们为所有场景生成了伪标签,从而支持学生网络的监督训练。此外,在训练过程中增强对难例的关注,已被证明有助于提高难例的检测能力【3】。然而,伪标签 \(\bar{Y}\) 不可避免地缺乏对某些难例的正监督。因此,直接利用全监督方法的真实标注来提升对难例的关注,并不能取得最优效果。我们观察到,难例主要分布在距离激光雷达采集车辆较远的点云空间。在点云空间中,距离的变化 主要体现在点云密度的显著差异。基于这一观察,我们对较近区域的点云进行下采样,以生成更多包含难例的点云空间。随后,我们利用混合密度特征 来增强检测头 处理难例特征的能力。

​ 在一个点云场景中,大多数学生网络 通常会通过骨干网络 提取多尺度 BEV 特征(multi-scale BEV features)\(\{B_i | _{i=1,2,3}\} = \{B_1, B_2, B_3\}\),在这一特征集 \(\{B_i\}\) 中,各层特征的空间尺寸 逐层递减。最终,检测头 通过最后一层 BEV 特征 \(B_3\) 生成目标检测结果。

​ 在本研究中,我们首先从常规视角点云(regular view point cloud) \(P\) 和下采样视角点云(down-sampled view point cloud) \(P^-\) 分别提取两组多尺度 BEV 特征,即:\(\{B_i | _{i=1,2,3}\} = \{B_1, B_2, B_3\}\)和\(\{B^-_i | _{i=1,2,3}\} = \{B^-_1, B^-_2, B^-_3\}\),然后,我们通过自适应融合(adaptive fusion) 两组多尺度特征,构建混合密度特征 \(B^×\)。

​ 在 \(B_i\) 和 \(B^-_i\) 中,各层特征的空间尺寸 相同,并且它们在特征空间中对齐。受到文献【14】的启发,对于特征对齐的特征图,自适应线性加权(adaptive linear weighting)是一种简单而有效的多尺度特征融合策略。基于此,我们生成混合密度特征 \(B^×\) :

\[B^× = \mathcal{S}(\{B_i\}_i, \{B^-_i\}_i, \lambda) \tag{2} \]

​ 其中,\(\mathcal{S}\) 表示多尺度特征融合函数,\(\lambda\) 为自适应权重。具体而言,\(B^×\) 计算方式如下:

\[B^× = \sum_{i=1}^{3} \left[ \lambda_i Avg (B_i) + \bar{\lambda}_i Avg (B^-_i) \right] \tag{3} \]

​ 其中,\(Avg(·)\) 表示平均池化操作。该操作的主要目的是确保所有特征图的尺寸与底层特征图(如 \(B_3\))保持一致,从而便于后续的线性加权求和。此外,受到SE(Squeeze-and-Excitation)模块【9】的启发,我们计算出合适的自适应权重 \(\lambda_i\) 和 \(\bar{\lambda}_i\),这些权重与特征层对应,其计算方式如下:

\[\lambda = \delta \left( f \left( Avg (B) \right) \right) \tag{4} \]

​ 其中,\(\delta(·)\) 代表Sigmoid 激活函数,\(f(·)\) 是全连接层。关于特征融合的更多具体细节,可参见补充材料。

​ 需要注意的是,\(B_3\)、\(B^-_3\) 和 \(B^×\) 的空间尺寸相同,它们分别表示不同密度下的特征表达。为了确保不同密度特征的预测结果保持一致,我们将这三种特征分别输入到检测头模块,从而生成三个对应的预测结果集。因此,混合密度学生网络的训练目标函数为:

\[\mathcal{L}_{MDS} = \gamma_1 \mathcal{L}_{det} \left( \mathcal{H}(B^×), \bar{Y} \right) + \gamma_2 \mathcal{L}_{det} \left( \mathcal{H}(B^-_3), \bar{Y} \right) + \gamma_3 \mathcal{L}_{det} \left( \mathcal{H}(B_3), \bar{Y} \right) \tag{5} \]

​ 其中,\(\mathcal{L}_{det}\) 采用与baseline相同的计算方式,以保持一致性。\(H(·)\) 表示检测头模块。\(\gamma_1\)、\(\gamma_2\) 和 \(\gamma_3\) 是超参数,我们在消融实验部分的 表 7 中对其进行了详细研究。不同于传统的学生网络,我们采用统一的方法来同时管理未标注场景和稀疏标注场景。因此,在计算损失时,我们不再将稀疏标注和未标注场景分开计算,而是统一计算损失,从而避免了单独调整权重的必要性。

​ 尽管引入多层次混合密度特征会带来一定的额外计算开销,但值得注意的是,该方法基于原始网络结构进行构建,其内存消耗和额外参数可以认为是可以忽略的。具体而言,我们仅使用了一些简单操作来实现特征融合模块,包括全局平均池化、线性层和Sigmoid 激活函数。

​ 当模型经过充分训练后,仅保留属于原始检测器的模块。具体来说,学生网络中与混合密度特征提取和融合相关的步骤可以被丢弃。这种做法确保了在推理阶段的公平性,即保持原始检测器的架构和输入密度的一致性。此外,最终的检测模型与原始检测器具有相同的参数数量,且推理延迟不会增加。

4. Experiments

4.1. Dataset and Evaluation Metrics

​ KITTI 数据集【7】是当前稀疏监督三维目标检测中最广泛使用的数据集。我们遵循近期研究【30】提出的方法,将 KITTI 训练集(共 7481 个场景)划分为训练集(包含 3712 个场景)和 验证集(包含 3769 个场景)。随后,我们随机选择训练集中 10% 的场景,并在每个选定的场景中仅保留一个目标的标注。这一处理方式形成了受限训练集(limited split)。相较于原始的训练集,该受限训练集的标注成本仅为全标注的 2%【30】。为了确保公平比较,我们采用官方主要评测指标(principal official evaluation metric),即在 40 个召回阈值(recall thresholds, R40) 上计算 三维平均精度(3D Average Precision, AP)。

4.2. Implementation Details

​ 我们的 HINTED 框架 使用了 CoIn【30】的预训练模型。我们在4 张 RTX 3090 GPU 上训练整个网络,batch size 设置为 8,学习率 设为 0.003,训练 80 个 epoch。

​ 在局部采样方面,我们沿X 轴将场景划分为两个区域:

  • [0 < x < 30]:定义为近处高密度点云(nearby dense point cloud)
  • [30 < x < 70]:定义为远处稀疏点云(distant sparse point cloud)

​ 对于近处高密度点云,我们采用随机采样,采样率 设为 20%。与先前的3D目标检测方法【13, 16】类似,我们在训练过程中应用了数据增强。具体而言:

  • 在教师网络中,我们进行弱增强,具体操作包括:
    • 以 **50% **的概率沿 X 轴和 Y 轴随机翻转。
    • 在 [0.91, 1.12] 范围内均匀采样缩放因子(uniformly sample scale factors)进行缩放。
    • 以随机角度在 [-π/4, π/4] 范围内绕 Z 轴旋转整个场景。
  • 在学生网络中,我们进行强增强,采用点云洗牌增强(shuffle augmentation on the point cloud)。

​ 在消融实验部分,我们将进一步讨论超参数和策略选择的影响。

4.3. Comparison with State-of-the-art Methods

与稀疏监督方法的比较(Comparison with Sparsely-Supervised Methods)

表1
表1. 在 KITTI 验证集上与当前最先进的稀疏监督方法的比较。所有方法均基于VoxelRCNN,我们报告了完整标注(full cost, 100%)和受限标注(limited cost, 3%, 2%)情况下的 3D 平均精度(3D AP) 结果。最佳的稀疏监督方法以加粗表示,符号 (*) 表示使用 R11 评估标准的结果。

​ 我们将所提出的 HINTED 与当前最先进的 稀疏监督方法 进行了比较。为了公平比较,所有检测器均采用 VoxelRCNN【4】 作为基础架构。表 1 展示了不同方法的性能对比。根据3D目标检测的常见评估标准【16】,我们分别采用以下IoU 阈值对三类目标进行评估:

  • 汽车(car):0.7
  • 行人(pedestrian):0.5
  • 骑行者(cyclist):0.5

​ 如 表 1 所示,我们提出的 HINTED 在所有稀疏监督方法中表现最佳。对于更具挑战性的类别——行人和骑行者,我们的方法取得了特别显著的提升。

  • 与 CoIn 方法相比(CoIn 在行人类别上此前取得了最佳性能),HINTED 在行人类别上的检测性能提升了平均 32%。
  • 与 CoIn++ 方法相比(CoIn++ 在骑行者类别上此前表现最佳),HINTED 在骑行者类别上的检测性能提升了平均 25%。

​ 此外,我们观察到,与全监督的 VoxelRCNN【4】 相比,我们提出的 HINTED 在汽车和行人类别上取得了可比的性能,并且在骑行者类别上甚至超越了全监督方法。这一结果表明,我们的方法不仅能够生成高质量的伪标签,同时也能在网络训练过程中成功强化难例学习,从而提高检测性能。


与半监督方法的比较(Comparison with Semi-Supervised Methods)

表2
表2. 在 KITTI 验证集上与当前最先进的半监督方法的比较。所有方法均基于 PV-RCNN,并在随机选取的 2% 或 1% 全标注帧上进行训练。

​ 我们提出的 HINTED 采用了类似于半监督方法的教师-学生网络,因此我们进一步在半监督设定下评估了该方法的性能。与以往的半监督方法【13, 24】类似,我们随机选择训练集中的 1% 和 2% 全标注帧 进行训练,并在验证集上进行测试。所有结果均基于 PV-RCNN【20】 框架计算得出。

​ 表 2 展示了我们的方法与不同半监督方法的比较。

  • 与现有方法相比,我们的HINTED 在具有挑战性的骑行者类别上表现出显著提升。
  • 然而,在汽车类别上,我们的方法并未表现出优势。这可能是因为在训练过程中强调学习难例,导致对一些相对简单的结构特征的学习不足。
  • 总体而言,我们的方法在所有方法中取得了最佳的平均性能,在 1% 和 2% 的标注比例下均带来了适度的平均精度提升。

​ 这一结果验证了我们的策略同样能够在半监督设定下提升难例的检测能力。


与弱监督方法的比较(Comparison with Weakly-Supervised Methods)

表3
表 3. 在 KITTI 验证集上与当前最先进的弱监督方法的比较。*表示点云标注。#表示高质量标注实例。

​ 我们还将 HINTED 与当前最先进的弱监督方法进行了比较。在 WS3D【17】 和 WSS3D【35】 方法中,它们不仅使用了少量的标注边界框 作为监督信号,还结合了大量中心点击标注(center-click annotations)。然而,我们的 HINTED 方法 并未引入专门设计的中心点击标注,而是直接利用了半监督方法 生成的结果(仅使用 2% 的全监督标注)。如 表 3 所示,即使不依赖额外的点云标注,我们的 HINTED 依然展现出了显著的性能优势。

4.4. Ablation Study

​ 在本节中,我们进行了消融实验,以验证 HINTED 各个模块的有效性。所有实验均基于 VoxelRCNN【4】 进行。

各组件的影响(Effect of Each Component)

表4
表 4. HINTED 各组件在 KITTI 验证集上的影响。

​ 我们系统地验证了 HINTED 各个组件的有效性,实验结果如 表 4 所示。

在第二行中,通过用我们提出的SBT取代传统的师生网络,标记帧更有效地传递信息,实现了更好的基线。后续两个模块的验证直接基于SBT进行。如第3行和第4行所示,MDS都可以进一步提高性能。表4的最后一行是实现最佳性能的SBT和MDS的组合。这表明,所提出的方法能够生成高质量的伪标签,并有效地在师生网络中传递信息。

  • 在表 4 的第 1 行,初始网络直接采用教师-学生框架进行训练。然而,由于标注场景中仅有一个实例被标注,其余未标注的实例会干扰学生网络的学习过程,最终导致检测性能低于自训练方法(如表 1 中的 CoIn++)。
  • 在表 4 的第 2 行,我们用自增强教师网络替换了传统的教师-学生网络,使得标注帧的信息传递更为高效,从而形成了更优的baseline。
  • 后续两个模块的验证直接基于SBT进行。如第3行和第4行所示,MDS都可以进一步提高性能。。
  • 表 4 的最后一行,即结合 SBT 和 MDS,达到了最佳性能。

​ 这一实验结果表明,我们提出的 HINTED不仅能够生成高质量的伪标签,同时也能在教师-学生网络中实现高效的信息传递,从而显著提升检测性能。


不同距离阈值下的比较(Comparison at Different Distance Thresholds)

图3
图 3. 三个类别在不同距离阈值下的比较。红色柱状图表示 HINTED 的性能,蓝色柱状图表示 CoIn【30】 的性能。N/A 表示在该难度级别下没有样本。

​ 与 HINTED 类似,CoIn 也在训练过程中利用了未标注场景信息。然而,作为一种新的教师-学生网络,HINTED 进一步提升了 CoIn【30】的性能。图 3 具体展示了在不同难度级别下,两种方法在所有类别上的性能对比。从图中可以看出,我们的方法在所有类别上均有性能提升。这表明,我们的教师网络能够提供准确的伪标签,从而增强检测能力。在远距离目标检测和难例目标检测方面,HINTED 也展现出了显著的优势。特别是在骑行者类别上,我们的方法能够在 45 米以外仍然生成正确的预测结果,进一步验证了 HINTED 在挑战性场景下的优越性。


与其他点云采样策略的比较(Comparison with Other Point Cloud Sampling Strategies)

表5
表 5. 不同采样策略在 KITTI 验证集上的比较。

​ 我们比较了不同采样策略对检测性能的影响。选取了最常用的两种方法:

  • 最远点采样(Farthest Point Sampling, FPS)
  • 随机采样(Random Sampling, RS)

​ 并分别设定了三种不同的采样率:10%、20% 和 40%。实验结果如 表 5 所示。

​ 与 FPS 方法相比,RS 采样的整体性能更优。这表明,FPS 作为一种相对稳定的采样方法,并不利于模拟远处的点云,因而无法为难例提供最佳的学习能力。在对近处点云采用 RS 采样的实验中,我们观察到当采样率设为 20% 时,检测器的性能达到最佳。


不同特征融合方法的比较(Comparison of Feature Fusion Approaches)

表6
表 6. 不同特征融合方法的影响。

​ 在本节中,我们研究了不同特征融合策略对检测性能的影响。表 6 中的baseline指的是未使用混合特征时的检测结果。在此基础上,我们设计了三种不同的特征融合方法:

  1. ROI-based Fusion(基于 ROI 的融合)(表 6 第 2 行):
    • 该方法根据网络预测结果生成感兴趣区域ROI,并在这些 ROI 内融合密集点云与稀疏点云的特征。
    • 但由于两种特征的 ROI 可能存在不对齐问题,该融合方式无法有效生成高质量伪标签,甚至可能影响网络的学习过程。
  2. Average-based Fusion(基于平均的融合)(表 6 第 3 行):
    • 该方法直接对两种点云特征进行均值操作,简单地融合特征。
    • 然而,这种粗略的融合方式并未带来显著的性能提升。
  3. Attention-based Fusion(基于注意力的融合)(HINTED 采用的方法):
    • 该方法采用基于自适应权重的特征融合,能够根据输入数据动态调整融合方式。
    • 实验结果表明,该方法取得了最佳检测性能,验证了自适应加权特征融合能够提升检测器的性能。

超参数的选择(Choice of Hyper-Parameters)

表7
表7:γ1, γ2, γ3的影响。

​ 在本节中,我们参考文献【8】,并采用控制变量法来确定最优的超参数。

  • 初始化设置:我们将 \(\gamma_2\) 和 \(\gamma_3\) 设为 1,然后逐步调整 \(\gamma_1\) 的值。
  • 优化过程:在此基础上,我们进一步寻找最优的 \(\gamma_2\) 和 \(\gamma_3\)。

​ 表 7 展示了实验结果,表中数据表示在 “mod” 难度级别下,三类目标的平均检测性能。实验结果表明,当 \(\gamma_1, \gamma_2, \gamma_3\) 分别设为 0.1、1、1 时,模型性能达到最佳。

4.5. Quality Analysis

图4
图 4. 定性分析对比。红色边界框表示 HINTED 的检测结果,绿色边界框表示预训练 CoIn 模型的检测结果。黄色虚线内的点云代表难例。

​ 在本节中,我们将预训练模型 CoIn 的预测结果与HINTED 生成的最终学生模型的预测结果进行了比较。如 图 4 所示,可以明显观察到:

  • 预训练模型无法为远处的难例提供正监督信号(如黄色虚线区域所示)。
  • 我们的 MDT 方法 成功增强了这些难例的检测能力,最终获得了更加准确的检测结果。

5. Conclusion

​ 本文提出了一种新颖的难例挖掘方法——HINTED,用于稀疏监督的户外3D目标检测。此外,得益于自增强教师网络和混合密度学生的引入,我们的方法显著提升了3D检测器的性能。在 KITTI 数据集上进行的大量实验验证了我们的方法在稀疏监督设定下的有效性。此外,我们还证明了,在半监督设定下,该方法同样能够提升难例的检测性能。在未来的研究中,我们将尝试在更大规模的数据集上进一步验证该方法的有效性。

​ 局限性. 由于内存限制,我们无法在学生网络中使用共享权重并行生成特征图,这导致训练时间较长。然而,在推理阶段,局部下采样视角和混合密度视角都会被丢弃,因此不会增加模型参数或降低推理速度。



一、动机

动机

二、本文工作

动机

三、方法

一)自增强教师网络(Self-Boosting Teacher, SBT)

SBT

二)混合密度学生网络(Mixed-Density Student, MDS)

MDS

三)教师网络的持续更新——指数移动平均(exponential moving average, EMA)

EMA
posted @ 2025-03-06 15:32  scarverm  阅读(308)  评论(0)    收藏  举报