目标检测论文精读
一、趋势
- ① 简单介绍:目标检测正在从“设计专用网络去拟合固定类别表”转向“以冻结的视觉 / 语言基础模型为底座,通过对齐、提示、检索与推理把它改造成检测器”。今年的主导叙事是开放词表 / 通用检测、零 / 少样本异常检测、以及多模态(事件 / 红外 / 雷达 / 点云)、3D 与视频时序感知的全面兴起;研究重心由“架构设计”转移到“如何调用与对齐基础模型”。
- ② 部署侧技术快速成熟并成为独立热点:域适应(黑盒 / 无源 / 测试时 / 因果去混杂)、增量学习(提示池 + 双教师蒸馏抗遗忘)与实时轻量(YOLO + Mamba / MoE / 重参数化)三条线并行,专门回答“模型训好之后如何走出实验室、持续扩展且跑得快”。
- ③新架构与可信基础设施同步补齐:Mamba / 状态空间模型以线性复杂度取代纯注意力承担长程时序与跨域对齐,MoE 实现“按需算力”的条件计算;与此同时,大规模基准(Omni-AD、MMR-AD、SteelDefectX 等)、Shapley / 显著性可解释、主动学习与数据筛选(如 DetGain)快速补齐,使领域从“能检”走向“可比较、可信任、可训练”。
二、方法
列出本方向各类研究方法,并附简要介绍。一个方法可应用于多篇、一篇也可同时采用多种方法。
研究方法
基准 / 数据集 / 评测:新建大规模基准与评测协议,揭示方法瓶颈、推动领域可比与前进。
DETR / Transformer / ViT / 注意力:以 Transformer 为统一检测框架,用可学习 query 做端到端检测,是多数新方法的结构底座。
提示学习 / LoRA / 适配器:在冻结大模型上叠加可学习提示或低秩适配,以极少参数把通用模型改造成专用检测器。
视觉基础模型 (VFM/CLIP/DINO/SAM):把冻结的强预训练视觉 / 图文模型当作特征与先验来源,通过对齐或轻量适配复用其通用表征。
三、主题
将全部 114 篇论文划分为以下 14 个类别。每一类先说明其应用场景与主题意义。
1 通用与开放词表目标检测
【应用场景】用大模型 / 语言驱动的方式做“任意物体都能检测”的通用检测器,以及不依赖固定类别表的开放词表检测。
A. 主题简述
· 意义:把检测从“闭集固定类别”推向“用语言即可指定要找什么”,是迈向通用视觉感知的核心方向,直接支撑机器人、AR、检索等开放场景。
【论文标题】 Detect Anything via Next Point Prediction (Rex-Omni)
【研究背景与动机】 该工作处于“通用与开放词表目标检测”这一研究脉络。其意义在于:把检测从“闭集固定类别”推向“用语言即可指定要找什么”,是迈向通用视觉感知的核心方向,直接支撑机器人、AR、检索等开放场景。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
2 异常检测 · 零样本与少样本
【应用场景】在几乎无标注(零样本)或仅有 1–4 张正常样本(少样本)条件下,判断图像/区域是否存在缺陷或异常。
A. 主题简述
· 意义:工业质检、医学筛查等场景标注极贵,零/少样本异常检测决定技术能否真正落地;CLIP/VFM 等基础模型让“免训练即可检”成为现实。
【论文标题】 AnomalyVFM: Transforming VFMs into Zero-Shot Anomaly Detectors
【研究背景与动机】 该工作处于“异常检测 · 零样本与少样本”这一研究脉络。其意义在于:工业质检、医学筛查等场景标注极贵,零/少样本异常检测决定技术能否真正落地;CLIP/VFM 等基础模型让“免训练即可检”成为现实。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
3 异常检测 · 无监督与多模态
【应用场景】用无标签正常样本训练、或结合 RGB+深度/3D 等多模态信息做异常检测与定位。
A. 主题简述
· 意义:真实产线往往只有正常样本,多模态(结构+纹理)能弥补单 RGB 的歧义;这类方法追求“一个模型通吃多类/多模态”的工业实用化。
【论文标题】 Dual-Prototype-Guided Multi-task Learning for Unsupervised AD
【研究背景与动机】 该工作处于“异常检测 · 无监督与多模态”这一研究脉络。其意义在于:真实产线往往只有正常样本,多模态(结构+纹理)能弥补单 RGB 的歧义;这类方法追求“一个模型通吃多类/多模态”的工业实用化。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
4 异常检测 · 3D 与工业基准
【应用场景】面向 3D 点云/形状的异常检测,以及为工业异常检测新建的大规模基准与数据集。
A. 主题简述
· 意义:3D 缺陷(形变、错位)在 2D 下不可见;高质量基准(Omni-AD、MMR-AD、SteelDefectX)揭示现有方法远未饱和,是推动领域前进的基础设施。
【论文标题】 A Semantically Disentangled Unified Model for Multi-category 3D AD
【研究背景与动机】 该工作处于“异常检测 · 3D 与工业基准”这一研究脉络。其意义在于:3D 缺陷(形变、错位)在 2D 下不可见;高质量基准(Omni-AD、MMR-AD、SteelDefectX)揭示现有方法远未饱和,是推动领域前进的基础设施。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
5 域适应 / 跨域 / 域泛化目标检测
【应用场景】当训练域(源)与测试域(目标)存在分布差异(天气、视角、传感器、风格)时,如何把检测器有效迁移或泛化。
A. 主题简述
· 意义:真实部署常遇“训练-测试不一致”,域适应/泛化决定模型能否走出实验室;黑盒、无源、测试时等严苛设定更贴近隐私与算力现实。
【论文标题】 A Closer Look at Cross-Domain Few-Shot OD: Fine-Tuning Matters
【研究背景与动机】 该工作处于“域适应 / 跨域 / 域泛化目标检测”这一研究脉络。其意义在于:真实部署常遇“训练-测试不一致”,域适应/泛化决定模型能否走出实验室;黑盒、无源、测试时等严苛设定更贴近隐私与算力现实。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
6 增量目标检测
【应用场景】检测器在上线后持续学习新类别/新域,且不能遗忘旧知识(无样本回放设定尤为受关注)。
A. 主题简述
· 意义:真实系统要不断扩展识别能力,增量学习避免“每加一类就全量重训”,是可持续发展的关键;但需对抗灾难性遗忘与提示退化。
【论文标题】 Beyond Prompt Degradation: Prototype-Guided Dual-Pool Prompting for IOD
【研究背景与动机】 该工作处于“增量目标检测”这一研究脉络。其意义在于:真实系统要不断扩展识别能力,增量学习避免“每加一类就全量重训”,是可持续发展的关键;但需对抗灾难性遗忘与提示退化。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
7 YOLO 与实时 / 轻量检测
【应用场景】以 YOLO 系列为代表的实时、低延迟、低算力目标检测架构改进与训练加速。
A. 主题简述
· 意义:边缘设备、自动驾驶、监控等场景对速度与功耗极敏感;在保持精度的同时压缩算力/参数是工业落地的硬需求。
【论文标题】 AKCMamba-YOLO: Selective State Space Models for Real-Time OD
【研究背景与动机】 该工作处于“YOLO 与实时 / 轻量检测”这一研究脉络。其意义在于:边缘设备、自动驾驶、监控等场景对速度与功耗极敏感;在保持精度的同时压缩算力/参数是工业落地的硬需求。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
8 多模态 / 特定传感器检测
【应用场景】融合或专门处理事件相机、热红外、RGB-红外、雷达、X 光等非典型 RGB 传感器的目标检测。
A. 主题简述
· 意义:在夜间、雾天、低光、遮挡等 RGB 失效场景下,事件/红外/雷达提供互补信息;跨模态对齐与融合是该方向的核心难题。
【论文标题】 Beyond Duality: Hybrid Framework for RGB-Event OD (SPFD)
【研究背景与动机】 该工作处于“多模态 / 特定传感器检测”这一研究脉络。其意义在于:在夜间、雾天、低光、遮挡等 RGB 失效场景下,事件/红外/雷达提供互补信息;跨模态对齐与融合是该方向的核心难题。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
9 遥感 / 航拍 / 无人机检测
【应用场景】面向卫星/航拍遥感与无人机视角的目标检测,含细粒度、小目标、旋转框、复杂背景与三模态融合。
A. 主题简述
· 意义:国土监测、农业、安防依赖从高空识别目标;小目标、旋转方向、复杂背景与传感器噪声是该场景特有挑战。
【论文标题】 Balanced Hierarchical Contrastive Learning for Fine-grained RS OD
【研究背景与动机】 该工作处于“遥感 / 航拍 / 无人机检测”这一研究脉络。其意义在于:国土监测、农业、安防依赖从高空识别目标;小目标、旋转方向、复杂背景与传感器噪声是该场景特有挑战。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
10 小目标检测(红外 / 事件)
【应用场景】专门应对红外、事件相机等模态下“目标极小、信噪比低、易与背景混淆”的检测与分割。
A. 主题简述
· 意义:红外小目标(如无人机、船只)与事件小目标在国防、监控中至关重要;其微弱信号易被深层网络稀释,需针对性保特征、抑虚警。
【论文标题】 CHAL: Causal-guided Hierarchical Anomaly-aware Learning for Moving IR Small Target
【研究背景与动机】 该工作处于“小目标检测(红外 / 事件)”这一研究脉络。其意义在于:红外小目标(如无人机、船只)与事件小目标在国防、监控中至关重要;其微弱信号易被深层网络稀释,需针对性保特征、抑虚警。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
11 视频目标检测与多目标跟踪
【应用场景】视频序列中的目标检测(利用时序)、以及把检测结果关联成稳定轨迹的多目标跟踪(MOT)与跨视角/固定视角跟踪。
A. 主题简述
· 意义:视频理解、自动驾驶、安防依赖“既检得准又跟得稳”;时序建模与跨帧/跨摄像头关联是提升鲁棒性的关键。
【论文标题】 D2FANet: Dual-Domain Feature Aggregation for Video OD
【研究背景与动机】 该工作处于“视频目标检测与多目标跟踪”这一研究脉络。其意义在于:视频理解、自动驾驶、安防依赖“既检得准又跟得稳”;时序建模与跨帧/跨摄像头关联是提升鲁棒性的关键。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
12 人-物交互(HOI)与指代检测
【应用场景】检测“人正在对什么物体做什么动作”(HOI),以及按语言/图像指代定位特定目标(Referring / Grounding)。
A. 主题简述
· 意义:HOI 与指代是视觉推理从“有哪些物体”走向“谁在对谁做什么、我要找哪一个”的关键,支撑机器人操作、图像检索与人机交互。
【论文标题】 Mining Instance-Centric Vision-Language Contexts for HOI Detection
【研究背景与动机】 该工作处于“人-物交互(HOI)与指代检测”这一研究脉络。其意义在于:HOI 与指代是视觉推理从“有哪些物体”走向“谁在对谁做什么、我要找哪一个”的关键,支撑机器人操作、图像检索与人机交互。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
13 基准 / 数据集 / 可解释性 / 主动学习 / 数据工程
【应用场景】为检测社区提供新基准与数据集、解释检测器决策、主动选择高价值样本标注、在线数据筛选,以及计数、图像转换、视觉合规等周边任务。
A. 主题简述
· 意义:高质量基准揭示方法瓶颈,可解释性建立信任,主动学习/数据筛选降低标注成本——这些都是把研究推向实用、可信、高效的底层支撑。
【论文标题】 Explaining Object Detectors via Collective Contribution of Pixels (VX-CODE)
【研究背景与动机】 该工作处于“基准 / 数据集 / 可解释性 / 主动学习 / 数据工程”这一研究脉络。其意义在于:高质量基准揭示方法瓶颈,可解释性建立信任,主动学习/数据筛选降低标注成本——这些都是把研究推向实用、可信、高效的底层支撑。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。
14 3D 目标检测(单目 / 通用)
【应用场景】从单张图像或视频恢复物体的 3D 位置、尺寸与朝向,以及用视觉语言模型做 3D 检测。
A. 主题简述
· 意义:自动驾驶、机器人抓取需要真实三维几何;单目方案成本低,而用 VLM 做 3D 检测是“语言即检测器”在自然三维世界的延伸。
【论文标题】 RARE: Learn to Rank and Retrieve for Monocular 3D OD
【研究背景与动机】 该工作处于“3D 目标检测(单目 / 通用)”这一研究脉络。其意义在于:自动驾驶、机器人抓取需要真实三维几何;单目方案成本低,而用 VLM 做 3D 检测是“语言即检测器”在自然三维世界的延伸。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

浙公网安备 33010602011771号