目标检测论文精读

一、趋势

  • ① 简单介绍:目标检测正在从“设计专用网络去拟合固定类别表”转向“以冻结的视觉 / 语言基础模型为底座,通过对齐、提示、检索与推理把它改造成检测器”。今年的主导叙事是开放词表 / 通用检测、零 / 少样本异常检测、以及多模态(事件 / 红外 / 雷达 / 点云)、3D 与视频时序感知的全面兴起;研究重心由“架构设计”转移到“如何调用与对齐基础模型”。
  • ② 部署侧技术快速成熟并成为独立热点:域适应(黑盒 / 无源 / 测试时 / 因果去混杂)、增量学习(提示池 + 双教师蒸馏抗遗忘)与实时轻量(YOLO + Mamba / MoE / 重参数化)三条线并行,专门回答“模型训好之后如何走出实验室、持续扩展且跑得快”。
  • ③新架构与可信基础设施同步补齐:Mamba / 状态空间模型以线性复杂度取代纯注意力承担长程时序与跨域对齐,MoE 实现“按需算力”的条件计算;与此同时,大规模基准(Omni-AD、MMR-AD、SteelDefectX 等)、Shapley / 显著性可解释、主动学习与数据筛选(如 DetGain)快速补齐,使领域从“能检”走向“可比较、可信任、可训练”。

二、方法

列出本方向各类研究方法,并附简要介绍。一个方法可应用于多篇、一篇也可同时采用多种方法。

研究方法
基准 / 数据集 / 评测:新建大规模基准与评测协议,揭示方法瓶颈、推动领域可比与前进。

DETR / Transformer / ViT / 注意力:以 Transformer 为统一检测框架,用可学习 query 做端到端检测,是多数新方法的结构底座。

提示学习 / LoRA / 适配器:在冻结大模型上叠加可学习提示或低秩适配,以极少参数把通用模型改造成专用检测器。

视觉基础模型 (VFM/CLIP/DINO/SAM):把冻结的强预训练视觉 / 图文模型当作特征与先验来源,通过对齐或轻量适配复用其通用表征。

三、主题

将全部 114 篇论文划分为以下 14 个类别。每一类先说明其应用场景与主题意义。

1 通用与开放词表目标检测

【应用场景】用大模型 / 语言驱动的方式做“任意物体都能检测”的通用检测器,以及不依赖固定类别表的开放词表检测。

A. 主题简述

· 意义:把检测从“闭集固定类别”推向“用语言即可指定要找什么”,是迈向通用视觉感知的核心方向,直接支撑机器人、AR、检索等开放场景。

【论文标题】 Detect Anything via Next Point Prediction (Rex-Omni)

【研究背景与动机】 该工作处于“通用与开放词表目标检测”这一研究脉络。其意义在于:把检测从“闭集固定类别”推向“用语言即可指定要找什么”,是迈向通用视觉感知的核心方向,直接支撑机器人、AR、检索等开放场景。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

2 异常检测 · 零样本与少样本

【应用场景】在几乎无标注(零样本)或仅有 1–4 张正常样本(少样本)条件下,判断图像/区域是否存在缺陷或异常。

A. 主题简述

· 意义:工业质检、医学筛查等场景标注极贵,零/少样本异常检测决定技术能否真正落地;CLIP/VFM 等基础模型让“免训练即可检”成为现实。

【论文标题】 AnomalyVFM: Transforming VFMs into Zero-Shot Anomaly Detectors

【研究背景与动机】 该工作处于“异常检测 · 零样本与少样本”这一研究脉络。其意义在于:工业质检、医学筛查等场景标注极贵,零/少样本异常检测决定技术能否真正落地;CLIP/VFM 等基础模型让“免训练即可检”成为现实。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

3 异常检测 · 无监督与多模态

【应用场景】用无标签正常样本训练、或结合 RGB+深度/3D 等多模态信息做异常检测与定位。

A. 主题简述

· 意义:真实产线往往只有正常样本,多模态(结构+纹理)能弥补单 RGB 的歧义;这类方法追求“一个模型通吃多类/多模态”的工业实用化。

【论文标题】 Dual-Prototype-Guided Multi-task Learning for Unsupervised AD

【研究背景与动机】 该工作处于“异常检测 · 无监督与多模态”这一研究脉络。其意义在于:真实产线往往只有正常样本,多模态(结构+纹理)能弥补单 RGB 的歧义;这类方法追求“一个模型通吃多类/多模态”的工业实用化。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

4 异常检测 · 3D 与工业基准

【应用场景】面向 3D 点云/形状的异常检测,以及为工业异常检测新建的大规模基准与数据集。

A. 主题简述

· 意义:3D 缺陷(形变、错位)在 2D 下不可见;高质量基准(Omni-AD、MMR-AD、SteelDefectX)揭示现有方法远未饱和,是推动领域前进的基础设施。

【论文标题】 A Semantically Disentangled Unified Model for Multi-category 3D AD

【研究背景与动机】 该工作处于“异常检测 · 3D 与工业基准”这一研究脉络。其意义在于:3D 缺陷(形变、错位)在 2D 下不可见;高质量基准(Omni-AD、MMR-AD、SteelDefectX)揭示现有方法远未饱和,是推动领域前进的基础设施。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

5 域适应 / 跨域 / 域泛化目标检测

【应用场景】当训练域(源)与测试域(目标)存在分布差异(天气、视角、传感器、风格)时,如何把检测器有效迁移或泛化。

A. 主题简述

· 意义:真实部署常遇“训练-测试不一致”,域适应/泛化决定模型能否走出实验室;黑盒、无源、测试时等严苛设定更贴近隐私与算力现实。

【论文标题】 A Closer Look at Cross-Domain Few-Shot OD: Fine-Tuning Matters

【研究背景与动机】 该工作处于“域适应 / 跨域 / 域泛化目标检测”这一研究脉络。其意义在于:真实部署常遇“训练-测试不一致”,域适应/泛化决定模型能否走出实验室;黑盒、无源、测试时等严苛设定更贴近隐私与算力现实。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

6 增量目标检测

【应用场景】检测器在上线后持续学习新类别/新域,且不能遗忘旧知识(无样本回放设定尤为受关注)。

A. 主题简述

· 意义:真实系统要不断扩展识别能力,增量学习避免“每加一类就全量重训”,是可持续发展的关键;但需对抗灾难性遗忘与提示退化。

【论文标题】 Beyond Prompt Degradation: Prototype-Guided Dual-Pool Prompting for IOD

【研究背景与动机】 该工作处于“增量目标检测”这一研究脉络。其意义在于:真实系统要不断扩展识别能力,增量学习避免“每加一类就全量重训”,是可持续发展的关键;但需对抗灾难性遗忘与提示退化。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

7 YOLO 与实时 / 轻量检测

【应用场景】以 YOLO 系列为代表的实时、低延迟、低算力目标检测架构改进与训练加速。

A. 主题简述

· 意义:边缘设备、自动驾驶、监控等场景对速度与功耗极敏感;在保持精度的同时压缩算力/参数是工业落地的硬需求。

【论文标题】 AKCMamba-YOLO: Selective State Space Models for Real-Time OD

【研究背景与动机】 该工作处于“YOLO 与实时 / 轻量检测”这一研究脉络。其意义在于:边缘设备、自动驾驶、监控等场景对速度与功耗极敏感;在保持精度的同时压缩算力/参数是工业落地的硬需求。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

8 多模态 / 特定传感器检测

【应用场景】融合或专门处理事件相机、热红外、RGB-红外、雷达、X 光等非典型 RGB 传感器的目标检测。

A. 主题简述

· 意义:在夜间、雾天、低光、遮挡等 RGB 失效场景下,事件/红外/雷达提供互补信息;跨模态对齐与融合是该方向的核心难题。

【论文标题】 Beyond Duality: Hybrid Framework for RGB-Event OD (SPFD)

【研究背景与动机】 该工作处于“多模态 / 特定传感器检测”这一研究脉络。其意义在于:在夜间、雾天、低光、遮挡等 RGB 失效场景下,事件/红外/雷达提供互补信息;跨模态对齐与融合是该方向的核心难题。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

9 遥感 / 航拍 / 无人机检测

【应用场景】面向卫星/航拍遥感与无人机视角的目标检测,含细粒度、小目标、旋转框、复杂背景与三模态融合。

A. 主题简述

· 意义:国土监测、农业、安防依赖从高空识别目标;小目标、旋转方向、复杂背景与传感器噪声是该场景特有挑战。

【论文标题】 Balanced Hierarchical Contrastive Learning for Fine-grained RS OD

【研究背景与动机】 该工作处于“遥感 / 航拍 / 无人机检测”这一研究脉络。其意义在于:国土监测、农业、安防依赖从高空识别目标;小目标、旋转方向、复杂背景与传感器噪声是该场景特有挑战。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

10 小目标检测(红外 / 事件)

【应用场景】专门应对红外、事件相机等模态下“目标极小、信噪比低、易与背景混淆”的检测与分割。

A. 主题简述

· 意义:红外小目标(如无人机、船只)与事件小目标在国防、监控中至关重要;其微弱信号易被深层网络稀释,需针对性保特征、抑虚警。

【论文标题】 CHAL: Causal-guided Hierarchical Anomaly-aware Learning for Moving IR Small Target

【研究背景与动机】 该工作处于“小目标检测(红外 / 事件)”这一研究脉络。其意义在于:红外小目标(如无人机、船只)与事件小目标在国防、监控中至关重要;其微弱信号易被深层网络稀释,需针对性保特征、抑虚警。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

11 视频目标检测与多目标跟踪

【应用场景】视频序列中的目标检测(利用时序)、以及把检测结果关联成稳定轨迹的多目标跟踪(MOT)与跨视角/固定视角跟踪。

A. 主题简述

· 意义:视频理解、自动驾驶、安防依赖“既检得准又跟得稳”;时序建模与跨帧/跨摄像头关联是提升鲁棒性的关键。

【论文标题】 D2FANet: Dual-Domain Feature Aggregation for Video OD

【研究背景与动机】 该工作处于“视频目标检测与多目标跟踪”这一研究脉络。其意义在于:视频理解、自动驾驶、安防依赖“既检得准又跟得稳”;时序建模与跨帧/跨摄像头关联是提升鲁棒性的关键。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

12 人-物交互(HOI)与指代检测

【应用场景】检测“人正在对什么物体做什么动作”(HOI),以及按语言/图像指代定位特定目标(Referring / Grounding)。

A. 主题简述

· 意义:HOI 与指代是视觉推理从“有哪些物体”走向“谁在对谁做什么、我要找哪一个”的关键,支撑机器人操作、图像检索与人机交互。

【论文标题】 Mining Instance-Centric Vision-Language Contexts for HOI Detection

【研究背景与动机】 该工作处于“人-物交互(HOI)与指代检测”这一研究脉络。其意义在于:HOI 与指代是视觉推理从“有哪些物体”走向“谁在对谁做什么、我要找哪一个”的关键,支撑机器人操作、图像检索与人机交互。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

13 基准 / 数据集 / 可解释性 / 主动学习 / 数据工程

【应用场景】为检测社区提供新基准与数据集、解释检测器决策、主动选择高价值样本标注、在线数据筛选,以及计数、图像转换、视觉合规等周边任务。

A. 主题简述

· 意义:高质量基准揭示方法瓶颈,可解释性建立信任,主动学习/数据筛选降低标注成本——这些都是把研究推向实用、可信、高效的底层支撑。

【论文标题】 Explaining Object Detectors via Collective Contribution of Pixels (VX-CODE)

【研究背景与动机】 该工作处于“基准 / 数据集 / 可解释性 / 主动学习 / 数据工程”这一研究脉络。其意义在于:高质量基准揭示方法瓶颈,可解释性建立信任,主动学习/数据筛选降低标注成本——这些都是把研究推向实用、可信、高效的底层支撑。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

14 3D 目标检测(单目 / 通用)

【应用场景】从单张图像或视频恢复物体的 3D 位置、尺寸与朝向,以及用视觉语言模型做 3D 检测。

A. 主题简述

· 意义:自动驾驶、机器人抓取需要真实三维几何;单目方案成本低,而用 VLM 做 3D 检测是“语言即检测器”在自然三维世界的延伸。

【论文标题】 RARE: Learn to Rank and Retrieve for Monocular 3D OD

【研究背景与动机】 该工作处于“3D 目标检测(单目 / 通用)”这一研究脉络。其意义在于:自动驾驶、机器人抓取需要真实三维几何;单目方案成本低,而用 VLM 做 3D 检测是“语言即检测器”在自然三维世界的延伸。 在此背景下,作者针对现有方法的关键短板提出新的解决思路。

posted @ 2026-08-12 11:49  小周同学的CtrlCV研记  阅读(31)  评论(0)    收藏  举报