REC相关的数据集和指标
在多模态领域中,一些任务(例如机器人抓取、自动驾驶行人分析、图像编辑)需要模型能够精确指出语言描述的图像所在的区域。
这是 Visual Grounding (视觉定位)的核心任务。Visual Grounding 按照是否要对语言描述中所有提及的物体进行定位,可以进一步划分为:
-
Phrase Localization:又称为Phrase Grounding,是对句子中的 noun phrases / entity mentions 进行定位;一个句子中可能有多个短语,每个短语可能对应一个或多个 box。 -
Referring Expression Comprehension (REC)即指代表达理解。每个语言表述(expression)只指示一个物体,每句话即使有上下文,也只对应一个指示物体的box标注。要求模型不仅能够识别物体,更要求模型理解物体之间的空间关系 (spatial relations)、属性对比 (attribute comparison) 以及复杂的句法结构。
本文更关注 REC 、 Local Image Retrieval 任务。
1. 任务类型
| 缩写 | 全称 | 中文名称 | 输入 | 输出 | 难点 | 与局部图像检索的相关性 |
|---|---|---|---|---|---|---|
| OVD | Open Vocabulary Object Detection | 开放词汇目标检测 | 图像,类别文本 | 边界框,类别标签,置信度 | 视觉-语义对齐(需对齐未见类别);背景抑制(防止将无关物错认为未见类别) | 中 |
| REC | Referring Expression Comprehension | 指代表达理解 | 图像,一句文本描述 | 一个边界框 (Bound Box) | 消除歧义,唯一精准定位 | 高 |
| REG | Referring Expression Generation | 指代表达生成 | 图像,一个目标框 | 一句区分性描述 | 生成独特的特征(不仅是”猫“,是”左边那只睡着的猫“) | 中 |
| RES | Referring Expression Segmentation | 指代表达分割 | 图像,文本描述 | 像素级掩码(Mask) | 需要极细粒度的边缘分割能力 | 中 |
| Local Image Retrieval | 局部图像检索 | n个图像,文本 / 图片 | 图片 | 根据文本或图片 query 从图库中找到包含query对应实例的图片 | 高 | |
| REIR | Referring Expression Instance Retrieval | 指代表达实体检索 | n个图像,文本 | 相关图片的边界框 | REIR = retrieval + localization。先从图库中找到对应的图片,再定位到物体。REC只需要根据文本在一张图片中进行定位 | 高 |
| Phrase Localization / Grounding | e.g., Flickr 30k Entities | 短语定位 | 图像,一句长描述 | 多个边界框 | 句子里的每个名词短语都要找到对应的物体 | 中 |
- 这类任务可以理解为文本和图像模态之间的匹配或对齐,即 cross-modal matching / alignment。
2. 几种技术流派
2.1 两阶段法
两阶段方法通常先使用检测器生成候选框,再计算每个候选框和文本之间的匹配分数。
流程如下:
- 输入图像;
- 使用检测器或 proposal generator 生成候选区域;
- 对每个候选区域提取视觉特征;
- 对文本 query 提取文本特征;
- 计算 region-text 相似度;
- 选取得分最高的区域作为结果。
优点是结构清晰,容易复用已有检测器。缺点是第一阶段的 proposal recall 会成为上限:如果检测器没有把感兴趣区域框出来,第二阶段再强也无法找回目标。
对于摄像头场景,这个问题尤其明显,因为烟头、火点、异物、远处安全帽等目标通常很小,容易在 proposal 阶段被漏掉。
2.2 单阶段 end-to-end 方法
单阶段方法类似 YOLO、DETR 或 Grounding DINO 的思想,直接输入图像和文本,输出最终坐标。
这类方法的优势是端到端建模,视觉和语言可以深度交互,通常精度较强。
缺点是很多 fusion-based 方法的视觉特征是 query-specific 的,也就是说每换一个文本 query,都可能需要重新进行一次图文融合计算。在大规模历史图库检索中,这种方式在线成本较高。
2.3 LLM / MLLM 生成坐标 方法
大语言模型或多模态大模型可以将坐标视为特殊文本 token 输出,例如:
<box>255, 300, 500, 600</box>
这类方法的优点是可以利用 LLM 强大的语言理解、常识推理和复杂指令跟随能力。缺点是:
- 坐标被离散化为 token,天然不如检测器的连续坐标回归精确;
- 使用自回归 next-token prediction,输出多个目标时速度较慢;
- 对所有物体进行完整检测时,容易漏检或输出不稳定;
- 不适合对海量历史图库反复在线推理。
因此,MLLM 直接生成坐标更适合作为少量样本分析、复杂 query 重排或数据标注辅助,而不适合作为大规模图库检索的唯一主干。
2.4 检索式局部表示:Object-level Embedding / Region-level Retrieval
这是最适合摄像头历史数据检索的一类方法。
核心思想是:不让模型每次 query 都重新检测整库图片,而是在离线阶段把图中的候选物体区域编码成 object embeddings。在线查询时,只需要把文本 query 编码成 text embedding,然后和已缓存的 object embeddings 做向量相似度检索。(根据SORCE论文,MLLM根据 Region Prompts 就能够对图片的不同区域生成嵌入)
离线阶段:
摄像头帧 → proposal generator → 多个候选框 → object embeddings → 向量库
在线阶段:
文本 query → text embedding → 向量检索 → 返回图片 / 时间戳 / box
这种路线的优势是:
- 适合历史数据回溯检索;
- 查询速度快;
- 可以处理小目标和局部目标;
- 可以返回目标区域;
- 比全图 embedding 更适合“地上的烟头”“货架第二层的红色瓶子”“工人手里的香烟”等局部描述。
3. 数据集 & Benchmark
3.1 开放词汇目标检测 OVD 数据集
这类数据集主要用于 proposal 或 detection,判断图像中哪里有物体。文本描述通常是类别标签或类别短语,而不是复杂自然语言指代表达。
| 名称 | 时间 | 特征 | 类别数量 | 图像数量 | box数量 |
|---|---|---|---|---|---|
| COCO | 2014 | 通用物体检测基础数据集,类别较少但标注质量高 | 80 | 123k | 896k |
| Objects365 | ICCV 2019 | 大规模通用物体检测数据集,类别和场景比 COCO 更丰富 | 365 | 638k | 10,101k |
| Open Images | arxiv 2018 | 大规模图像理解数据集,包含 image-level label、box、关系等多种标注 | 600 | 1,515k | 14,815k |
| LVIS | CVPR 2019 | 开放词汇实例分割;大词表;在稀有品类上具有长尾分布 | 1203 | 120k | 1,525k |
| V3Det | ICCV 2023 | 类别特别多,且按照 由粗到细 的层级结构组织;图像分辨率高;主要来自Bamboo分类数据集 | 13204 | 243k | 1,727k |
| NEU-171K | ICRA 2025 | 面向fine-grained OVD;包含两个领域:汽车和零售商品(零售商品图片是实验室的模拟环境);每个对象包含多个部件的细粒度标签 | 105(719细) | 143k | 659k |
3.2 指代表达理解 REC 数据集
REC 数据集的任务是在一张图片内部根据文本描述定位目标区域。它们的核心价值是让模型学习:
这句话描述的是图里的哪个区域?
| 名称 | 时间 | 特征 | 数据分布 | 适用场景 | 例子 | 图像数量 | 对象实例数量 | 指代表达式数量 | 平均词数 |
|---|---|---|---|---|---|---|---|---|---|
| RefCOCO (train, val, testA, testB) | 2015 | 允许使用任何词汇 | 包含绝对空间词汇,如Left, Top, Middle | 测试模型对空间的敏感度 | The guy on the left | 19,994 | 50,000 | 142,209 | 3.6 |
| RefCOCO+ (train, val, testA, testB) | 2016 | 禁止使用空间方位词。玩家被迫描述外观属性 | 包含颜色、纹理、形状、动作等视觉属性 | 测试模型对细粒度视觉特征的区分能力 | The dark chair nearest to the table | 19,992 | 49,856 | 141,564 | 3.6 |
| RefCOCOg (train, val) | 2016 | 非交互式采集,直接让工人写描述 | 句子更长,包含复杂的人物/物体关系 | 测试模型的语言理解深度和关系推理 | A zebra looking towards the camera while grazing on grass | 25,799 | 95,010 | 49,822 | 8.4 |
| Ref-Adv-s (benchmark) | ICLR 2026 | 文字描述更长、一图存在多个同类别物体、存在难干扰项(满足部分条件的物体)、包含否定等复杂推理 | 来自COCO和OpenImages v7验证/测试集,筛选全景标注图像,每张图像包含多个同类别干扰对象 | 测试模型的视觉推理与定位能力,尤其是处理否定和复杂关系建模 | the person in the car who is not sitting in the driver’s seat | 1,142 | - | - | 11.5 |
| HumanRef (train, benchmark) | ICCV 2025 | (0)人型检测(1)多实例引用(一个表达式可能对应多个实例);(2)包含属性、位置、交互、推理和名人识别;(3)如果目标任务未出现,应该拒绝生成回答 | 包含自然环境、工业、医疗、体育、电影、动画等多样场景,每个图像至少包含4人,平均每个表达式2.2个实例 | 测试模型在多实例引用和复杂现实场景中的多目标区分与综合推理能力 | A woman wearing a sleeveless white dress standing and smiling with sandals interacting with others | 34,806 | avg 2.2 | 103,028 | |
| Who's Waldo (train, val, test) | ICCV 2021 | 以人为中心的视觉定位任务。将标题中的名字遮掉,鼓励模型关注人物之间的交互关系,而非名字和长相之间的关系 | 来自Wikimedia Commons,训练集179K,验证、测试集各6.7K | 测试跨模态人物关联和交互理解能力 | Cheick Diallo blocks Allonzo Trier (#20) in front of Luke Kennard (#5) and Carlon Bragg (#31) in the 2015 McDonald’s All-American Boys Game | 271,747 | - | 271,747 | |
| HC-RefLoCo (benchmark) | NIPS 2024 | 以人为中心的REC benchmark。描述中的每个句子分为:外观、人-物交互、位置、动作、名人、OCR | 来自COCO 2017, Objects365, OpenImage v7, LAION-5B。注释特别长,平均长度为93.2。 | 测试模型对长文本表达式的理解能力,以及多模态细粒度分析(如名人识别、OCR结合) | 13,452 | 24,129 | 44,738 | 93.2 | |
| Ref-L4 (benchmark) | CVPR 2025 | 物品种类多样(365类)、指代表达更长、词汇表大 | 来自RefCOCO三个系列、Objects365,覆盖多样场景 | 测试模型在多类别,长文本下的表现 | 9,735 | 18,653 | 45,341 | 24.2 | |
| FineCops-Ref (train, val, test) | arxiv 2024 | 设有不同的难度等级、包含负样本(即文本表达式不存在于图片中的情况) | 来自GQA和RefCOCO | 测试模型的细粒度推理能力,测试模型的幻觉程度 | 291k |
3.3 局部图像检索 / REIR 数据集
这类数据集最接近“摄像头场景下局部图像检索”。它们不只是在单张图内定位目标,而是要求模型在图库中检索相关图片,甚至进一步定位图中的目标实例。
| 名称 | 时间 | 特征 | 数据分布 | 适用场景 | 例子 | 图像数量 | 对象实例数量 | 文本 query / 表达数量 | 平均词数 |
|---|---|---|---|---|---|---|---|---|---|
| REIRCOCO | ACM MM 2025 | 给定实例级文字描述,先从图库中检索相关图片,再定位目标物体;描述细粒度、无歧义,确保文本唯一对应目标实例 | 来自 MSCOCO 和 RefCOCO,包含上下文、关系线索和位置关系 | 大规模图库中的实例级文本检索与定位 | The brown dog lies on a cushion near the fire place with a red rug underneath. | 30,106 | 215,835 | 613,548 | - |
| SORCE-1K | arXiv 2025 | 面向复杂环境中的小物体文本检索,query 描述的是不显眼的小目标,而不是整图语义或显著前景 | 复杂场景图像,小目标通常只占图像很小区域 | 非常贴近烟头、异物、货架小商品等摄像头局部检索场景 | - | 1,023 | - | 1K 级 query | - |
| ILIAS | CVPR 2025 | Instance-Level Image Retrieval at Scale;包含 1,000 个 object instances,并使用 100M YFCC100M 作为 distractor images 做大规模检索 | 包含 image query、text query、positive images 和大规模 distractors | 大规模实例级检索、hard distractor、跨域检索评估 | - | 5,947 | 1,000 | 1,000 text queries;1,232 image queries;4,715 positive images | - |
- REIRCOCO属于REIR任务;SORCE-1K,ILIAS属于Local Image Retrieval任务。
3.4 Phrase Localization 数据集
| 名称 | 时间 | 特征 | 图像数量 | 标注规模 |
|---|---|---|---|---|
| Flickr30k Entities | 2015 | 基于 Flickr30k captions,将句子中的 entity mentions 与图像区域对齐 | 31k | 158k captions,244k coreference chains,276k boxes |
3.5 数据构造流程
- RefCOCO系列均基于MS COCO图像,但是采集协议不同。
- RefCOCO、RefCOCO+采用的是类似 ReferItGame 的交互式方法:玩家A看图描述,玩家B基于描述找。
- HumanRef 的数据标注包含3个步骤:
- 列举属性:对于图片中的所有人形,标注者会考虑他们的外观、动作、位置、交互以及预定义属性字典,然后列出一系列属性。为了保证数据的多样性,标注者被鼓励标注多个个体共享的属性,避免所有个体都有的属性。
- 分配属性:将上面列出的属性分配给图片中的个体
- 重写引用样式:使用 Qwen2.5+Prompt 将上述属性列表转化为自然语言形式的引用表达。
- Ref-Adv 的数据标注流程:
- 筛选图片:选择干扰项≥3的图片,并给实例添加数字tag
- 相似性判断:使用GPT-4o鉴别最相似的实例对,标注
group-level和instance-level的discriminator - 生成表达:使用
discriminator和否定来构建最小满足的指代表达式 - 人类校验:确保表达准确,难干扰项存在
- HC-RefLoCo 的数据标注流程:
- 使用GPT-4V生成实例的描述(instance-level description)
- 将原始图片交给GPT-4V让它根据实例周围的上下文丰富第一步生成的描述
- 人工审核、修正、将句子分为6类
- 使用GPT-4V重写指代表达,使注释数量翻倍,增加数据多样性
- REIRCOCO的数据构建流程:
- 生成:使用GPT4o生成5个不同的自然语言描述,要求利用视觉线索,能够唯一区别于相似物体,强调动作、关系、空间,鼓励多样性;
- 过滤:使用DeepSeek R1过滤掉错误的、模糊的、冗余的、低信息量的描述。
4. 评价指标 Metrics
不同任务的评价指标不同。对于本课题,需要区分 检测指标、REC 指标、局部检索指标、REIR 端到端指标。
4.1 基础概念:IoU
IoU,即 Intersection over Union,中文通常称为交并比,用于衡量预测框和真实框的重叠程度。
给定预测框 \(B_{pred}\) 和真实框 \(B_{gt}\):
IoU 的取值范围是 \([0, 1]\):
- \(IoU = 1\):预测框和真实框完全重合;
- \(IoU = 0\):预测框和真实框没有重叠;
- IoU 越高,说明定位越准确。
在视觉定位任务中,常用 \(IoU \geq 0.5\) 作为“定位正确”的基本标准。
4.2 Detection / OVD 指标
目标检测和开放词汇目标检测通常需要同时判断:
- 是否找到了目标;
- 目标框是否准确;
- 类别是否匹配;
- 置信度排序是否合理。
Precision 与 Recall
其中:
- TP:正确检测出的目标;
- FP:错误检测出的目标;
- FN:漏检的目标。
Precision 关注“检测出来的结果有多少是真的”,Recall 关注“真实目标中有多少被找到了”。
AP
AP,即 Average Precision,是 Precision-Recall 曲线下的面积。它衡量模型在不同置信度阈值下的综合表现。
对于单个类别,可以计算一个 AP;对所有类别求平均,就是 mAP。
AP50 / AP75
- AP50:在 IoU 阈值为 0.5 时计算 AP;
- AP75:在 IoU 阈值为 0.75 时计算 AP。
AP50 相对宽松,AP75 更强调定位精度。
COCO AP
COCO AP 是 COCO benchmark 中最常用的检测指标。它不是只看一个 IoU 阈值,而是对多个 IoU 阈值求平均:
也就是说,COCO AP 会同时考虑从 \(0.50\) 到 \(0.95\) 的 10 个 IoU 阈值,因此比 AP50 更严格。
APs / APm / APl
COCO 还会按照目标面积划分小、中、大目标:
- APs:small objects,面积小于 \(32 \times 32\);
- APm:medium objects,面积在 \(32 \times 32\) 到 \(96 \times 96\) 之间;
- APl:large objects,面积大于 \(96 \times 96\)。
对于摄像头局部检索,APs 非常重要,因为烟头、火点、远处安全帽、货架小商品等通常都属于小目标。
开放词汇检测中的补充指标
OVD 还常见以下分析维度:
| 指标 / 维度 | 含义 |
|---|---|
| seen / unseen AP | 分别评估训练中见过和没见过的类别 |
| base / novel AP | base 类别和 novel 类别上的检测能力 |
| fixed AP | LVIS 中常用的 AP 计算方式 |
4.3 REC 指标
REC 的输入是:
一张图像 + 一句指代表达
输出是:
一个 bounding box
标准 REC 通常不要求模型额外预测类别,因为文本表达本身已经指定了目标。因此,REC 的核心评价标准是:
预测框是否和 ground-truth box 足够重合?
Acc@0.5
最常见的 REC 指标是 Acc@0.5:
其中:
- \(N\) 是样本数量;
- \(B_i^{pred}\) 是第 \(i\) 个样本的预测框;
- \(B_i^{gt}\) 是第 \(i\) 个样本的真实框;
- \(\mathbb{1}\) 是指示函数,条件成立时为 1,否则为 0。
如果预测框和真实框的 IoU 大于等于 0.5,则认为该样本定位正确。
Acc@0.75
Acc@0.75 使用更高的 IoU 阈值:
它比 Acc@0.5 更严格,更能反映模型的精确定位能力。
Top-1 Accuracy
很多 REC 论文中使用 Top-1 Accuracy,本质上通常等价于:
模型输出得分最高的 box,如果与 GT box 的 IoU ≥ 0.5,则认为正确。
因此,在 RefCOCO、RefCOCO+、RefCOCOg 上,常见的评价方式就是 Top-1 Accuracy 或 Acc@0.5。
4.4 Local Image Retrieval 指标
局部图像检索的输入是:
文本 query + 图库
输出是:
按相关性排序的图片列表,或者图片 + 局部区域
它和普通图文检索类似,都需要评估排序质量,但局部图像检索的 query 描述的是图像中的局部目标,而不是整张图的整体语义。
Recall@K
Recall@K 表示:对于每个 query,排名前 K 的结果中是否至少包含一个正确结果。
例如:
- Recall@1:排名第一的结果是否正确;
- Recall@5:前五个结果中是否包含正确图片;
- Recall@10:前十个结果中是否包含正确图片。
在业务中,Recall@K 很重要,因为检索系统通常给用户返回 Top-K 图片。只要目标图片出现在前 K 个结果中,用户就有机会找到它。
Precision@K
Precision@K 表示:Top-K 返回结果中,有多少比例是真正相关的。
例如,用户搜索“地上的烟头”,系统返回 10 张图片,其中 7 张真的包含烟头,则:
Precision@K 更适合衡量用户体验:返回结果越干净,人工筛选成本越低。
AP 与 mAP
对于一个 query,模型会返回一个排序列表。AP 衡量的是整个排序列表中正样本排名是否靠前。
如果正样本越靠前,AP 越高;如果正样本虽然被找到了但排得很靠后,AP 会下降。
mAP 是对所有 query 的 AP 求平均:
mAP 比 Recall@K 更全面,因为它不仅关心有没有找回正样本,也关心正样本在排序列表中的位置。
mAP@50
mAP@50 表示只在前 50 个返回结果中计算 AP。它适合大规模检索场景,因为实际业务中用户通常只会查看前几十个结果。
ILIAS 和一些实例级检索 benchmark 会使用 mAP@50 来评估模型在 top results 中的排序质量。
MRR
MRR,即 Mean Reciprocal Rank,关注第一个正确结果出现的位置:
其中 \(rank_i\) 是第一个正确结果的排名。
如果正确结果经常排在第一,MRR 会很高。MRR 适合用户只看最前几个结果的搜索场景。
4.5 REIR 指标
REIR 同时包含两个子任务:
- 从图库中检索到正确图片;
- 在正确图片中定位到目标实例。
因此,REIR 不能只看图片检索指标,也不能只看单图定位指标,而应该同时评估 retrieval 和 localization。
图像级检索指标
这部分和 Local Image Retrieval 类似:
| 指标 | 含义 |
|---|---|
| Recall@K | Top-K 图片中是否包含目标图片 |
| Precision@K | Top-K 图片中相关图片的比例 |
| mAP | 整个排序列表的平均精度 |
| MRR | 第一个正确结果的排名质量 |
定位指标
当模型找到了相关图片后,还需要判断目标框是否正确:
| 指标 | 含义 |
|---|---|
| IoU@0.5 | 预测框和 GT box 的 IoU 是否大于等于 0.5 |
| Acc@0.5 | 所有样本中 IoU ≥ 0.5 的比例 |
| Acc@0.75 | 更严格的定位准确率 |
端到端 REIR 指标
对于 REIR,更合理的评价方式是:
Top-K 中检索到正确图片,并且对应预测框与 GT box 的 IoU ≥ threshold。
可以记作:
或者更直观地写成:
End-to-end Recall@K@IoU0.5
含义是:
在前 K 个返回结果中,是否存在一个结果:
1. 图片是正确的;
2. 目标实例也是正确的;
3. 预测 box 与 GT box 的 IoU ≥ 0.5。
这比单纯的 Recall@K 更严格,也更符合业务需求。
例如,用户搜索“地上的烟头”:
- 如果系统返回了一张确实有烟头的图片,但框到了纸屑,这是图片检索成功、局部定位失败;
- 如果系统框到了烟头,但这张图片排序很靠后,用户可能仍然找不到;
- 只有当系统把正确图片排在前面,并且正确框出烟头,才算端到端成功。

浙公网安备 33010602011771号