答题满分,指证零分:16 个多模态模型在 DocAttriBench 上集体暴露的定位短板

💡 一句话总结:DocAttriBench(DAB)用「遮挡版面元素 → 测答案困惑度增量」的免训练打分法,把 8 个现有 DocVQA 数据集批量补上元素级证据框,然后拿它一测:16 个主流多模态模型答题都还行,指证据全瞎——连 30B+ 模型的定位 F1 都不到 40%。更扎心的是,用 DAB 微调一个 7B 模型,定位与作答全面反超 32B 零样本。

先问一个做文档智能的同学都遇到过的问题:模型给你的 RAG 系统返回了一个答案,看起来没毛病,但你敢不敢让它把答案在原文里的位置圈出来?

圈不出来就麻烦了。金融、医疗、法务这些场景里,「答案对不对」和「答案有没有出处」是两回事——后者决定系统能不能被审计。这就是 Visual Answer Grounding(视觉答案归属):模型除了给出文本答案,还要输出支撑该答案的图像区域。

现状有多尴尬呢?大多数 DocVQA 基准根本没有 grounding 标注;有人工标注的(VisualMRC 动用了 500 多名标注者)成本高到不可复制;走自动路线的又经常出现「幻觉 grounding」——把跟答案毫无关系的区域一本正经地标成证据。

想自己看看?资源在这:

🎯 为什么归属标注这么难搞?

人工标注贵到离谱,这条路基本堵死。自动标注又有个死循环:要用模型给「模型找的证据」打分,打分器自己不可靠,标出来的框就是噪声。

意大利摩德纳大学的团队想明白了一件事:证据归属本质上不是「找框」问题,而是「消融」问题——如果某个版面元素真的承载了答案,那么把它遮住,模型生成这个答案就该变得困难。这个直觉催生了 MAPPET。

🛠️ MAPPET:把「证据在哪」变成一道消融题

MAPPET(Mask-based Perplexity-Derived Attribution)全流程不需要训练任何新模型,三步走:

MAPPET 归属流水线:版面分析抽元素 → 逐元素遮挡测困惑度增量 → 双重过滤留高置信样本

  • 抽候选:用现成的版面分析模型 Docling 把页面切成 12 类结构化元素(段落、表格、题注、图片……),每个框都是候选证据;
  • 打分数:对每个候选元素做遮挡,计算「遮挡后答案困惑度 − 原困惑度」。关键证据被遮住,困惑度显著上升(分数为正且大);遮住无关区域,分数接近零。用对数差分还能跨不同长度的答案公平比较;
  • 双重过滤:光有高分不够,还要「赢够多」——最高分低于阈值 0.1 的丢掉(答案在页面多处冗余出现,定位没有唯一解),最高分与次高分差距小于 0.1 的也丢掉(证据分散在多个区域)。

第二步那个「分差过滤」是最容易被忽略、也最聪明的一步。它相当于承认:归属的可用性取决于唯一性,而不只是「有一个高分」。顺便说一句,这个「绝对阈值 + 领先幅度」的双过滤手法,你在做任何自动标注筛选时都抄得走。

标出来的数据靠不靠谱?作者做了三条件验证:只留证据区域(充分性)、只遮证据区域(必要性)、遮同尺寸随机区域(对照)。结果:只留证据时答案似然不降反升,只遮证据时平均下降 -0.914 且 98.8% 的样本变差,而随机遮挡只掉 -0.232——真证据的效果是随机区域的 3-4 倍,排除了「遮什么都掉分」的平庸解释。人工抽查里,过滤后的标注准确率普遍超过 95%。

📊 16 个模型的成绩单:答题与定位严重脱钩

用这套标准一测,画面相当欢乐。DAB 一共 237,418 张文档图、295,554 组「图 + 问题 + 答案 + 证据框」,图像多样性 Simpson 系数 0.97(同口径下 DUDE 是 0.82)。几个代表性成绩(Acc = 总体答案正确率,F1 = 定位 F1,按 7 个测试集平均):

类别 模型 答案准确率 定位 F1
零样本 InternVL2.5-8B 低(各集 0-1.7) ≈0
零样本 InternVL3.5-38B 8.6 —
零样本 Qwen2.5-VL-32B 9.1 —
零样本 Qwen3-VL-32B 25.4 41.8*
微调 MAPPET-7B(LoRA) 33.8 65.8
微调 MAPPET-8B 37.0 75.3

*单项集上的 Box F1,总体口径见论文表 5。

三个发现值得细品。第一,答题和定位是两种能力:InternVL2.5-8B 在 DocVQA 上答对 59%,Box F1 是刺眼的 0.0——模型能「说出答案」,却完全指不出证据在哪。这直接戳破了「准确率高 = 输出可靠」的幻觉。

第二,堆参数解决不了定位:InternVL 家族从 2B 铺到 38B,定位 F1 几乎原地踏步;真正跳变的是 Qwen3-VL-32B 这一个点——更可能是它的训练配方里见过定位类监督,而不是它大。

第三,归属监督比参数规模好使:7B/8B 模型用 DAB 做 LoRA 微调(2×A100 训 24 小时的成本),定位 F1 比零样本自己提升 20-49 分,MAPPET-8B 的总体正确率 37.0% 对 Qwen3-VL-32B 零样本的 25.4%——4 倍的参数差距就这么被数据抹平了。跨架构验证(在 InternVL 上微调的 MAPPET-I-8B)同样成立,说明这不是 Qwen 自嗨。

Visual Answer Grounding 任务定义与 DAB 数据集示例统计

🧊 泼冷水时间:四个要打问号的地方

这篇论文写得扎实,但有几个点你得心里有数:

  • 选择偏倚写进了数据定义:分差过滤把「证据分散在多个区域」的样本全排除了,所以 DAB 衡量的是单元素归属能力。真实场景里恰恰是多区域证据聚合更常见也更难——DAB 高分不等于归属问题接近解决。
  • 评估器和被评估者同源:打分、答案改写、微调基座全是 Qwen2.5-VL-7B。作者用 InternVL 做了跨族微调和独立验证(加分),但没做「换一个族的打分器重新生成一版 DAB」的对照,标注带 Qwen 系偏好的可能性没法排除。
  • 人工验证没报标注者间一致性:每来源 100 例、三位标注者,但没有 IAA/κ 系数。当「多个区域都算有效证据」时,95% 的准确率里有多少是标注者自己也没对齐,说不清。
  • 训练集的主力来源有点尴尬:28.5 万训练数据近九成来自 DoclingMatix 和 VISA 系——后者正是论文自己在 related work 里批评「含不自然问题与错误 grounding」的来源。MAPPET 过滤确实把 VISA 上的准确率从 20.7 拉到 55.1,但反过来读:过滤后仍有近一半错漏,只是汇报口径用的是过滤后子集。

🤔 那这篇能带走什么?

抛开基准本身,有三样东西可以直接搬进你的工程:

  • 「遮挡-困惑度差分」这个归属打分思路,可迁移到任何「答案 ↔ 上下文单元」场景:表格单元格归属、代码片段归属、多页文档的页级引用,原理通用;
  • 「绝对阈值 + 与次优分差」双过滤,处理多义自动标注的通用手法,成本几乎为零;
  • 「答题准确率 × 定位 F1」的 AND 组合指标,如果你在做多模态 RAG 的评测,建议把「指不出证据的答案不算对」写进验收标准——这篇论文用 16 个模型证明了这两件事有多容易脱钩。

往大了说,这篇论文给「多模态模型能力评估」补上了一块长期缺席的板子:我们测了太多「答得对不对」,太少测「依据找没找对」。在文档智能往审计场景走的过程中,后者可能才是那道真正的门槛——好在现在,补齐监督数据的成本已经被打到「单卡两天」量级了。

posted @ 2026-10-03 08:15  Lusca2026  阅读(2)  评论(0)    收藏  举报