答题满分,指证零分:16 个多模态模型在 DocAttriBench 上集体暴露的定位短板
💡 一句话总结:DocAttriBench(DAB)用「遮挡版面元素 → 测答案困惑度增量」的免训练打分法,把 8 个现有 DocVQA 数据集批量补上元素级证据框,然后拿它一测:16 个主流多模态模型答题都还行,指证据全瞎——连 30B+ 模型的定位 F1 都不到 40%。更扎心的是,用 DAB 微调一个 7B 模型,定位与作答全面反超 32B 零样本。
先问一个做文档智能的同学都遇到过的问题:模型给你的 RAG 系统返回了一个答案,看起来没毛病,但你敢不敢让它把答案在原文里的位置圈出来?
圈不出来就麻烦了。金融、医疗、法务这些场景里,「答案对不对」和「答案有没有出处」是两回事——后者决定系统能不能被审计。这就是 Visual Answer Grounding(视觉答案归属):模型除了给出文本答案,还要输出支撑该答案的图像区域。
现状有多尴尬呢?大多数 DocVQA 基准根本没有 grounding 标注;有人工标注的(VisualMRC 动用了 500 多名标注者)成本高到不可复制;走自动路线的又经常出现「幻觉 grounding」——把跟答案毫无关系的区域一本正经地标成证据。
想自己看看?资源在这:
- 📄 论文 · arXiv 2609.20574
- 📊 数据集与代码 · DocAttriBench 主页
🎯 为什么归属标注这么难搞?
人工标注贵到离谱,这条路基本堵死。自动标注又有个死循环:要用模型给「模型找的证据」打分,打分器自己不可靠,标出来的框就是噪声。
意大利摩德纳大学的团队想明白了一件事:证据归属本质上不是「找框」问题,而是「消融」问题——如果某个版面元素真的承载了答案,那么把它遮住,模型生成这个答案就该变得困难。这个直觉催生了 MAPPET。
🛠️ MAPPET:把「证据在哪」变成一道消融题
MAPPET(Mask-based Perplexity-Derived Attribution)全流程不需要训练任何新模型,三步走:

- 抽候选:用现成的版面分析模型 Docling 把页面切成 12 类结构化元素(段落、表格、题注、图片……),每个框都是候选证据;
- 打分数:对每个候选元素做遮挡,计算「遮挡后答案困惑度 − 原困惑度」。关键证据被遮住,困惑度显著上升(分数为正且大);遮住无关区域,分数接近零。用对数差分还能跨不同长度的答案公平比较;
- 双重过滤:光有高分不够,还要「赢够多」——最高分低于阈值 0.1 的丢掉(答案在页面多处冗余出现,定位没有唯一解),最高分与次高分差距小于 0.1 的也丢掉(证据分散在多个区域)。
第二步那个「分差过滤」是最容易被忽略、也最聪明的一步。它相当于承认:归属的可用性取决于唯一性,而不只是「有一个高分」。顺便说一句,这个「绝对阈值 + 领先幅度」的双过滤手法,你在做任何自动标注筛选时都抄得走。
标出来的数据靠不靠谱?作者做了三条件验证:只留证据区域(充分性)、只遮证据区域(必要性)、遮同尺寸随机区域(对照)。结果:只留证据时答案似然不降反升,只遮证据时平均下降 -0.914 且 98.8% 的样本变差,而随机遮挡只掉 -0.232——真证据的效果是随机区域的 3-4 倍,排除了「遮什么都掉分」的平庸解释。人工抽查里,过滤后的标注准确率普遍超过 95%。
📊 16 个模型的成绩单:答题与定位严重脱钩
用这套标准一测,画面相当欢乐。DAB 一共 237,418 张文档图、295,554 组「图 + 问题 + 答案 + 证据框」,图像多样性 Simpson 系数 0.97(同口径下 DUDE 是 0.82)。几个代表性成绩(Acc = 总体答案正确率,F1 = 定位 F1,按 7 个测试集平均):
| 类别 | 模型 | 答案准确率 | 定位 F1 |
|---|---|---|---|
| 零样本 | InternVL2.5-8B | 低(各集 0-1.7) | ≈0 |
| 零样本 | InternVL3.5-38B | 8.6 | — |
| 零样本 | Qwen2.5-VL-32B | 9.1 | — |
| 零样本 | Qwen3-VL-32B | 25.4 | 41.8* |
| 微调 | MAPPET-7B(LoRA) | 33.8 | 65.8 |
| 微调 | MAPPET-8B | 37.0 | 75.3 |
*单项集上的 Box F1,总体口径见论文表 5。
三个发现值得细品。第一,答题和定位是两种能力:InternVL2.5-8B 在 DocVQA 上答对 59%,Box F1 是刺眼的 0.0——模型能「说出答案」,却完全指不出证据在哪。这直接戳破了「准确率高 = 输出可靠」的幻觉。
第二,堆参数解决不了定位:InternVL 家族从 2B 铺到 38B,定位 F1 几乎原地踏步;真正跳变的是 Qwen3-VL-32B 这一个点——更可能是它的训练配方里见过定位类监督,而不是它大。
第三,归属监督比参数规模好使:7B/8B 模型用 DAB 做 LoRA 微调(2×A100 训 24 小时的成本),定位 F1 比零样本自己提升 20-49 分,MAPPET-8B 的总体正确率 37.0% 对 Qwen3-VL-32B 零样本的 25.4%——4 倍的参数差距就这么被数据抹平了。跨架构验证(在 InternVL 上微调的 MAPPET-I-8B)同样成立,说明这不是 Qwen 自嗨。

🧊 泼冷水时间:四个要打问号的地方
这篇论文写得扎实,但有几个点你得心里有数:
- 选择偏倚写进了数据定义:分差过滤把「证据分散在多个区域」的样本全排除了,所以 DAB 衡量的是单元素归属能力。真实场景里恰恰是多区域证据聚合更常见也更难——DAB 高分不等于归属问题接近解决。
- 评估器和被评估者同源:打分、答案改写、微调基座全是 Qwen2.5-VL-7B。作者用 InternVL 做了跨族微调和独立验证(加分),但没做「换一个族的打分器重新生成一版 DAB」的对照,标注带 Qwen 系偏好的可能性没法排除。
- 人工验证没报标注者间一致性:每来源 100 例、三位标注者,但没有 IAA/κ 系数。当「多个区域都算有效证据」时,95% 的准确率里有多少是标注者自己也没对齐,说不清。
- 训练集的主力来源有点尴尬:28.5 万训练数据近九成来自 DoclingMatix 和 VISA 系——后者正是论文自己在 related work 里批评「含不自然问题与错误 grounding」的来源。MAPPET 过滤确实把 VISA 上的准确率从 20.7 拉到 55.1,但反过来读:过滤后仍有近一半错漏,只是汇报口径用的是过滤后子集。
🤔 那这篇能带走什么?
抛开基准本身,有三样东西可以直接搬进你的工程:
- 「遮挡-困惑度差分」这个归属打分思路,可迁移到任何「答案 ↔ 上下文单元」场景:表格单元格归属、代码片段归属、多页文档的页级引用,原理通用;
- 「绝对阈值 + 与次优分差」双过滤,处理多义自动标注的通用手法,成本几乎为零;
- 「答题准确率 × 定位 F1」的 AND 组合指标,如果你在做多模态 RAG 的评测,建议把「指不出证据的答案不算对」写进验收标准——这篇论文用 16 个模型证明了这两件事有多容易脱钩。
往大了说,这篇论文给「多模态模型能力评估」补上了一块长期缺席的板子:我们测了太多「答得对不对」,太少测「依据找没找对」。在文档智能往审计场景走的过程中,后者可能才是那道真正的门槛——好在现在,补齐监督数据的成本已经被打到「单卡两天」量级了。
浙公网安备 33010602011771号