The Cauldron 数据集分布分析报告

The Cauldron 数据集分布分析报告

数据集: HuggingFaceM4/the_cauldron
用途: Idefics2 视觉-语言模型微调训练数据
报告日期: 2025-07-05
数据集规模: 50 个子数据集 | 1,880,992 样本 | 424.6 GB


目录

  1. 执行摘要
  2. 数据集总体概况
  3. 各类别分布分析
  4. 样本数量分布特征
  5. 存储大小分布分析
  6. 样本密度与存储效率分析
  7. 帕累托分布与长尾效应
  8. 异常值深度分析
  9. 关键发现与结论
  10. 训练实践建议

1. 执行摘要

The Cauldron 是 Idefics2 视觉-语言模型发布时配套的大规模训练数据集,由 50 个 经过筛选的视觉-语言子数据集整合而成,覆盖 9 大任务类别,总计 1,880,992 条 训练样本,原始存储体积约 424.6 GB

本报告通过对该数据集的多维度统计分析,揭示以下核心发现:

  • 样本分布呈高度偏斜的长尾形态:前 16 个数据集(32%)贡献了 80% 的样本,尾部 34 个数据集仅贡献 20%。
  • 存储与样本严重不对等:General VQA 类别以 14.7% 的样本量占据了 67.3% 的存储空间,其根本原因是 okvqa 子数据集的异常大体积。
  • okvqa 为极端异常值:仅 9,009 条样本(0.48%)却独占 262.1 GB(61.7% 的总存储),单样本平均 30.5 MB,是均值的 40 倍。
  • Chart & Figure 类别样本最密集:以 29.2% 的样本量仅占用 4.2% 的存储,单样本仅 43 KB,数据效率极高。

2. 数据集总体概况

2.1 基本统计指标

指标 数值
子数据集数量 50
总样本数 1,880,992
总数据集大小 424.6 GB
总下载大小 157.3 GB
平均每数据集样本数 37,620
平均每数据集大小 8.5 GB
样本数量中位数 16,134
样本数量标准差 50,572
变异系数 1.34

2.2 任务类别覆盖

The Cauldron 涵盖 9 大视觉-语言任务类别,体现了全面的任务覆盖策略:

类别 数据集数 占比
OCR & Document 10 20.0%
Table Understanding 8 16.0%
General VQA 8 16.0%
Chart & Figure 7 14.0%
Reasoning & Math 6 12.0%
Captioning 3 6.0%
Textbook & Academic 3 6.0%
Image Difference 3 6.0%
Screenshot to Code 2 4.0%

观察: OCR & Document、Table Understanding、General VQA 三类占据了 52% 的数据集数量,反映了 Idefics2 在文档理解和结构化推理方面的能力侧重。


3. 各类别分布分析

3.1 样本数量分布

按样本总量排序的 9 大类别分布如下:

排名 类别 总样本数 占比 数据集数 平均样本/数据集
1 Chart & Figure 549,682 29.2% 7 78,526
2 General VQA 276,466 14.7% 8 34,558
3 OCR & Document 258,196 13.7% 10 25,820
4 Reasoning & Math 219,890 11.7% 6 36,648
5 Captioning 217,885 11.6% 3 72,628
6 Table Understanding 162,065 8.6% 8 20,258
7 Image Difference 129,931 6.9% 3 43,310
8 Screenshot to Code 57,974 3.1% 2 28,987
9 Textbook & Academic 8,903 0.5% 3 2,968

各类别样本数量分布

图 1: 各类别样本数量分布 —— Chart & Figure 以近 55 万条样本占据首位,Textbook & Academic 仅 8,903 条。

关键观察:

  • Chart & Figure 以近 55 万条样本占据首位,主要由 dvqa(200,000)、plotqa(157,070)和 figureqa(100,000)三个大型数据集驱动。
  • Captioning 虽仅有 3 个数据集,但凭借 localized_narratives(~200,000 样本)的平均值高达 72,628,效率极高。
  • Textbook & Academic 最为稀疏,仅 8,903 条样本(0.5%),覆盖 ai2d、tqa、scienceqa 三个学术问答数据集。

3.2 存储大小分布

排名 类别 总大小 (GB) 占比 单样本平均 (KB)
1 General VQA 285.8 67.3% 3,934.6
2 OCR & Document 37.6 8.9% 368.2
3 Reasoning & Math 25.7 6.1% 85.0
4 Captioning 21.6 5.1% 85.6
5 Image Difference 21.1 5.0% 174.3
6 Chart & Figure 17.7 4.2% 43.3
7 Table Understanding 11.8 2.8% 70.5
8 Screenshot to Code 2.3 0.5% 103.1
9 Textbook & Academic 1.0 0.2% 159.8

关键观察:

  • General VQA 的存储占比(67.3%)远超其样本占比(14.7%),单样本平均近 4 MB,原因完全是 okvqa 的异常值效应。
  • Chart & Figure 的存储占比(4.2%)远低于其样本占比(29.2%),单样本仅 43 KB,数据压缩率极高。这类数据以程序生成的图表为主,图像结构简单、色彩单一,天然适合高效存储。
  • 排除 okvqa 后,整体数据集大小将缩减至约 162.5 GB(减少 61.7%),而样本仅减少 0.48%。

各类别存储大小分布

图 2: 各类别存储大小分布 —— General VQA 以 285.8 GB 独占 67.3% 的存储空间,远超其他类别。

各类别样本占比环形图

图 3: 各类别样本占比 —— Chart & Figure 贡献 29.2% 的样本,为最大类别;9 大类别合计 1,880,992 条样本。


4. 样本数量分布特征

4.1 整体分布统计

统计量 数值
最小值 300 (diagram_image_to_text)
最大值 200,000 (dvqa)
中位数 16,134
平均值 37,620
标准差 50,572
变异系数 1.34

分布特征: 变异系数为 1.34(> 1),表明样本数量分布呈 强离散状态,数据高度不均匀。平均值(37,620)远高于中位数(16,134),进一步印证了右偏(正偏态)分布特征。

4.2 Top 10 数据集明细

排名 数据集 类别 样本数 占比 累计占比
1 dvqa Chart & Figure 200,000 10.6% 10.6%
2 localized_narratives Captioning 199,998 10.6% 21.3%
3 ocrvqa OCR & Document 165,746 8.8% 30.1%
4 plotqa Chart & Figure 157,070 8.4% 38.4%
5 figureqa Chart & Figure 100,000 5.3% 43.7%
6 tallyqa General VQA 98,680 5.2% 49.0%
7 vqav2 General VQA 82,772 4.4% 53.4%
8 robut_wikisql Table Understanding 74,989 4.0% 57.3%
9 mimic_cgd Image Difference 70,939 3.8% 61.1%
10 clevr_math Reasoning & Math 70,000 3.7% 64.9%

数据集样本排序与累计占比

图 4: 各数据集样本数量排序与累计占比 —— dvqa(200,000)和 localized_narratives(199,998)为最大数据集;前 16 个数据集(32%)贡献了 80% 的样本,呈现典型的长尾分布。

4.3 Bottom 10 数据集明细

排名 数据集 类别 样本数 占比
41 tat_qa Table Understanding 2,199 0.12%
42 intergps Reasoning & Math 1,280 0.07%
43 tqa Textbook & Academic 1,493 0.08%
44 vsr Captioning 2,157 0.11%
45 infographic_vqa OCR & Document 2,118 0.11%
46 hitab Table Understanding 2,500 0.13%
47 scienceqa Textbook & Academic 4,976 0.26%
48 vqarad General VQA 313 0.02%
49 ai2d Textbook & Academic 2,434 0.13%
50 diagram_image_to_text OCR & Document 300 0.02%

5. 存储大小分布分析

5.1 按存储排序的 Top 10 数据集

排名 数据集 类别 大小 (GB) 占比 单样本 (KB)
1 okvqa General VQA 262.1 61.7% 30,509
2 localized_narratives Captioning 19.9 4.7% 102
3 clevr_math Reasoning & Math 12.4 2.9% 182
4 clevr Reasoning & Math 10.7 2.5% 161
5 vqav2 General VQA 9.9 2.3% 124
6 nlvr2 Image Difference 7.8 1.8% 164
7 docvqa OCR & Document 6.4 1.5% 674
8 ocrvqa OCR & Document 5.1 1.2% 32
9 plotqa Chart & Figure 7.3 1.7% 49
10 textvqa OCR & Document 5.5 1.3% 268

关键发现: okvqa 以绝对压倒性的 262.1 GB 占据总存储的 61.7%,是第二名 localized_narratives(19.9 GB)的 13.2 倍。这一异常现象值得特别关注(详见第 8 节)。

5.2 存储最小数据集

数据集 大小 (MB) 类别
vqarad 15.8 General VQA
diagram_image_to_text 18.0 OCR & Document
intergps 23.8 Reasoning & Math
tat_qa 69.8 Table Understanding
infographic_vqa 278.3 OCR & Document

6. 样本密度与存储效率分析

6.1 单样本平均大小分布

类别 单样本平均 (KB) 特征
Chart & Figure 43.3 程序生成图表,结构简单,效率最高
Table Understanding 70.5 结构化表格数据,以文本为主
Reasoning & Math 85.0 合成场景图像(CLEVR),尺寸标准化
Captioning 85.6 自然图像+文本描述
Screenshot to Code 103.1 网页截图,分辨率可控
Textbook & Academic 159.8 教材截图,中等分辨率
Image Difference 174.3 双图对比任务,含成对图像
OCR & Document 368.2 高分辨率文档扫描件
General VQA 3,934.6 被 okvqa 严重扭曲

6.2 各数据集单样本大小 Top 10

排名 数据集 类别 单样本 (KB)
1 okvqa General VQA 30,509
2 rendered_text OCR & Document 1,082
3 visualmrc OCR & Document 948
4 docvqa OCR & Document 674
5 hateful_memes General VQA 348
6 visual7w General VQA 302
7 textvqa OCR & Document 268
8 textcaps OCR & Document 267
9 tqa Textbook & Academic 248
10 websight Screenshot to Code 193

观察: 单样本大小分布跨越了 3 个数量级(从 iconqa 的 9.5 KB 到 okvqa 的 30,509 KB),这种极端差异在数据加载和批处理时需要特别关注内存管理。

样本数与存储大小关系散点图

图 5: 样本数量 vs. 存储大小散点图(对数坐标)—— okvqa 为显著离群点(低样本数、极高存储);localized_narratives 和 dvqa 为高样本数、中等存储的代表性数据集。

各数据集平均样本大小

图 6: 各数据集平均样本大小 —— okvqa 以 30,509 KB/样本为极端离群值,iconqa(9.5 KB)和 tabmwp(11.4 KB)为存储效率最高的数据集。


7. 帕累托分布与长尾效应

7.1 帕累托分析

将 50 个数据集按样本数量降序排列,计算累计贡献:

累计占比 所需数据集数 数据集占比
50% 6 12%
64.9% 10 20%
80% 16 32%
90% 24 48%
100% 50 100%

结论: The Cauldron 的样本分布呈现典型的 帕累托/长尾分布——少数头部数据集贡献了绝大多数样本,而大量尾部数据集仅贡献少量样本。

7.2 长尾部分的组成

后 34 个数据集(68% 的数据集数量)仅贡献了 20% 的样本,这些尾部数据集主要包含:

  • 特殊领域数据: 医学影像问答(vqarad)、几何推理(geomverse)、导航地图(mapqa)
  • 小规模精品数据: 教科书问答(ai2d, tqa, scienceqa)、图表描述(diagram_image_to_text)
  • 新兴任务数据: 网页转代码(websight, datikz)、差异检测(spot_the_diff)

虽然单个体量小,但这些尾部数据集覆盖了头部数据集无法触及的特殊能力维度,对模型的泛化能力至关重要。


8. 异常值深度分析

8.1 okvqa — 极端异常值

属性 数值 与均值比值
样本数 9,009 0.24x
数据大小 262.1 GB 30.9x
单样本平均 30,509 KB 40.3x
占总存储比 61.7%
占总样本比 0.48%

可能原因分析:

  1. 高分辨率图像: okvqa 数据集(OK-VQA)需要丰富的外部知识来回答视觉问题,其原始图像可能来自多源聚合,包含大量高分辨率自然照片。
  2. 图像预处理差异: 与其他经过压缩或标准化处理的子数据集不同,okvqa 可能保留了原始未压缩的图像文件。
  3. 数据格式差异: okvqa 的 num_bytes(实际数据体积)与 download_size(3 MB)之间存在巨大差异,说明该数据集的实际展开体积远大于下载体积,可能涉及复杂的图像解码或重复存储。

影响评估:

  • 正面: okvqa 作为外部知识 VQA 的代表数据集,其高质量图像有助于模型学习视觉-知识关联。
  • 负面: 在训练过程中,okvqa 批次将产生不成比例的内存占用和 I/O 压力,可能需要特殊的批次构造策略。

8.2 clevr_math — 下载大小异常

属性 数值
数据集大小 12.4 GB
下载大小 15.6 MB
压缩比 ~800x

clevr_math 的 download_size 异常小(15.6 MB),而数据集大小达 12.4 GB,这意味着该数据集在加载时会通过程序实时生成图像(CLEVR 系列以程序化场景生成为特点),而非存储静态图像文件。


9. 关键发现与结论

9.1 核心发现汇总

# 发现 影响等级
1 样本分布高度偏斜,Top 10 数据集贡献 64.9% 样本
2 okvqa 独占 61.7% 存储但仅贡献 0.48% 样本 极高
3 Chart & Figure 以 4.2% 存储贡献 29.2% 样本,效率最高
4 50 个数据集覆盖 9 大任务类别,任务覆盖全面
5 单样本大小跨越 3 个数量级(9.5 KB ~ 30,509 KB)
6 帕累托效应显著:32% 数据集贡献 80% 样本
7 Textbook & Academic 类别最为稀疏(0.5% 样本)
8 CLEVR 系列采用程序生成,下载体积极小

9.2 结构性观察

任务类别的设计意图: The Cauldron 的 9 大类别设计体现了对视觉-语言模型能力的全面规划:

  • 感知层: Captioning、General VQA —— 基础视觉理解
  • 认知层: OCR & Document、Chart & Figure、Table Understanding —— 结构化信息提取
  • 推理层: Reasoning & Math、Textbook & Academic —— 逻辑与知识推理
  • 特殊能力: Image Difference、Screenshot to Code —— 差异化与代码生成能力

数据-效率权衡: 数据集在数量和存储之间做出了明确的权衡——优先保证任务覆盖的全面性(50 个数据集、9 大类别),而非追求各数据集之间的体量均衡。


10. 训练实践建议

10.1 数据采样策略

建议 1: 逆频率加权采样

由于样本分布高度偏斜,建议采用基于数据集样本数量的逆频率加权策略,避免模型过度拟合到头部数据集:

weight_i = (total_samples / n_datasets) / samples_i

这将赋予尾部数据集更高的采样概率,促进模型在稀有任务上的学习能力。

建议 2: okvqa 特殊处理

方案 描述 适用场景
A 保留完整 okvqa,使用较小批次 存储充足,追求最佳性能
B 对 okvqa 图像进行预压缩/降采样 存储受限,平衡性能与资源
C 排除 okvqa,释放 61.7% 存储 严格存储约束,快速实验
D 将 okvqa 拆分为多个子批次 显存受限,分布式训练

10.2 数据加载优化

建议 3: 分层批次构造

由于单样本大小跨越 3 个数量级,建议:

  1. 按数据体积分层: 将数据集分为"大图像"(> 500 KB/sample)和"小图像"(<= 500 KB/sample)两组
  2. 动态批次大小: 对 Chart & Figure、Table Understanding 等小样本数据集使用较大批次;对 okvqa、docvqa 等大样本数据集使用较小批次
  3. 预加载与缓存: 对尾部小数据集(< 2,000 样本)可完全缓存至内存,减少重复 I/O

建议 4: 混合精度加载

对于 rendered_text(1,082 KB/sample)、visualmrc(948 KB/sample)等高分辨率 OCR 数据集,可考虑在数据加载阶段进行动态降采样,平衡视觉细节与内存占用。

10.3 训练监控指标

建议训练过程中特别关注以下指标以检测数据不平衡问题:

  • 类别级损失: 监控各任务类别的验证损失,确保尾部类别(Textbook & Academic、Screenshot to Code)的学习进度
  • 梯度范数: 监控来自 okvqa 批次的梯度范数,防止其过大体积导致梯度爆炸
  • 采样覆盖率: 确保每个 epoch 内所有 50 个数据集至少被采样一次

10.4 数据子集快速实验

如需快速迭代实验,建议按以下优先级构建数据子集:

优先级 数据集 理由
P0 Chart & Figure(排除 dvqa/plotqa) 29.2% 样本,仅 4.2% 存储
P1 Reasoning & Math + Table Understanding 20.3% 样本,结构清晰
P2 OCR & Document(排除 docvqa) 13.7% 样本,实用能力
P3 Captioning + General VQA(排除 okvqa) 26.3% 样本,基础能力
P4 全部尾部类别 特殊能力维度
P5 okvqa 视存储情况决定是否纳入

附录: 50 个数据集完整统计

数据集 类别 样本数 大小 (GB) 单样本 (KB)
dvqa Chart & Figure 200,000 3.4 17.5
localized_narratives Captioning 199,998 19.9 101.9
ocrvqa OCR & Document 165,746 5.1 31.8
plotqa Chart & Figure 157,070 7.3 48.5
figureqa Chart & Figure 100,000 1.8 18.3
tallyqa General VQA 98,680 4.0 41.5
vqav2 General VQA 82,772 9.9 122.5
robut_wikisql Table Understanding 74,989 5.5 75.3
mimic_cgd Image Difference 70,939 11.7 169.4
clevr_math Reasoning & Math 70,000 12.4 181.7
clevr Reasoning & Math 70,000 10.7 161.4
raven Reasoning & Math 42,000 1.4 34.8
nlvr2 Image Difference 50,426 7.8 158.5
robut_wtq Table Understanding 38,246 3.7 100.5
mapqa Chart & Figure 37,417 3.0 80.9
iconqa Reasoning & Math 27,315 0.3 9.5
chart2text Chart & Figure 26,985 1.0 38.8
tabmwp Table Understanding 22,729 0.3 11.4
cocoqa General VQA 46,287 2.1 46.1
textcaps OCR & Document 21,953 5.5 256.8
textvqa OCR & Document 21,953 5.5 261.8
screen2words Captioning 15,730 1.6 101.5
st_vqa OCR & Document 17,247 0.6 38.3
aokvqa General VQA 16,539 0.8 49.6
geomverse Reasoning & Math 9,303 0.9 99.8
multihiertt Table Understanding 7,619 1.3 170.9
visual7w General VQA 14,366 4.1 293.2
finqa Table Understanding 5,276 0.1 25.0
hateful_memes General VQA 8,500 2.8 337.3
robut_sqa Table Understanding 8,514 0.6 77.7
scienceqa Textbook & Academic 4,976 0.3 54.7
iam OCR & Document 5,663 1.1 194.8
vistext Chart & Figure 9,969 0.5 52.3
websight Screenshot to Code 10,000 1.9 193.8
datikz Screenshot to Code 47,974 0.4 9.5
docvqa OCR & Document 10,189 6.4 651.4
spot_the_diff Image Difference 8,566 1.5 180.9
hitab Table Understanding 2,500 0.1 61.8
okvqa General VQA 9,009 262.1 30,509.0
ai2d Textbook & Academic 2,434 0.4 170.2
tqa Textbook & Academic 1,493 0.4 248.1
vsr Captioning 2,157 0.1 48.5
infographic_vqa OCR & Document 2,118 0.3 133.8
visualmrc OCR & Document 3,027 2.7 927.5
rendered_text OCR & Document 10,000 10.3 1,055.3
chartqa Chart & Figure 18,265 0.7 40.9
vqarad General VQA 313 0.02 49.7
intergps Reasoning & Math 1,280 0.02 18.0
tat_qa Table Understanding 2,199 0.07 31.3
diagram_image_to_text OCR & Document 300 0.02 59.7

报告生成说明: 本报告基于 The Cauldron 数据集的 dataset_info 元数据统计和 Dataset Card 中的类别标注生成。所有数值保留原始数据精度,分析结论基于统计推断。

posted @ 2026-07-05 18:35  Xu_Lin  阅读(10)  评论(0)    收藏  举报