The Cauldron 数据集分布分析报告
The Cauldron 数据集分布分析报告
数据集: HuggingFaceM4/the_cauldron
用途: Idefics2 视觉-语言模型微调训练数据
报告日期: 2025-07-05
数据集规模: 50 个子数据集 | 1,880,992 样本 | 424.6 GB
目录
1. 执行摘要
The Cauldron 是 Idefics2 视觉-语言模型发布时配套的大规模训练数据集,由 50 个 经过筛选的视觉-语言子数据集整合而成,覆盖 9 大任务类别,总计 1,880,992 条 训练样本,原始存储体积约 424.6 GB。
本报告通过对该数据集的多维度统计分析,揭示以下核心发现:
- 样本分布呈高度偏斜的长尾形态:前 16 个数据集(32%)贡献了 80% 的样本,尾部 34 个数据集仅贡献 20%。
- 存储与样本严重不对等:General VQA 类别以 14.7% 的样本量占据了 67.3% 的存储空间,其根本原因是 okvqa 子数据集的异常大体积。
- okvqa 为极端异常值:仅 9,009 条样本(0.48%)却独占 262.1 GB(61.7% 的总存储),单样本平均 30.5 MB,是均值的 40 倍。
- Chart & Figure 类别样本最密集:以 29.2% 的样本量仅占用 4.2% 的存储,单样本仅 43 KB,数据效率极高。
2. 数据集总体概况
2.1 基本统计指标
| 指标 | 数值 |
|---|---|
| 子数据集数量 | 50 |
| 总样本数 | 1,880,992 |
| 总数据集大小 | 424.6 GB |
| 总下载大小 | 157.3 GB |
| 平均每数据集样本数 | 37,620 |
| 平均每数据集大小 | 8.5 GB |
| 样本数量中位数 | 16,134 |
| 样本数量标准差 | 50,572 |
| 变异系数 | 1.34 |
2.2 任务类别覆盖
The Cauldron 涵盖 9 大视觉-语言任务类别,体现了全面的任务覆盖策略:
| 类别 | 数据集数 | 占比 |
|---|---|---|
| OCR & Document | 10 | 20.0% |
| Table Understanding | 8 | 16.0% |
| General VQA | 8 | 16.0% |
| Chart & Figure | 7 | 14.0% |
| Reasoning & Math | 6 | 12.0% |
| Captioning | 3 | 6.0% |
| Textbook & Academic | 3 | 6.0% |
| Image Difference | 3 | 6.0% |
| Screenshot to Code | 2 | 4.0% |
观察: OCR & Document、Table Understanding、General VQA 三类占据了 52% 的数据集数量,反映了 Idefics2 在文档理解和结构化推理方面的能力侧重。
3. 各类别分布分析
3.1 样本数量分布
按样本总量排序的 9 大类别分布如下:
| 排名 | 类别 | 总样本数 | 占比 | 数据集数 | 平均样本/数据集 |
|---|---|---|---|---|---|
| 1 | Chart & Figure | 549,682 | 29.2% | 7 | 78,526 |
| 2 | General VQA | 276,466 | 14.7% | 8 | 34,558 |
| 3 | OCR & Document | 258,196 | 13.7% | 10 | 25,820 |
| 4 | Reasoning & Math | 219,890 | 11.7% | 6 | 36,648 |
| 5 | Captioning | 217,885 | 11.6% | 3 | 72,628 |
| 6 | Table Understanding | 162,065 | 8.6% | 8 | 20,258 |
| 7 | Image Difference | 129,931 | 6.9% | 3 | 43,310 |
| 8 | Screenshot to Code | 57,974 | 3.1% | 2 | 28,987 |
| 9 | Textbook & Academic | 8,903 | 0.5% | 3 | 2,968 |

图 1: 各类别样本数量分布 —— Chart & Figure 以近 55 万条样本占据首位,Textbook & Academic 仅 8,903 条。
关键观察:
- Chart & Figure 以近 55 万条样本占据首位,主要由 dvqa(200,000)、plotqa(157,070)和 figureqa(100,000)三个大型数据集驱动。
- Captioning 虽仅有 3 个数据集,但凭借 localized_narratives(~200,000 样本)的平均值高达 72,628,效率极高。
- Textbook & Academic 最为稀疏,仅 8,903 条样本(0.5%),覆盖 ai2d、tqa、scienceqa 三个学术问答数据集。
3.2 存储大小分布
| 排名 | 类别 | 总大小 (GB) | 占比 | 单样本平均 (KB) |
|---|---|---|---|---|
| 1 | General VQA | 285.8 | 67.3% | 3,934.6 |
| 2 | OCR & Document | 37.6 | 8.9% | 368.2 |
| 3 | Reasoning & Math | 25.7 | 6.1% | 85.0 |
| 4 | Captioning | 21.6 | 5.1% | 85.6 |
| 5 | Image Difference | 21.1 | 5.0% | 174.3 |
| 6 | Chart & Figure | 17.7 | 4.2% | 43.3 |
| 7 | Table Understanding | 11.8 | 2.8% | 70.5 |
| 8 | Screenshot to Code | 2.3 | 0.5% | 103.1 |
| 9 | Textbook & Academic | 1.0 | 0.2% | 159.8 |
关键观察:
- General VQA 的存储占比(67.3%)远超其样本占比(14.7%),单样本平均近 4 MB,原因完全是 okvqa 的异常值效应。
- Chart & Figure 的存储占比(4.2%)远低于其样本占比(29.2%),单样本仅 43 KB,数据压缩率极高。这类数据以程序生成的图表为主,图像结构简单、色彩单一,天然适合高效存储。
- 排除 okvqa 后,整体数据集大小将缩减至约 162.5 GB(减少 61.7%),而样本仅减少 0.48%。

图 2: 各类别存储大小分布 —— General VQA 以 285.8 GB 独占 67.3% 的存储空间,远超其他类别。

图 3: 各类别样本占比 —— Chart & Figure 贡献 29.2% 的样本,为最大类别;9 大类别合计 1,880,992 条样本。
4. 样本数量分布特征
4.1 整体分布统计
| 统计量 | 数值 |
|---|---|
| 最小值 | 300 (diagram_image_to_text) |
| 最大值 | 200,000 (dvqa) |
| 中位数 | 16,134 |
| 平均值 | 37,620 |
| 标准差 | 50,572 |
| 变异系数 | 1.34 |
分布特征: 变异系数为 1.34(> 1),表明样本数量分布呈 强离散状态,数据高度不均匀。平均值(37,620)远高于中位数(16,134),进一步印证了右偏(正偏态)分布特征。
4.2 Top 10 数据集明细
| 排名 | 数据集 | 类别 | 样本数 | 占比 | 累计占比 |
|---|---|---|---|---|---|
| 1 | dvqa | Chart & Figure | 200,000 | 10.6% | 10.6% |
| 2 | localized_narratives | Captioning | 199,998 | 10.6% | 21.3% |
| 3 | ocrvqa | OCR & Document | 165,746 | 8.8% | 30.1% |
| 4 | plotqa | Chart & Figure | 157,070 | 8.4% | 38.4% |
| 5 | figureqa | Chart & Figure | 100,000 | 5.3% | 43.7% |
| 6 | tallyqa | General VQA | 98,680 | 5.2% | 49.0% |
| 7 | vqav2 | General VQA | 82,772 | 4.4% | 53.4% |
| 8 | robut_wikisql | Table Understanding | 74,989 | 4.0% | 57.3% |
| 9 | mimic_cgd | Image Difference | 70,939 | 3.8% | 61.1% |
| 10 | clevr_math | Reasoning & Math | 70,000 | 3.7% | 64.9% |

图 4: 各数据集样本数量排序与累计占比 —— dvqa(200,000)和 localized_narratives(199,998)为最大数据集;前 16 个数据集(32%)贡献了 80% 的样本,呈现典型的长尾分布。
4.3 Bottom 10 数据集明细
| 排名 | 数据集 | 类别 | 样本数 | 占比 |
|---|---|---|---|---|
| 41 | tat_qa | Table Understanding | 2,199 | 0.12% |
| 42 | intergps | Reasoning & Math | 1,280 | 0.07% |
| 43 | tqa | Textbook & Academic | 1,493 | 0.08% |
| 44 | vsr | Captioning | 2,157 | 0.11% |
| 45 | infographic_vqa | OCR & Document | 2,118 | 0.11% |
| 46 | hitab | Table Understanding | 2,500 | 0.13% |
| 47 | scienceqa | Textbook & Academic | 4,976 | 0.26% |
| 48 | vqarad | General VQA | 313 | 0.02% |
| 49 | ai2d | Textbook & Academic | 2,434 | 0.13% |
| 50 | diagram_image_to_text | OCR & Document | 300 | 0.02% |
5. 存储大小分布分析
5.1 按存储排序的 Top 10 数据集
| 排名 | 数据集 | 类别 | 大小 (GB) | 占比 | 单样本 (KB) |
|---|---|---|---|---|---|
| 1 | okvqa | General VQA | 262.1 | 61.7% | 30,509 |
| 2 | localized_narratives | Captioning | 19.9 | 4.7% | 102 |
| 3 | clevr_math | Reasoning & Math | 12.4 | 2.9% | 182 |
| 4 | clevr | Reasoning & Math | 10.7 | 2.5% | 161 |
| 5 | vqav2 | General VQA | 9.9 | 2.3% | 124 |
| 6 | nlvr2 | Image Difference | 7.8 | 1.8% | 164 |
| 7 | docvqa | OCR & Document | 6.4 | 1.5% | 674 |
| 8 | ocrvqa | OCR & Document | 5.1 | 1.2% | 32 |
| 9 | plotqa | Chart & Figure | 7.3 | 1.7% | 49 |
| 10 | textvqa | OCR & Document | 5.5 | 1.3% | 268 |
关键发现: okvqa 以绝对压倒性的 262.1 GB 占据总存储的 61.7%,是第二名 localized_narratives(19.9 GB)的 13.2 倍。这一异常现象值得特别关注(详见第 8 节)。
5.2 存储最小数据集
| 数据集 | 大小 (MB) | 类别 |
|---|---|---|
| vqarad | 15.8 | General VQA |
| diagram_image_to_text | 18.0 | OCR & Document |
| intergps | 23.8 | Reasoning & Math |
| tat_qa | 69.8 | Table Understanding |
| infographic_vqa | 278.3 | OCR & Document |
6. 样本密度与存储效率分析
6.1 单样本平均大小分布
| 类别 | 单样本平均 (KB) | 特征 |
|---|---|---|
| Chart & Figure | 43.3 | 程序生成图表,结构简单,效率最高 |
| Table Understanding | 70.5 | 结构化表格数据,以文本为主 |
| Reasoning & Math | 85.0 | 合成场景图像(CLEVR),尺寸标准化 |
| Captioning | 85.6 | 自然图像+文本描述 |
| Screenshot to Code | 103.1 | 网页截图,分辨率可控 |
| Textbook & Academic | 159.8 | 教材截图,中等分辨率 |
| Image Difference | 174.3 | 双图对比任务,含成对图像 |
| OCR & Document | 368.2 | 高分辨率文档扫描件 |
| General VQA | 3,934.6 | 被 okvqa 严重扭曲 |
6.2 各数据集单样本大小 Top 10
| 排名 | 数据集 | 类别 | 单样本 (KB) |
|---|---|---|---|
| 1 | okvqa | General VQA | 30,509 |
| 2 | rendered_text | OCR & Document | 1,082 |
| 3 | visualmrc | OCR & Document | 948 |
| 4 | docvqa | OCR & Document | 674 |
| 5 | hateful_memes | General VQA | 348 |
| 6 | visual7w | General VQA | 302 |
| 7 | textvqa | OCR & Document | 268 |
| 8 | textcaps | OCR & Document | 267 |
| 9 | tqa | Textbook & Academic | 248 |
| 10 | websight | Screenshot to Code | 193 |
观察: 单样本大小分布跨越了 3 个数量级(从 iconqa 的 9.5 KB 到 okvqa 的 30,509 KB),这种极端差异在数据加载和批处理时需要特别关注内存管理。

图 5: 样本数量 vs. 存储大小散点图(对数坐标)—— okvqa 为显著离群点(低样本数、极高存储);localized_narratives 和 dvqa 为高样本数、中等存储的代表性数据集。

图 6: 各数据集平均样本大小 —— okvqa 以 30,509 KB/样本为极端离群值,iconqa(9.5 KB)和 tabmwp(11.4 KB)为存储效率最高的数据集。
7. 帕累托分布与长尾效应
7.1 帕累托分析
将 50 个数据集按样本数量降序排列,计算累计贡献:
| 累计占比 | 所需数据集数 | 数据集占比 |
|---|---|---|
| 50% | 6 | 12% |
| 64.9% | 10 | 20% |
| 80% | 16 | 32% |
| 90% | 24 | 48% |
| 100% | 50 | 100% |
结论: The Cauldron 的样本分布呈现典型的 帕累托/长尾分布——少数头部数据集贡献了绝大多数样本,而大量尾部数据集仅贡献少量样本。
7.2 长尾部分的组成
后 34 个数据集(68% 的数据集数量)仅贡献了 20% 的样本,这些尾部数据集主要包含:
- 特殊领域数据: 医学影像问答(vqarad)、几何推理(geomverse)、导航地图(mapqa)
- 小规模精品数据: 教科书问答(ai2d, tqa, scienceqa)、图表描述(diagram_image_to_text)
- 新兴任务数据: 网页转代码(websight, datikz)、差异检测(spot_the_diff)
虽然单个体量小,但这些尾部数据集覆盖了头部数据集无法触及的特殊能力维度,对模型的泛化能力至关重要。
8. 异常值深度分析
8.1 okvqa — 极端异常值
| 属性 | 数值 | 与均值比值 |
|---|---|---|
| 样本数 | 9,009 | 0.24x |
| 数据大小 | 262.1 GB | 30.9x |
| 单样本平均 | 30,509 KB | 40.3x |
| 占总存储比 | 61.7% | — |
| 占总样本比 | 0.48% | — |
可能原因分析:
- 高分辨率图像: okvqa 数据集(OK-VQA)需要丰富的外部知识来回答视觉问题,其原始图像可能来自多源聚合,包含大量高分辨率自然照片。
- 图像预处理差异: 与其他经过压缩或标准化处理的子数据集不同,okvqa 可能保留了原始未压缩的图像文件。
- 数据格式差异: okvqa 的 num_bytes(实际数据体积)与 download_size(3 MB)之间存在巨大差异,说明该数据集的实际展开体积远大于下载体积,可能涉及复杂的图像解码或重复存储。
影响评估:
- 正面: okvqa 作为外部知识 VQA 的代表数据集,其高质量图像有助于模型学习视觉-知识关联。
- 负面: 在训练过程中,okvqa 批次将产生不成比例的内存占用和 I/O 压力,可能需要特殊的批次构造策略。
8.2 clevr_math — 下载大小异常
| 属性 | 数值 |
|---|---|
| 数据集大小 | 12.4 GB |
| 下载大小 | 15.6 MB |
| 压缩比 | ~800x |
clevr_math 的 download_size 异常小(15.6 MB),而数据集大小达 12.4 GB,这意味着该数据集在加载时会通过程序实时生成图像(CLEVR 系列以程序化场景生成为特点),而非存储静态图像文件。
9. 关键发现与结论
9.1 核心发现汇总
| # | 发现 | 影响等级 |
|---|---|---|
| 1 | 样本分布高度偏斜,Top 10 数据集贡献 64.9% 样本 | 高 |
| 2 | okvqa 独占 61.7% 存储但仅贡献 0.48% 样本 | 极高 |
| 3 | Chart & Figure 以 4.2% 存储贡献 29.2% 样本,效率最高 | 中 |
| 4 | 50 个数据集覆盖 9 大任务类别,任务覆盖全面 | 中 |
| 5 | 单样本大小跨越 3 个数量级(9.5 KB ~ 30,509 KB) | 高 |
| 6 | 帕累托效应显著:32% 数据集贡献 80% 样本 | 中 |
| 7 | Textbook & Academic 类别最为稀疏(0.5% 样本) | 低 |
| 8 | CLEVR 系列采用程序生成,下载体积极小 | 低 |
9.2 结构性观察
任务类别的设计意图: The Cauldron 的 9 大类别设计体现了对视觉-语言模型能力的全面规划:
- 感知层: Captioning、General VQA —— 基础视觉理解
- 认知层: OCR & Document、Chart & Figure、Table Understanding —— 结构化信息提取
- 推理层: Reasoning & Math、Textbook & Academic —— 逻辑与知识推理
- 特殊能力: Image Difference、Screenshot to Code —— 差异化与代码生成能力
数据-效率权衡: 数据集在数量和存储之间做出了明确的权衡——优先保证任务覆盖的全面性(50 个数据集、9 大类别),而非追求各数据集之间的体量均衡。
10. 训练实践建议
10.1 数据采样策略
建议 1: 逆频率加权采样
由于样本分布高度偏斜,建议采用基于数据集样本数量的逆频率加权策略,避免模型过度拟合到头部数据集:
weight_i = (total_samples / n_datasets) / samples_i
这将赋予尾部数据集更高的采样概率,促进模型在稀有任务上的学习能力。
建议 2: okvqa 特殊处理
| 方案 | 描述 | 适用场景 |
|---|---|---|
| A | 保留完整 okvqa,使用较小批次 | 存储充足,追求最佳性能 |
| B | 对 okvqa 图像进行预压缩/降采样 | 存储受限,平衡性能与资源 |
| C | 排除 okvqa,释放 61.7% 存储 | 严格存储约束,快速实验 |
| D | 将 okvqa 拆分为多个子批次 | 显存受限,分布式训练 |
10.2 数据加载优化
建议 3: 分层批次构造
由于单样本大小跨越 3 个数量级,建议:
- 按数据体积分层: 将数据集分为"大图像"(> 500 KB/sample)和"小图像"(<= 500 KB/sample)两组
- 动态批次大小: 对 Chart & Figure、Table Understanding 等小样本数据集使用较大批次;对 okvqa、docvqa 等大样本数据集使用较小批次
- 预加载与缓存: 对尾部小数据集(< 2,000 样本)可完全缓存至内存,减少重复 I/O
建议 4: 混合精度加载
对于 rendered_text(1,082 KB/sample)、visualmrc(948 KB/sample)等高分辨率 OCR 数据集,可考虑在数据加载阶段进行动态降采样,平衡视觉细节与内存占用。
10.3 训练监控指标
建议训练过程中特别关注以下指标以检测数据不平衡问题:
- 类别级损失: 监控各任务类别的验证损失,确保尾部类别(Textbook & Academic、Screenshot to Code)的学习进度
- 梯度范数: 监控来自 okvqa 批次的梯度范数,防止其过大体积导致梯度爆炸
- 采样覆盖率: 确保每个 epoch 内所有 50 个数据集至少被采样一次
10.4 数据子集快速实验
如需快速迭代实验,建议按以下优先级构建数据子集:
| 优先级 | 数据集 | 理由 |
|---|---|---|
| P0 | Chart & Figure(排除 dvqa/plotqa) | 29.2% 样本,仅 4.2% 存储 |
| P1 | Reasoning & Math + Table Understanding | 20.3% 样本,结构清晰 |
| P2 | OCR & Document(排除 docvqa) | 13.7% 样本,实用能力 |
| P3 | Captioning + General VQA(排除 okvqa) | 26.3% 样本,基础能力 |
| P4 | 全部尾部类别 | 特殊能力维度 |
| P5 | okvqa | 视存储情况决定是否纳入 |
附录: 50 个数据集完整统计
| 数据集 | 类别 | 样本数 | 大小 (GB) | 单样本 (KB) |
|---|---|---|---|---|
| dvqa | Chart & Figure | 200,000 | 3.4 | 17.5 |
| localized_narratives | Captioning | 199,998 | 19.9 | 101.9 |
| ocrvqa | OCR & Document | 165,746 | 5.1 | 31.8 |
| plotqa | Chart & Figure | 157,070 | 7.3 | 48.5 |
| figureqa | Chart & Figure | 100,000 | 1.8 | 18.3 |
| tallyqa | General VQA | 98,680 | 4.0 | 41.5 |
| vqav2 | General VQA | 82,772 | 9.9 | 122.5 |
| robut_wikisql | Table Understanding | 74,989 | 5.5 | 75.3 |
| mimic_cgd | Image Difference | 70,939 | 11.7 | 169.4 |
| clevr_math | Reasoning & Math | 70,000 | 12.4 | 181.7 |
| clevr | Reasoning & Math | 70,000 | 10.7 | 161.4 |
| raven | Reasoning & Math | 42,000 | 1.4 | 34.8 |
| nlvr2 | Image Difference | 50,426 | 7.8 | 158.5 |
| robut_wtq | Table Understanding | 38,246 | 3.7 | 100.5 |
| mapqa | Chart & Figure | 37,417 | 3.0 | 80.9 |
| iconqa | Reasoning & Math | 27,315 | 0.3 | 9.5 |
| chart2text | Chart & Figure | 26,985 | 1.0 | 38.8 |
| tabmwp | Table Understanding | 22,729 | 0.3 | 11.4 |
| cocoqa | General VQA | 46,287 | 2.1 | 46.1 |
| textcaps | OCR & Document | 21,953 | 5.5 | 256.8 |
| textvqa | OCR & Document | 21,953 | 5.5 | 261.8 |
| screen2words | Captioning | 15,730 | 1.6 | 101.5 |
| st_vqa | OCR & Document | 17,247 | 0.6 | 38.3 |
| aokvqa | General VQA | 16,539 | 0.8 | 49.6 |
| geomverse | Reasoning & Math | 9,303 | 0.9 | 99.8 |
| multihiertt | Table Understanding | 7,619 | 1.3 | 170.9 |
| visual7w | General VQA | 14,366 | 4.1 | 293.2 |
| finqa | Table Understanding | 5,276 | 0.1 | 25.0 |
| hateful_memes | General VQA | 8,500 | 2.8 | 337.3 |
| robut_sqa | Table Understanding | 8,514 | 0.6 | 77.7 |
| scienceqa | Textbook & Academic | 4,976 | 0.3 | 54.7 |
| iam | OCR & Document | 5,663 | 1.1 | 194.8 |
| vistext | Chart & Figure | 9,969 | 0.5 | 52.3 |
| websight | Screenshot to Code | 10,000 | 1.9 | 193.8 |
| datikz | Screenshot to Code | 47,974 | 0.4 | 9.5 |
| docvqa | OCR & Document | 10,189 | 6.4 | 651.4 |
| spot_the_diff | Image Difference | 8,566 | 1.5 | 180.9 |
| hitab | Table Understanding | 2,500 | 0.1 | 61.8 |
| okvqa | General VQA | 9,009 | 262.1 | 30,509.0 |
| ai2d | Textbook & Academic | 2,434 | 0.4 | 170.2 |
| tqa | Textbook & Academic | 1,493 | 0.4 | 248.1 |
| vsr | Captioning | 2,157 | 0.1 | 48.5 |
| infographic_vqa | OCR & Document | 2,118 | 0.3 | 133.8 |
| visualmrc | OCR & Document | 3,027 | 2.7 | 927.5 |
| rendered_text | OCR & Document | 10,000 | 10.3 | 1,055.3 |
| chartqa | Chart & Figure | 18,265 | 0.7 | 40.9 |
| vqarad | General VQA | 313 | 0.02 | 49.7 |
| intergps | Reasoning & Math | 1,280 | 0.02 | 18.0 |
| tat_qa | Table Understanding | 2,199 | 0.07 | 31.3 |
| diagram_image_to_text | OCR & Document | 300 | 0.02 | 59.7 |
报告生成说明: 本报告基于 The Cauldron 数据集的
dataset_info元数据统计和 Dataset Card 中的类别标注生成。所有数值保留原始数据精度,分析结论基于统计推断。

浙公网安备 33010602011771号