OpenSeek-100B 预训练数据集分布分析报告

OpenSeek-100B 预训练数据集分布分析报告

数据集: BAAI/OpenSeek-Pretrain-100B
版本: v1.0
基础来源: CCI4.0-M2 v1
报告日期: 2025-07-05
数据规模: 79 个条目 | 109.73B Tokens | 11 大 Domain


目录

  1. 执行摘要
  2. 数据集总体概况
  3. Domain 分布分析
  4. CoT Synthesis 深度分析
  5. Nemotron-CC 处理分析
  6. 中英文分布
  7. Quality Tier 分析
  8. 极值与头部数据集
  9. 关键发现与结论
  10. 训练实践建议

1. 执行摘要

OpenSeek-100B 是 BAAI 发布的预训练数据集采样版本,源自 CCI4.0-M2 v1,总计 109.73B Tokens,包含英文/中文网页数据、领域专用数据以及 Chain-of-Thought 推理合成数据三大类。本报告通过对 79 个数据条目的多维度统计分析,揭示以下核心发现:

  • CoT Synthesis 是绝对核心:占比高达 66.7%(73.16B),远超自然数据(33.3%),体现 OpenSeek 以推理能力为核心导向的数据构建策略。
  • 学术类数据占据主导:arXiv + Pes2o + CoT arXiv 合计 63.83B(58.2%),模型训练以学术论文为核心知识来源。
  • 中英文极度不均衡:英文占 94.3%,中文仅占 5.7%
  • Quality Tier 设计合理:high/mid/low 三档分布为 41.0% / 32.7% / 26.2%,梯度清晰。

2. 数据集总体概况

2.1 基本统计指标

指标 数值
数据条目数 79
总 Token 数 109.73B
目标规模 100B(实际 109.73B,超额 9.7%)
Domain 类别数 11
CoT 版本 v1 + v2

2.2 数据构成全景

OpenSeek-100B 的数据构成体现了"以推理为中心"的设计哲学。数据集由三大板块组成:

板块一:CoT Synthesis(Chain-of-Thought 合成数据) — 73.16B(66.7%)

  • 基于 arXiv、Code、Math、Wiki、Web CC、Open Source 六大来源合成
  • 包含 v1 和 v2 两个版本,v2 规模更大(43.22B vs 29.94B)

板块二:英文网页数据(Nemotron-CC) — 11.90B(10.8%)

  • 包含 actual(原始)和 synthetic(蒸馏/知识提取/问答对生成等)两类处理流程
  • 按 quality tier(high/medium/low)和 synthesis method 细分

板块三:领域专用数据 — 24.67B(22.5%)

  • 学术:Pes2o(7.87B)、arXiv(0.66B)
  • 数学:Math(5.30B)
  • 代码:Code(3.22B)、Stack(0.44B)
  • 中文:zh_cc(6.29B)
  • 百科:Wiki(0.43B)
  • 书籍:Books(0.48B)

3. Domain 分布分析

3.1 Domain Token 分布

openseek_domain_distribution

排名 Domain Tokens 占比 条目数
1 CoT Synthesis v2 43.22B 39.4% 18
2 CoT Synthesis v1 29.94B 27.3% 18
3 Nemotron-CC (EN Web) 11.90B 10.8% 24
4 Pes2o 7.87B 7.2% 3
5 zh_cc (CN Web) 6.29B 5.7% 6
6 Math 5.30B 4.8% 3
7 Code 3.22B 2.9% 3
8 arXiv 0.66B 0.6% 1
9 Books 0.48B 0.4% 1
10 Stack 0.44B 0.4% 1
11 Wiki 0.43B 0.4% 1

3.2 关键观察

  • CoT Synthesis 合计 73.16B(66.7%),是数据集的绝对主体,远超 Nemotron-CC 的 11.90B。
  • v2 版本 > v1 版本:CoT Synthesis v2(43.22B)比 v1(29.94B)多 44.4%,说明 v2 是迭代优化的增强版本。
  • 头部 3 个 Domain 占 77.5%:CoT v2 + CoT v1 + Nemotron-CC 合计 85.06B。
  • Pes2o 是单一最大的自然数据源(7.87B),超过 zh_cc(6.29B)和 Math(5.30B)。

4. CoT Synthesis 深度分析

4.1 CoT 数据来源分布

openseek_cot_source

来源 CoT v1 CoT v2 合计 占比
arXiv 22.78B 32.52B 55.30B 50.4%
Math 1.84B 3.41B 5.25B 4.8%
Code 1.41B 2.11B 3.52B 3.2%
Wiki 1.37B 2.08B 3.45B 3.1%
Web (CC) 0.63B 2.33B 2.96B 2.7%
Open Source 1.91B 0.77B 2.68B 2.4%

4.2 关键发现

arXiv 是 CoT 的绝对核心来源(55.30B,占全部数据的 50.4%):

  • CoT v1 的 arXiv 子集:22.78B
  • CoT v2 的 arXiv 子集:32.52B
  • v2 相对 v1 的 arXiv 增幅:42.8%

CoT v2 相对 v1 的演进方向

  • arXiv:+42.8%(学术论文推理深化)
  • Math:+85.3%(数学推理大幅增强)
  • Web (CC):+269.8%(网页数据利用显著提升)
  • Wiki:+51.8%(百科知识推理增强)
  • Code:+49.6%(代码推理增强)
  • Open Source:-59.7%(开源数据缩减)

结论:v2 版本的演进重点是强化学术论文和数学推理能力,同时大幅提升网页数据的利用,缩减了对开源数据的依赖。

4.3 CoT vs Natural Data 对比

openseek_waterfall_cot

类型 Tokens 占比
CoT Synthesis (v1+v2) 73.16B 66.7%
Natural Data 36.59B 33.3%

这是 OpenSeek-100B 最显著的特征 — CoT 合成数据占比超过 2/3。与 Llama、Qwen 等传统预训练数据以自然文本为主的设计相比,OpenSeek 选择了"推理优先"的数据构建策略,即通过大量 CoT 合成数据直接注入推理能力,而非仅靠模型规模涌现。


5. Nemotron-CC 处理分析

5.1 处理分布

openseek_nemotron_method

处理方法 Tokens 占比 (of Nemotron-CC)
actual(原始数据) 5.13B 43.1%
synthetic-wrap(包装增强) 2.97B 25.0%
synthetic-qa_pairs(问答对生成) 1.50B 12.6%
synthetic-extract_know(知识提取) 0.90B 7.6%
synthetic-know_list(知识列表) 0.70B 5.9%
synthetic-distill(蒸馏) 0.70B 5.9%

5.2 关键观察

  • 原始数据 vs 合成数据比例约为 4:6(43.1% vs 56.9%),合成数据略多于原始数据。
  • wrap(包装增强)是最主要的合成策略(2.97B),可能指对原始文本进行结构化包装、上下文扩展等处理。
  • diverse_qa_pairs(多样化问答对生成) 是第二大合成策略(1.50B),体现了通过问答形式增强数据互动性的设计思路。
  • distill(蒸馏)仅 0.70B,说明 Nemotron-CC 不依赖模型蒸馏作为主要的合成手段。
  • Nemotron-CC 整体仅占全数据集的 10.8%,说明 OpenSeek 的训练不重度依赖通用网页语料。

6. 中英文分布

openseek_tier_language

语言 Tokens 占比
English 103.46B 94.3%
Chinese 6.29B 5.7%

中文数据来源仅为 zh_cc(中文网页爬取) 的 6 个条目:

条目 Tokens Quality 说明
zh_cc-high-loss0 1.87B 高质量,最低损失
zh_cc-high-loss1 1.01B 高质量,次低损失
zh_cc-medidum-loss0 0.98B 中质量,最低损失
zh_cc-medidum-loss1 0.95B 中质量,次低损失
zh_cc-medidum-loss2 1.10B 中质量,最高损失
zh_cc-high-loss2 0.38B 高质量,最高损失

关键观察

  • 中文数据占比 5.7%(6.29B),比例偏低,可能对中文能力的训练不够充分。
  • zh_cc 使用 loss 值(loss0/loss1/loss2)而非 high/mid/low 进行质量分级,可能是基于模型困惑度(perplexity)的动态质量评估。
  • 中文数据无 CoT Synthesis 版本,推理能力可能主要依赖英文 CoT 的迁移学习。

7. Quality Tier 分析

7.1 Tier 分布

Tier Tokens 占比 (of tiered data)
high 40.99B 41.0%
mid 32.68B 32.7%
low 26.20B 26.2%

7.2 Tier 设计特征

  • high tier 占比最高(41.0%),体现"质量优先"的采样策略。
  • mid tier(32.7%)> low tier(26.2%),形成合理梯度。
  • 三档比例约为 4:3:2.5,并非严格的均匀分布,而是向高质量倾斜。
  • 不同 Domain 的 tier 命名规则不同:
    • Nemotron-CC / Code / Math:使用 high/mid/low
    • zh_cc:使用 loss0/loss1/loss2(基于困惑度评估)
    • CoT Synthesis:使用 high/mid/low(基于来源质量评估)

8. 极值与头部数据集

8.1 Top 10 子数据集

openseek_waterfall_cot

排名 数据集 Domain Tokens 占比
1 cot_synthesis2_arxiv-high CoT v2 arXiv 12.89B 11.7%
2 cot_synthesis2_arxiv-mid CoT v2 arXiv 10.45B 9.5%
3 cot_synthesis_arxiv-mid CoT v1 arXiv 9.21B 8.4%
4 cot_synthesis2_arxiv-low CoT v2 arXiv 9.18B 8.4%
5 cot_synthesis_arxiv-low CoT v1 arXiv 7.72B 7.0%
6 pes2o Academic 6.39B 5.8%
7 cot_synthesis_arxiv-high CoT v1 arXiv 5.85B 5.3%
8 cot_synthesis2_CC-mid CoT v2 Web 1.89B 1.7%
9 math-high Math 1.87B 1.7%
10 zh_cc-high-loss0 CN Web 1.87B 1.7%

8.2 长尾分析

  • Top 5 占比 45.1%:前 5 个数据集贡献了约 45% 的 Token。
  • Top 10 占比 64.7%:前 10 个数据集贡献了约 2/3 的 Token。
  • 帕累托效应显著:前 20 个数据集(占条目数 25.3%)贡献了约 80% 的 Token。
  • 尾部数据丰富:后 59 个数据集虽仅占约 20%,但覆盖了 Math、Code、Wiki、Books、Stack 等多个关键领域,对能力覆盖至关重要。

9. 关键发现与结论

9.1 核心发现汇总

# 发现 影响等级
1 CoT Synthesis 占 66.7%,是数据集的绝对主体 极高
2 arXiv 来源的 CoT 数据占全量 50.4%,学术导向明确 极高
3 学术类数据合计 63.83B(58.2%),远超其他类型 极高
4 v2 版本相对 v1 强化 Math(+85%)和 Web(+270%)
5 英文占 94.3%,中文仅 5.7%,语言分布极不均衡
6 Nemotron-CC 仅占 10.8%,通用网页数据比重低
7 Quality Tier 设计为 4:3:2.5 梯度,向高质量倾斜
8 Pes2o 是最大的单一自然数据源(7.87B)
9 Math 合计 10.55B(9.6%),含自然+CoT 双轨
10 Code 合计 7.18B(6.5%),含 Code+Stack+CoT Code

9.2 设计哲学解读

OpenSeek-100B 的数据设计体现了明确的"推理优先、学术驱动"哲学:

与传统预训练数据的差异

维度 OpenSeek-100B 传统预训练(如 Llama)
CoT 数据占比 66.7% < 5%
学术数据占比 58.2% ~10-20%
通用网页占比 10.8% 60-80%
推理注入方式 直接合成 规模涌现

核心假设:通过大规模 CoT 合成数据直接注入推理能力,而非依赖模型规模的自然涌现。这是一种"数据工程驱动"而非"规模驱动"的预训练策略。


10. 训练实践建议

10.1 采样策略

建议 1: Domain 平衡采样

由于 CoT arXiv 占 50.4%,建议采用逆频率加权:

weight_domain = total_tokens / (n_domains * domain_tokens)

确保 Math、Code、Wiki 等非 arXiv 领域获得足够的训练信号。

建议 2: CoT v1 / v2 混合比例

方案 v1 比例 v2 比例 适用场景
A 30% 70% 优先 v2 的增强推理
B 50% 50% 均衡利用两个版本
C 70% 30% 保守策略,减少 v2 风险

建议 3: 中英文协同

鉴于中文仅占 5.7%,建议:

  • 中文批次采用更高采样权重(2-3x)进行补偿
  • 或额外引入中文 CoT 合成数据
  • 监控中文评测集(C-Eval、CMMLU)的收敛情况

10.2 质量 Tier 使用策略

训练阶段 high mid low 策略说明
预热阶段 80% 15% 5% 高质量数据快速收敛
主训练阶段 40% 35% 25% 全 tier 均衡利用
退火阶段 60% 30% 10% 回归高质量精调

10.3 能力维度关注

能力维度 数据支撑 建议
学术论文理解 63.83B(58.2%) 充分,关注长文本处理
数学推理 10.55B(9.6%) 中等,可额外增强
代码能力 7.18B(6.5%) 偏弱,建议补充
中文能力 6.29B(5.7%) 偏弱,建议补充中文 CoT
百科知识 3.88B(3.5%) 偏弱,Wiki 数据较少

附录 A: 完整 Domain 统计

Domain 条目数 总 Tokens 平均 Tokens/条目
CoT Synthesis v2 18 43.22B 2.40B
CoT Synthesis v1 18 29.94B 1.66B
Nemotron-CC (EN Web) 24 11.90B 0.50B
Pes2o 3 7.87B 2.62B
zh_cc (CN Web) 6 6.29B 1.05B
Math 3 5.30B 1.77B
Code 3 3.22B 1.07B
arXiv 1 0.66B 0.66B
Books 1 0.48B 0.48B
Stack 1 0.44B 0.44B
Wiki 1 0.43B 0.43B

附录 B: CoT Synthesis 完整来源统计

来源 CoT v1 CoT v2 合计
arXiv 22.78B 32.52B 55.30B
Math 1.84B 3.41B 5.25B
Code 1.41B 2.11B 3.52B
Wiki 1.37B 2.08B 3.45B
Web (CC) 0.63B 2.33B 2.96B
Open Source 1.91B 0.77B 2.68B

报告生成说明: 本报告基于 OpenSeek-100B 数据集公开的 Data Composition 表格进行统计分析和可视化。所有 Token 数值保留原始数据精度,分析结论基于统计推断。

posted @ 2026-07-05 19:09  Xu_Lin  阅读(35)  评论(0)    收藏  举报