OpenSeek-100B 预训练数据集分布分析报告
OpenSeek-100B 预训练数据集分布分析报告
数据集: BAAI/OpenSeek-Pretrain-100B
版本: v1.0
基础来源: CCI4.0-M2 v1
报告日期: 2025-07-05
数据规模: 79 个条目 | 109.73B Tokens | 11 大 Domain
目录
- 执行摘要
- 数据集总体概况
- Domain 分布分析
- CoT Synthesis 深度分析
- Nemotron-CC 处理分析
- 中英文分布
- Quality Tier 分析
- 极值与头部数据集
- 关键发现与结论
- 训练实践建议
1. 执行摘要
OpenSeek-100B 是 BAAI 发布的预训练数据集采样版本,源自 CCI4.0-M2 v1,总计 109.73B Tokens,包含英文/中文网页数据、领域专用数据以及 Chain-of-Thought 推理合成数据三大类。本报告通过对 79 个数据条目的多维度统计分析,揭示以下核心发现:
- CoT Synthesis 是绝对核心:占比高达 66.7%(73.16B),远超自然数据(33.3%),体现 OpenSeek 以推理能力为核心导向的数据构建策略。
- 学术类数据占据主导:arXiv + Pes2o + CoT arXiv 合计 63.83B(58.2%),模型训练以学术论文为核心知识来源。
- 中英文极度不均衡:英文占 94.3%,中文仅占 5.7%。
- Quality Tier 设计合理:high/mid/low 三档分布为 41.0% / 32.7% / 26.2%,梯度清晰。
2. 数据集总体概况
2.1 基本统计指标
| 指标 | 数值 |
|---|---|
| 数据条目数 | 79 |
| 总 Token 数 | 109.73B |
| 目标规模 | 100B(实际 109.73B,超额 9.7%) |
| Domain 类别数 | 11 |
| CoT 版本 | v1 + v2 |
2.2 数据构成全景
OpenSeek-100B 的数据构成体现了"以推理为中心"的设计哲学。数据集由三大板块组成:
板块一:CoT Synthesis(Chain-of-Thought 合成数据) — 73.16B(66.7%)
- 基于 arXiv、Code、Math、Wiki、Web CC、Open Source 六大来源合成
- 包含 v1 和 v2 两个版本,v2 规模更大(43.22B vs 29.94B)
板块二:英文网页数据(Nemotron-CC) — 11.90B(10.8%)
- 包含 actual(原始)和 synthetic(蒸馏/知识提取/问答对生成等)两类处理流程
- 按 quality tier(high/medium/low)和 synthesis method 细分
板块三:领域专用数据 — 24.67B(22.5%)
- 学术:Pes2o(7.87B)、arXiv(0.66B)
- 数学:Math(5.30B)
- 代码:Code(3.22B)、Stack(0.44B)
- 中文:zh_cc(6.29B)
- 百科:Wiki(0.43B)
- 书籍:Books(0.48B)
3. Domain 分布分析
3.1 Domain Token 分布

| 排名 | Domain | Tokens | 占比 | 条目数 |
|---|---|---|---|---|
| 1 | CoT Synthesis v2 | 43.22B | 39.4% | 18 |
| 2 | CoT Synthesis v1 | 29.94B | 27.3% | 18 |
| 3 | Nemotron-CC (EN Web) | 11.90B | 10.8% | 24 |
| 4 | Pes2o | 7.87B | 7.2% | 3 |
| 5 | zh_cc (CN Web) | 6.29B | 5.7% | 6 |
| 6 | Math | 5.30B | 4.8% | 3 |
| 7 | Code | 3.22B | 2.9% | 3 |
| 8 | arXiv | 0.66B | 0.6% | 1 |
| 9 | Books | 0.48B | 0.4% | 1 |
| 10 | Stack | 0.44B | 0.4% | 1 |
| 11 | Wiki | 0.43B | 0.4% | 1 |
3.2 关键观察
- CoT Synthesis 合计 73.16B(66.7%),是数据集的绝对主体,远超 Nemotron-CC 的 11.90B。
- v2 版本 > v1 版本:CoT Synthesis v2(43.22B)比 v1(29.94B)多 44.4%,说明 v2 是迭代优化的增强版本。
- 头部 3 个 Domain 占 77.5%:CoT v2 + CoT v1 + Nemotron-CC 合计 85.06B。
- Pes2o 是单一最大的自然数据源(7.87B),超过 zh_cc(6.29B)和 Math(5.30B)。
4. CoT Synthesis 深度分析
4.1 CoT 数据来源分布

| 来源 | CoT v1 | CoT v2 | 合计 | 占比 |
|---|---|---|---|---|
| arXiv | 22.78B | 32.52B | 55.30B | 50.4% |
| Math | 1.84B | 3.41B | 5.25B | 4.8% |
| Code | 1.41B | 2.11B | 3.52B | 3.2% |
| Wiki | 1.37B | 2.08B | 3.45B | 3.1% |
| Web (CC) | 0.63B | 2.33B | 2.96B | 2.7% |
| Open Source | 1.91B | 0.77B | 2.68B | 2.4% |
4.2 关键发现
arXiv 是 CoT 的绝对核心来源(55.30B,占全部数据的 50.4%):
- CoT v1 的 arXiv 子集:22.78B
- CoT v2 的 arXiv 子集:32.52B
- v2 相对 v1 的 arXiv 增幅:42.8%
CoT v2 相对 v1 的演进方向:
- arXiv:+42.8%(学术论文推理深化)
- Math:+85.3%(数学推理大幅增强)
- Web (CC):+269.8%(网页数据利用显著提升)
- Wiki:+51.8%(百科知识推理增强)
- Code:+49.6%(代码推理增强)
- Open Source:-59.7%(开源数据缩减)
结论:v2 版本的演进重点是强化学术论文和数学推理能力,同时大幅提升网页数据的利用,缩减了对开源数据的依赖。
4.3 CoT vs Natural Data 对比

| 类型 | Tokens | 占比 |
|---|---|---|
| CoT Synthesis (v1+v2) | 73.16B | 66.7% |
| Natural Data | 36.59B | 33.3% |
这是 OpenSeek-100B 最显著的特征 — CoT 合成数据占比超过 2/3。与 Llama、Qwen 等传统预训练数据以自然文本为主的设计相比,OpenSeek 选择了"推理优先"的数据构建策略,即通过大量 CoT 合成数据直接注入推理能力,而非仅靠模型规模涌现。
5. Nemotron-CC 处理分析
5.1 处理分布

| 处理方法 | Tokens | 占比 (of Nemotron-CC) |
|---|---|---|
| actual(原始数据) | 5.13B | 43.1% |
| synthetic-wrap(包装增强) | 2.97B | 25.0% |
| synthetic-qa_pairs(问答对生成) | 1.50B | 12.6% |
| synthetic-extract_know(知识提取) | 0.90B | 7.6% |
| synthetic-know_list(知识列表) | 0.70B | 5.9% |
| synthetic-distill(蒸馏) | 0.70B | 5.9% |
5.2 关键观察
- 原始数据 vs 合成数据比例约为 4:6(43.1% vs 56.9%),合成数据略多于原始数据。
- wrap(包装增强)是最主要的合成策略(2.97B),可能指对原始文本进行结构化包装、上下文扩展等处理。
- diverse_qa_pairs(多样化问答对生成) 是第二大合成策略(1.50B),体现了通过问答形式增强数据互动性的设计思路。
- distill(蒸馏)仅 0.70B,说明 Nemotron-CC 不依赖模型蒸馏作为主要的合成手段。
- Nemotron-CC 整体仅占全数据集的 10.8%,说明 OpenSeek 的训练不重度依赖通用网页语料。
6. 中英文分布

| 语言 | Tokens | 占比 |
|---|---|---|
| English | 103.46B | 94.3% |
| Chinese | 6.29B | 5.7% |
中文数据来源仅为 zh_cc(中文网页爬取) 的 6 个条目:
| 条目 | Tokens | Quality 说明 |
|---|---|---|
| zh_cc-high-loss0 | 1.87B | 高质量,最低损失 |
| zh_cc-high-loss1 | 1.01B | 高质量,次低损失 |
| zh_cc-medidum-loss0 | 0.98B | 中质量,最低损失 |
| zh_cc-medidum-loss1 | 0.95B | 中质量,次低损失 |
| zh_cc-medidum-loss2 | 1.10B | 中质量,最高损失 |
| zh_cc-high-loss2 | 0.38B | 高质量,最高损失 |
关键观察:
- 中文数据占比 5.7%(6.29B),比例偏低,可能对中文能力的训练不够充分。
- zh_cc 使用 loss 值(loss0/loss1/loss2)而非 high/mid/low 进行质量分级,可能是基于模型困惑度(perplexity)的动态质量评估。
- 中文数据无 CoT Synthesis 版本,推理能力可能主要依赖英文 CoT 的迁移学习。
7. Quality Tier 分析
7.1 Tier 分布
| Tier | Tokens | 占比 (of tiered data) |
|---|---|---|
| high | 40.99B | 41.0% |
| mid | 32.68B | 32.7% |
| low | 26.20B | 26.2% |
7.2 Tier 设计特征
- high tier 占比最高(41.0%),体现"质量优先"的采样策略。
- mid tier(32.7%)> low tier(26.2%),形成合理梯度。
- 三档比例约为 4:3:2.5,并非严格的均匀分布,而是向高质量倾斜。
- 不同 Domain 的 tier 命名规则不同:
- Nemotron-CC / Code / Math:使用 high/mid/low
- zh_cc:使用 loss0/loss1/loss2(基于困惑度评估)
- CoT Synthesis:使用 high/mid/low(基于来源质量评估)
8. 极值与头部数据集
8.1 Top 10 子数据集

| 排名 | 数据集 | Domain | Tokens | 占比 |
|---|---|---|---|---|
| 1 | cot_synthesis2_arxiv-high | CoT v2 arXiv | 12.89B | 11.7% |
| 2 | cot_synthesis2_arxiv-mid | CoT v2 arXiv | 10.45B | 9.5% |
| 3 | cot_synthesis_arxiv-mid | CoT v1 arXiv | 9.21B | 8.4% |
| 4 | cot_synthesis2_arxiv-low | CoT v2 arXiv | 9.18B | 8.4% |
| 5 | cot_synthesis_arxiv-low | CoT v1 arXiv | 7.72B | 7.0% |
| 6 | pes2o | Academic | 6.39B | 5.8% |
| 7 | cot_synthesis_arxiv-high | CoT v1 arXiv | 5.85B | 5.3% |
| 8 | cot_synthesis2_CC-mid | CoT v2 Web | 1.89B | 1.7% |
| 9 | math-high | Math | 1.87B | 1.7% |
| 10 | zh_cc-high-loss0 | CN Web | 1.87B | 1.7% |
8.2 长尾分析
- Top 5 占比 45.1%:前 5 个数据集贡献了约 45% 的 Token。
- Top 10 占比 64.7%:前 10 个数据集贡献了约 2/3 的 Token。
- 帕累托效应显著:前 20 个数据集(占条目数 25.3%)贡献了约 80% 的 Token。
- 尾部数据丰富:后 59 个数据集虽仅占约 20%,但覆盖了 Math、Code、Wiki、Books、Stack 等多个关键领域,对能力覆盖至关重要。
9. 关键发现与结论
9.1 核心发现汇总
| # | 发现 | 影响等级 |
|---|---|---|
| 1 | CoT Synthesis 占 66.7%,是数据集的绝对主体 | 极高 |
| 2 | arXiv 来源的 CoT 数据占全量 50.4%,学术导向明确 | 极高 |
| 3 | 学术类数据合计 63.83B(58.2%),远超其他类型 | 极高 |
| 4 | v2 版本相对 v1 强化 Math(+85%)和 Web(+270%) | 高 |
| 5 | 英文占 94.3%,中文仅 5.7%,语言分布极不均衡 | 高 |
| 6 | Nemotron-CC 仅占 10.8%,通用网页数据比重低 | 中 |
| 7 | Quality Tier 设计为 4:3:2.5 梯度,向高质量倾斜 | 中 |
| 8 | Pes2o 是最大的单一自然数据源(7.87B) | 中 |
| 9 | Math 合计 10.55B(9.6%),含自然+CoT 双轨 | 中 |
| 10 | Code 合计 7.18B(6.5%),含 Code+Stack+CoT Code | 中 |
9.2 设计哲学解读
OpenSeek-100B 的数据设计体现了明确的"推理优先、学术驱动"哲学:
与传统预训练数据的差异:
| 维度 | OpenSeek-100B | 传统预训练(如 Llama) |
|---|---|---|
| CoT 数据占比 | 66.7% | < 5% |
| 学术数据占比 | 58.2% | ~10-20% |
| 通用网页占比 | 10.8% | 60-80% |
| 推理注入方式 | 直接合成 | 规模涌现 |
核心假设:通过大规模 CoT 合成数据直接注入推理能力,而非依赖模型规模的自然涌现。这是一种"数据工程驱动"而非"规模驱动"的预训练策略。
10. 训练实践建议
10.1 采样策略
建议 1: Domain 平衡采样
由于 CoT arXiv 占 50.4%,建议采用逆频率加权:
weight_domain = total_tokens / (n_domains * domain_tokens)
确保 Math、Code、Wiki 等非 arXiv 领域获得足够的训练信号。
建议 2: CoT v1 / v2 混合比例
| 方案 | v1 比例 | v2 比例 | 适用场景 |
|---|---|---|---|
| A | 30% | 70% | 优先 v2 的增强推理 |
| B | 50% | 50% | 均衡利用两个版本 |
| C | 70% | 30% | 保守策略,减少 v2 风险 |
建议 3: 中英文协同
鉴于中文仅占 5.7%,建议:
- 中文批次采用更高采样权重(2-3x)进行补偿
- 或额外引入中文 CoT 合成数据
- 监控中文评测集(C-Eval、CMMLU)的收敛情况
10.2 质量 Tier 使用策略
| 训练阶段 | high | mid | low | 策略说明 |
|---|---|---|---|---|
| 预热阶段 | 80% | 15% | 5% | 高质量数据快速收敛 |
| 主训练阶段 | 40% | 35% | 25% | 全 tier 均衡利用 |
| 退火阶段 | 60% | 30% | 10% | 回归高质量精调 |
10.3 能力维度关注
| 能力维度 | 数据支撑 | 建议 |
|---|---|---|
| 学术论文理解 | 63.83B(58.2%) | 充分,关注长文本处理 |
| 数学推理 | 10.55B(9.6%) | 中等,可额外增强 |
| 代码能力 | 7.18B(6.5%) | 偏弱,建议补充 |
| 中文能力 | 6.29B(5.7%) | 偏弱,建议补充中文 CoT |
| 百科知识 | 3.88B(3.5%) | 偏弱,Wiki 数据较少 |
附录 A: 完整 Domain 统计
| Domain | 条目数 | 总 Tokens | 平均 Tokens/条目 |
|---|---|---|---|
| CoT Synthesis v2 | 18 | 43.22B | 2.40B |
| CoT Synthesis v1 | 18 | 29.94B | 1.66B |
| Nemotron-CC (EN Web) | 24 | 11.90B | 0.50B |
| Pes2o | 3 | 7.87B | 2.62B |
| zh_cc (CN Web) | 6 | 6.29B | 1.05B |
| Math | 3 | 5.30B | 1.77B |
| Code | 3 | 3.22B | 1.07B |
| arXiv | 1 | 0.66B | 0.66B |
| Books | 1 | 0.48B | 0.48B |
| Stack | 1 | 0.44B | 0.44B |
| Wiki | 1 | 0.43B | 0.43B |
附录 B: CoT Synthesis 完整来源统计
| 来源 | CoT v1 | CoT v2 | 合计 |
|---|---|---|---|
| arXiv | 22.78B | 32.52B | 55.30B |
| Math | 1.84B | 3.41B | 5.25B |
| Code | 1.41B | 2.11B | 3.52B |
| Wiki | 1.37B | 2.08B | 3.45B |
| Web (CC) | 0.63B | 2.33B | 2.96B |
| Open Source | 1.91B | 0.77B | 2.68B |
报告生成说明: 本报告基于 OpenSeek-100B 数据集公开的 Data Composition 表格进行统计分析和可视化。所有 Token 数值保留原始数据精度,分析结论基于统计推断。

浙公网安备 33010602011771号