OpenCSG重磅发布第三版高质量开源数据:Fineweb-Edu-Chinese-V3继续奠定开源高质量数据领导地位

OpenCSG 正式发布最新数据集:Fineweb-Edu-Chinese-V3。Fineweb-Edu-Chinese 系列累计下载超过百万次、覆盖 9.57 亿条高质量文本、被 100 余篇学术论文引用,已经成为全球下载量排名前三的中文数据集之一。

现在,这一中文数据集系列迎来了新一轮关键升级。

Fineweb-Edu-Chinese-V3 改变了整条数据生产路线的起点:从筛选网页片段,转向理解完整的图书、教材、学科文献与技术长文;从生成概念型问答,转向构造有原文依据、有知识结构、有完整推导过程的训练样本。

大模型能够回答一道题,并不意味着它真正掌握了这道题。

尤其在教育与专业知识场景中,我们期待的答案,不只是一个看似正确的结论,还应该包括清晰的推导步骤、必要的背景知识、符号与单位说明,以及结论成立的假设和适用范围。

Fineweb-Edu-Chinese-V3 正是为此而来。

v3数据集包含188,148 条中英双语 SFT 样本,来自 100,442 篇源文档,覆盖计算机、自然科学、社科人文、法学和经济等方向,面向学科知识问答、教材理解与推理型指令微调场景开放使用。

四个关键词,快速了解 V3:

A:完整文档

数据源从网页片段切换到图书、教材、学科文献与技术长文;

B:知识点驱动

围绕定理、公式、命题和真实表格构造问题;

C:原文可追溯

通过证据检索补齐核心答案与背景依据;

D:完整推导

答案包含分步分析、符号与单位、前置假设和适用范围。

从 V1.0 的教育语料筛选,到 V2 系列的规模扩展与 SFT 问答,再到 V3 的文档级学科推理数据,OpenCSG 正在把“高质量中文训练数据”推向一个新的阶段。

01 从“筛得更准”,到“理解得更深”

Fineweb-Edu-Chinese 系列一直在探索一个问题:如何让中文大模型不只是读到更多中文,而是学到更高质量、更有教育价值的中文内容?

沿着这条路线,Fineweb-Edu-Chinese 经历了从教育语料筛选、到 SFT 问答构造、再到文档级学科推理数据的持续演进。

V1.0 | 概念验证规模:约 9000 万条,约 300GB;

特点:使用 BERT 模型评分、MinHash 去重,数据源包括 CCI2、SkyPile、Tele-AI。

V2.0|规模化扩展

规模:约 1.88 亿条,约 420B tokens;

特点:升级至 OpenCSG `csg-wukong-enterprise V2` 评分器,并扩展 Industry2、万卷1.0、悟道等数据源。

V2.1|预训练精选

规模:总计约 1.5T tokens;

特点:按教育质量分数分层组织,新增 map-cc、opencsg-cc,支持灵活预训练和课程学习。

V2.2|SFT 与对齐

规模:约 143.7 万条高质量问答;

特点:将教育语料转化为可直接训练的 SFT 数据,提供纯问答与带上下文两种形态。

V2.3|更高纯度的 SFT 数据

规模:23.04 万条 QA pairs;

特点:进一步强化源文本筛选、证据对齐、质量过滤和多格式导出。

V3|文档级学科推理数据

规模:18.81 万条样本,来自 10.04 万篇源文档;

特点:数据源转向图书、教材、学科文献与技术长文,通过八阶段文档理解管线构造完整推导型问答。从 V1.0 到 V2.3,OpenCSG 持续解决“如何筛得更准”;到了 V3,重点进一步转向“如何理解得更深”。

02 18.81 万条样本背后,是 10.04 万篇完整文档

Fineweb-Edu-Chinese-V3 包含:

188,148 条SFT 样本;

  • 100,442 篇源文档;
  • 16 个数据包,覆盖16 个构建域;
  • 计算机、自然科学、社科人文、法学、经济等多个学科方向;
  • General QA、Table QA、Single Choice、Multiple Choice 四类题型;
  • Messages、Messages-no-system、Alpaca 三种训练格式。

这些数字之外,V3 更重要的价值体现在三个方面。

教材级别的知识密度

V3 的数据来源从网页片段扩展到图书、教材、学科文献与专业技术长文。相较于结构零散的网页内容,完整文档拥有更清晰的知识体系、章节关系和上下文信息,也更有利于构造需要多步推导的复杂问题。

有据可依的问答构造

问题与答案并非脱离原文自由生成,而是由文档中显式抽取出的定理、公式、命题和表格等实体驱动。构建过程中还会重新回到源文档检索证据,为问题补充核心答案与背景依据,降低脱离原文自由发挥的比例。

更完整的推理型答案

V3 的回答不只追求“答对”,还强调“讲清楚”。典型答案会包含分步推导、符号和单位定义、前置假设以及适用范围说明,更适合训练需要展示解题过程和专业分析过程的模型。

03 一篇专业文档,如何变成可训练的问答?

专业文档中往往同时存在章节层级、跨页表格、数学公式、图注、前置定义和跨章节引用,并不能直接变成训练数据。Fineweb-Edu-Chinese-V3 通过一条八阶段文档理解管线,依次完成文档结构恢复、知识点提取、原文证据检索、问题精炼与训练格式导出。

01 文档结构化|S1—S1.5

将PDF等原始文档解析为结构化Markdown,分离正文、公式、表格与图片,并根据章节标题重建文档层级,保留知识在原文中的位置和上下文关系。

02 知识点与问题构造|S2—S3

从文档中识别定理、关键公式、命题和表格等知识实体,形成可测试的知识点,再围绕知识点和源文档生成问题草稿。

03 证据检索与问题精炼|S4—S5

重新回到原文检索核心答案和背景证据,并补充问题所需的背景、变量、条件及分问题,让问答更完整、更有依据。

04 综合问题与格式导出|S6—S8

合并跨章节的关联知识,形成覆盖多个知识点的综合问题,完成质量筛选和题型转换,最终导出为Messages、Messages-no-system与Alpaca格式

从文档解析到SFT导出,V3 遵循“整体完整性原则”:当一个命题与其前置假设、关键公式共同构成自洽的推导闭环时,它们会被合并为一个宏观知识点,而不是被拆散成若干孤立的小问题。

04 样本数量少了,数据反而更“重”了

从数字上看,V3 的样本量由 V2.3 的 230,400 条下降至 188,148 条,减少约 18%。

但这并不意味着数据规模或能力下降。

V3 的单条样本平均体量达到 V2.3 的2.6倍,整体文本量则达到 V2.3 的 2.1倍。

这种变化来自样本形态本身:V2.3 更偏向概念解释型问答;V3 的问题通常包含背景设定、符号和单位表格,以及多个相互关联的分问题,回答则需要逐步给出分析和推导过程。

如果希望模型输出简洁的知识性回答,V2.3 仍然具有独立价值;如果希望模型展示完整的解题和推导过程,V3 更加契合。两个版本的数据来源并不重叠,也可以混合使用,以兼顾简洁问答与深度推理能力。

05 不只有问答,还有真实表格与客观题

Fineweb-Edu-Chinese-V3 共包含四类题型:

其中,单选题与多选题合计占 28.4%,可直接用于训练或评测模型的客观题作答能力。

Table QA 则来自源文档中的真实表格,而非脱离文档生成的虚构表格。模型不仅需要读懂文字,还需要理解表格中的字段、数值和对应关系。

一条典型的 V3 样本,往往会先给出问题背景,再列出变量、符号和单位,随后提出多个相互关联的子问题。答案按照子问题逐一分析,并说明推导依据、条件和结论。

从“一个问题对应一段解释”,到“一个问题对应一条知识推导链”,正是 V3 样本结构最直观的变化。

同时,每条样本还保留 domain、question_type 和 source_paper 等信息,支持按学科、题型和源文档进行数据审计、筛选与分层训练。

06 三种训练格式,一条真实样本

为了适配不同模型模板和训练框架,Fineweb-Edu-Chinese-V3 同步提供Messages、Messages-no-system 与 Alpaca 三种数据格式。

Messages

Messages 格式包含学科领域的 system prompt,以及 user 和 assistant 两轮内容,适合需要保持稳定领域角色的 Chat 模型监督微调。

Messages-no-syst

Messages-no-system 适配自定义系统提示词,仅保留 user 与 assistant 内容,适合已经拥有统一 system prompt、希望自行控制领域人设的训练流程。

Alpaca

Alpaca 兼容常见指令微调框架,格式使用 instruction、input 和 output 字段,可接入 LLaMA-Factory 等兼容 Alpaca 数据结构的训练框架。

三种格式来自同一批问答数据,只是面向不同训练模板的导出视图。实际训练时应根据模型模板选择其中一种,不应把三种格式重复合并并视为三倍数据量。

07 下载、加载,并接入训练流程

Fineweb-Edu-Chinese-V3 以 16 个 `.tar.gz` 数据包组织。通过 Hugging Face CLI 下载并解压后,即可使用 `datasets` 加载,并接入常见训练流程。

01 下载与解压

完整数据集压缩后约 271 MB,解压后约 3.0 GB;也可以使用 `--include` 只下载需要的数据包。

02 加载数据

解压后,递归查找 Messages 格式文件,并构建训练集与验证集

03 接入训练

对于 Messages 格式,可使用基座模型 tokenizer 自带的对话模板生成训练文本:

使用建议:三种格式是同一批问答的不同导出视图,请根据模型模板选择其中一种;

原始 train/validation 按文档切分、比例较特殊,可根据任务需要重新划分;

不同基座模型的对话模板、上下文长度和特殊 token 设置不同,训练前需要对应适配。

08 从“学到更好的中文”,到“学会完整地解决问题”

Fineweb-Edu-Chinese 系列的目标,帮助模型接触和学习更高质量的中文知识内容。

截至 V2.3,Fineweb-Edu-Chinese 系列累计下载已超过百万次,被国内外多所高校与研究机构的论文引用,并进入多个开源及产业模型的数据实践中。

V3 在这条路线之上又向前推进了一步。它开始关注模型能否理解知识的结构,能否找到回答所依据的内容,能否把一个结论的来龙去脉完整地讲清楚。

这批数据可用于:

学科知识问答与教育助手模型的监督微调;

需要展示完整推导过程的推理型模型训练;

中英双语学科问答能力建设;

教材理解、专业培训和科研辅助模型;

文档理解、知识点抽取与合成数据质量研究。

从网页筛选到文档理解,从概念复述到完整推导——Fineweb-Edu-Chinese-V3 希望让模型不只是记住一个答案,更能理解并呈现解决问题的过程。

09 OpenCSG 全球开源生态

OpenCSG发布的FineWeb-Edu-Chinese作为全球下载量排名前三的中文预训练数据集,累计下载超百万次,其价值已经得到业界广泛认可:

  • 学术领域:被斯坦福大学、清华大学、中国人民大学高瓴人工智能学院、上海人工智能实验室、北京智源研究院等 20 余家顶尖机构的论文引用。旗下 Chinese Fineweb Edu 已成为中文 NLP 研究的核心数据资源,被 100 + 篇学术论文引用,在 NeurIPS、ACL、EMNLP、ICLR 等国际顶会及 Nature 子刊、JMLR 等权威期刊中作为核心实验数据集,支撑大模型预训练、指令微调等前沿研究,合作机构还包括鹏城实验室、西南电子技术研究所、西班牙国家级超算中心(Barcelona Supercomputing Center)及 Mozilla Data Collective等全球顶尖科研单位。
  • 产业应用:支撑 Llama3-Chinese、DeepSeek 等知名模型训练,并被中国移动、中国联通、英伟达(NVIDIA)、苹果公司(Apple Inc.)、OPPO、美团、阿里巴巴、蚂蚁集团、面壁智能(ModelBest)、Krafton等领军企业采用。Chinese Fineweb Edu 已从实验室走向产业场景,为创业公司到头部企业的研发团队提供可靠支撑,切实推动中文 NLP 应用从理论落地到生产实践。
  • 生态影响:下载数量累计超百万次,数据体量达 2.42TB,覆盖 9.57 亿条高质量文本,已孵化出 10 余个垂直领域微调模型。同时,OpenCSG 通过开源打分模型和完整工具链,输出数据治理方法论,带动行业从 “模型参数内卷” 转向 “数据基建完善”,显著降低中小开发者与研究机构的入门门槛。
  • 开源生态:OpenCSG 坚持“开源即文化”的理念,通过透明、共创、共享的社区文化,与全球开发者、工程师和 AI 原生企业共同构建智能体生态。

10 数据地址

OpenCSG 社区:

https://opencsg.com/datasets/OpenCSG/Fineweb-Edu-Chinese-V3

Hugging Face:

https://huggingface.co/datasets/opencsg/Fineweb-Edu-Chinese-V3

魔搭社区:

https://www.modelscope.cn/datasets/opencsg/Fineweb-Edu-Chinese-V3

关于 OpenCSG

OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

posted @ 2026-09-29 18:25  OpenCSG  阅读(10)  评论(0)    收藏  举报