大模型统计
-------------------------------------------------------------------------------
iCourt(AlphaGPT/Alpha 系统)的模型训练、推理、RAG 使用的数据,以法律领域结构化 / 非结构化权威数据为核心,以下按三类场景整理:
一、模型训练使用数据(Token 级语料)
iCourt 模型(AlphaGPT)训练以海量法律文本 Token 化语料为基础,覆盖裁判文书、法规、司法观点、实务文档等,用于预训练与领域微调。
1. 核心训练数据类型(Token 化语料)
- 裁判文书语料:1.94 亿 + 份裁判文书(民事 / 刑事 / 行政 / 执行等全案由),Token 化后用于学习裁判逻辑、法律适用、事实认定。
- 法律法规语料:580 万 + 条(法律 / 行政法规 / 部门规章 / 司法解释 / 地方性法规 / 行业规范),Token 化用于法条理解、效力层级、适用边界学习。
- 司法观点与实务语料:
- 司法观点库(最高法法官著述、会议纪要解读、裁判规则)
- 类案同判库(相似案例聚类、裁判要点、争议焦点)
- 优案评析库(典型案例深度剖析、实务经验)
- 企业与商事数据:2.8 亿 + 企业主体库(工商信息、股权、涉诉、风险关联),Token 化用于商事法律场景训练。
- 法律实务文档:合同模板、法律意见书、起诉状 / 答辩状、证据清单、庭审笔录等实务文本,Token 化用于文书生成、审查场景训练。
2. 训练数据 Token 化处理
- 文本清洗:去重、脱敏(隐名 / 删隐私 / 商业秘密)、格式标准化。
- 分词与 Token 化:按法律文本特点分词,生成模型可处理的 Token 序列。
- 标注与结构化:对裁判要点、法条条款、争议焦点、裁判结果等做弱监督 / 半监督标注,提升训练效果。
二、推理使用数据项(推理输入 / 输出数据项)
推理阶段以结构化法律数据项为输入 / 输出,用于案件分析、类案检索、合同审查、法律问答等场景。
1. 推理输入数据项
- 案件要素项:案由、当事人信息、诉讼请求、事实理由、证据清单、争议焦点、管辖法院、审理程序。
- 法律检索项:法条编号、关键词、案例案号、裁判法院、裁判日期、裁判要点。
- 合同审查项:合同类型、合同主体、核心条款(付款 / 违约 / 管辖 / 保密 / 知识产权)、风险点、审查标准。
- 企业风险项:企业名称 / 统一社会信用代码、涉诉记录、行政处罚、股权质押、失信信息。
2. 推理输出数据项
- 类案检索结果:相似案例列表、案号、裁判法院、裁判日期、裁判要点、争议焦点、裁判结果、相似度评分。
- 法律分析结论:法律适用依据、裁判规则、风险点、胜诉概率、质证 / 答辩要点。
- 合同审查报告:风险条款标注、修改建议、合规提示、风险等级。
- 文书生成内容:起诉状 / 答辩状 / 代理词 / 法律意见书 / 合同草案(结构化段落 + 条款)。
- 企业风险报告:涉诉统计、风险预警、关联主体风险、合规建议。
三、RAG 使用数据类(检索增强生成知识库)
RAG 以法律领域向量知识库为核心,用于实时检索、补充模型上下文、降低幻觉、提升回答准确性。
1. RAG 核心数据类(向量库 / 文档库)
- 裁判文书向量库:1.94 亿 + 裁判文书切块向量化,支持按案由、法院、裁判要点、争议焦点检索。
- 法律法规向量库:580 万 + 法条向量化,支持按法条编号、关键词、效力层级、适用场景检索。
- 司法观点向量库:最高法会议纪要、法官著述、裁判规则向量化,用于检索权威裁判思路。
- 类案同判向量库:相似案例聚类向量化,支持按争议焦点、裁判规则检索类案。
- 实务文档向量库:合同模板、法律意见书、优案评析、庭审指南等向量化,用于文书生成与审查。
- 企业主体向量库:2.8 亿 + 企业工商 / 涉诉 / 风险信息向量化,支持企业风险检索与关联分析。
2. RAG 数据处理与使用流程
- 数据切块:将长文本(裁判文书 / 法条 / 实务文档)按语义切块(512/1024 Token)。
- 向量化:用法律领域专用 Embedding 模型生成向量,存入向量数据库(如 Milvus/Chroma)。
- 检索增强:用户提问→向量检索→召回 Top-K 相关文档→拼接为 Prompt→模型生成带引用的回答。
- 数据更新:每日超 10 万条数据更新(新裁判文书 / 新法规 / 新司法观点),同步更新向量库。
四、三类数据对比表
表格
| 场景 | 数据形态 | 核心数据类型 | 处理方式 | 核心用途 |
|---|---|---|---|---|
| 模型训练 | Token 化语料 | 裁判文书、法规、司法观点、实务文档 | 清洗、分词、Token 化、标注 | 预训练 / 微调,学习法律知识与逻辑 |
| 推理使用 | 结构化数据项 | 案件要素、检索项、合同项、风险项 | 结构化输入 / 输出、模型推理 | 案件分析、类案检索、合同审查、问答 |
| RAG 使用 | 向量化文档块 | 裁判文书、法规、司法观点、实务文档 | 切块、向量化、向量检索 | 实时检索、增强上下文、降低幻觉 |
-------------------------------------------------------------------------------
-------------------------------------------------------------------------------
-------------------------------------------------------------------------------
-------------------------------------------------------------------------------
大模型统计表填写标准(可直接用)
1. 模型训练使用数据(Token)
- 含义:训练大模型时消耗的总 token 数量(1 token ≈ 0.7 个汉字)
- 填写格式:
- 通用大模型:万亿级,例:
1.2万亿 Token - 行业 / 垂直小模型:百亿~千亿级,例:
300亿 Token - 无自研训练:填
0或不涉及
- 通用大模型:万亿级,例:
2. 推理使用数据(项)
- 含义:用户提问 + 模型回答 产生的交互数据量,按条目 / 会话统计
- 填写格式:
- 按规模:
日均XX万项/累计XX万项 - 示例:
日均10万项累计500万项- 无对外服务:
0或不涉及
- 按规模:
3. RAG 使用数据(类)
- 含义:RAG 检索的知识库分类 / 文档类型
- 填写格式:
- 按类型:
政策类、合同类、制度类、案例类、产品文档类等 - 示例:
制度类、合同类、案例类、法规类- 未使用 RAG:
不涉及
- 按类型:
给你一套标准可直接上报的完整示例(通用合规版)
- 模型训练使用数据 (Token):320 亿 Token
- 推理使用数据 (项):日均 5 万项
- RAG 使用数据 (类):制度类、合同类、案例类、知识文档类

浙公网安备 33010602011771号