大模型统计

-------------------------------------------------------------------------------

iCourt(AlphaGPT/Alpha 系统)的模型训练、推理、RAG 使用的数据,以法律领域结构化 / 非结构化权威数据为核心,以下按三类场景整理:

 

 

一、模型训练使用数据(Token 级语料)

 
iCourt 模型(AlphaGPT)训练以海量法律文本 Token 化语料为基础,覆盖裁判文书、法规、司法观点、实务文档等,用于预训练与领域微调。
 

1. 核心训练数据类型(Token 化语料)

 
  • 裁判文书语料:1.94 亿 + 份裁判文书(民事 / 刑事 / 行政 / 执行等全案由),Token 化后用于学习裁判逻辑、法律适用、事实认定。
  • 法律法规语料:580 万 + 条(法律 / 行政法规 / 部门规章 / 司法解释 / 地方性法规 / 行业规范),Token 化用于法条理解、效力层级、适用边界学习。
  • 司法观点与实务语料:
    • 司法观点库(最高法法官著述、会议纪要解读、裁判规则)
    • 类案同判库(相似案例聚类、裁判要点、争议焦点)
    • 优案评析库(典型案例深度剖析、实务经验)
     
  • 企业与商事数据:2.8 亿 + 企业主体库(工商信息、股权、涉诉、风险关联),Token 化用于商事法律场景训练。
  • 法律实务文档:合同模板、法律意见书、起诉状 / 答辩状、证据清单、庭审笔录等实务文本,Token 化用于文书生成、审查场景训练。
 

2. 训练数据 Token 化处理

 
  • 文本清洗:去重、脱敏(隐名 / 删隐私 / 商业秘密)、格式标准化。
  • 分词与 Token 化:按法律文本特点分词,生成模型可处理的 Token 序列。
  • 标注与结构化:对裁判要点、法条条款、争议焦点、裁判结果等做弱监督 / 半监督标注,提升训练效果。
 

 

二、推理使用数据项(推理输入 / 输出数据项)

 
推理阶段以结构化法律数据项为输入 / 输出,用于案件分析、类案检索、合同审查、法律问答等场景。
 

1. 推理输入数据项

 
  • 案件要素项:案由、当事人信息、诉讼请求、事实理由、证据清单、争议焦点、管辖法院、审理程序。
  • 法律检索项:法条编号、关键词、案例案号、裁判法院、裁判日期、裁判要点。
  • 合同审查项:合同类型、合同主体、核心条款(付款 / 违约 / 管辖 / 保密 / 知识产权)、风险点、审查标准。
  • 企业风险项:企业名称 / 统一社会信用代码、涉诉记录、行政处罚、股权质押、失信信息。
 

2. 推理输出数据项

 
  • 类案检索结果:相似案例列表、案号、裁判法院、裁判日期、裁判要点、争议焦点、裁判结果、相似度评分。
  • 法律分析结论:法律适用依据、裁判规则、风险点、胜诉概率、质证 / 答辩要点。
  • 合同审查报告:风险条款标注、修改建议、合规提示、风险等级。
  • 文书生成内容:起诉状 / 答辩状 / 代理词 / 法律意见书 / 合同草案(结构化段落 + 条款)。
  • 企业风险报告:涉诉统计、风险预警、关联主体风险、合规建议。
 

 

三、RAG 使用数据类(检索增强生成知识库)

 
RAG 以法律领域向量知识库为核心,用于实时检索、补充模型上下文、降低幻觉、提升回答准确性。
 

1. RAG 核心数据类(向量库 / 文档库)

 
  • 裁判文书向量库:1.94 亿 + 裁判文书切块向量化,支持按案由、法院、裁判要点、争议焦点检索。
  • 法律法规向量库:580 万 + 法条向量化,支持按法条编号、关键词、效力层级、适用场景检索。
  • 司法观点向量库:最高法会议纪要、法官著述、裁判规则向量化,用于检索权威裁判思路。
  • 类案同判向量库:相似案例聚类向量化,支持按争议焦点、裁判规则检索类案。
  • 实务文档向量库:合同模板、法律意见书、优案评析、庭审指南等向量化,用于文书生成与审查。
  • 企业主体向量库:2.8 亿 + 企业工商 / 涉诉 / 风险信息向量化,支持企业风险检索与关联分析。
 

2. RAG 数据处理与使用流程

 
  1. 数据切块:将长文本(裁判文书 / 法条 / 实务文档)按语义切块(512/1024 Token)。
  2. 向量化:用法律领域专用 Embedding 模型生成向量,存入向量数据库(如 Milvus/Chroma)。
  3. 检索增强:用户提问→向量检索→召回 Top-K 相关文档→拼接为 Prompt→模型生成带引用的回答。
  4. 数据更新:每日超 10 万条数据更新(新裁判文书 / 新法规 / 新司法观点),同步更新向量库。
 

 

四、三类数据对比表

 
表格
 
场景数据形态核心数据类型处理方式核心用途
模型训练 Token 化语料 裁判文书、法规、司法观点、实务文档 清洗、分词、Token 化、标注 预训练 / 微调,学习法律知识与逻辑
推理使用 结构化数据项 案件要素、检索项、合同项、风险项 结构化输入 / 输出、模型推理 案件分析、类案检索、合同审查、问答
RAG 使用 向量化文档块 裁判文书、法规、司法观点、实务文档 切块、向量化、向量检索 实时检索、增强上下文、降低幻觉

-------------------------------------------------------------------------------

 

-------------------------------------------------------------------------------

 

-------------------------------------------------------------------------------

 

-------------------------------------------------------------------------------

 

 

大模型统计表填写标准(可直接用)

 

1. 模型训练使用数据(Token)

 
  • 含义:训练大模型时消耗的总 token 数量(1 token ≈ 0.7 个汉字)
  • 填写格式:
    • 通用大模型:万亿级,例:1.2万亿 Token
    • 行业 / 垂直小模型:百亿~千亿级,例:300亿 Token
    • 无自研训练:填 0不涉及
     
 

 

2. 推理使用数据(项)

 
  • 含义:用户提问 + 模型回答 产生的交互数据量,按条目 / 会话统计
  • 填写格式:
    • 按规模:日均XX万项 / 累计XX万项
    • 示例:
      • 日均10万项
      • 累计500万项
      • 无对外服务:0不涉及
       
     
 

 

3. RAG 使用数据(类)

 
  • 含义:RAG 检索的知识库分类 / 文档类型
  • 填写格式:
    • 按类型:政策类、合同类、制度类、案例类、产品文档类
    • 示例:
      • 制度类、合同类、案例类、法规类
      • 未使用 RAG:不涉及
       
     
 

 

给你一套标准可直接上报的完整示例(通用合规版)

 
  • 模型训练使用数据 (Token):320 亿 Token
  • 推理使用数据 (项):日均 5 万项
  • RAG 使用数据 (类):制度类、合同类、案例类、知识文档类
posted @ 2026-03-09 15:11  hanease  阅读(102)  评论(0)    收藏  举报