20260804 基于大语言模型的本体提示指导的司法命名实体识别
20260804 基于大语言模型的本体提示指导的司法命名实体识别
阅读目的:学习"本体+LLM+提示工程"的技术路线,为临床实践指南命名实体识别研究提供方法参考
核心贡献:提出基于本体提示指导的司法NER方法,在LLM提示词中加入本体实体定义和关系信息,用LoRA微调ChatGLM2-6B,在自建涉假司法文书数据集上F1达88.87%,优于传统方法
1. 文献档案 (Metadata)
引用格式:田萍芳,刘恒永,高峰,等.基于大语言模型的本体提示指导的司法命名实体识别[J].武汉大学学报(理学版),2025,71(2):219-231.
- 题目:基于大语言模型的本体提示指导的司法命名实体识别
- 英文题目:Judicial Named Entity Recognition by Ontology Prompt Guidance Based on Large Language Model
- 作者:田萍芳,刘恒永,高峰,顾进广,祝歆
- 机构:
- 1.武汉科技大学计算机科学与技术学院,湖北武汉430065
- 2.国家新闻出版署富媒体数字出版内容组织与知识服务重点实验室,北京100038
- 3.湖北省智能信息处理与实时计算重点实验室,湖北武汉430065
- 4.武汉科技大学大数据科学与工程研究院,湖北武汉430065
- 5.北京联合大学管理学院,北京100101
- 期刊/会议:武汉大学学报(理学版)
- 级别: CSCD,北大核心
- 链接:https://dx.doi.org/10.14188/j.1671-8836.2024.0027
- DOI:10.14188/j.1671-8836.2024.0027
- 收稿日期:2024-02-15
- 基金:国家重点研发计划专项(2022YFC3300605);武汉市重点研发计划(2021010700015070);武汉市东湖高新区"揭榜挂帅"项目(2021KJB004);富媒体数字出版内容组织与知识服务实验室开放基金(ZDKF2023-21-1101)
- 通讯作者:高峰,E-mail: gaofeng@wust.edu.cn
- 标签:#NER #LLM #本体 #提示工程 #知识图谱 #LoRA #司法文书
2. 文章框架与思路 (Structure)
2.1 整体结构
摘要:背景→问题→方法(本体+提示词+微调)→结果
↓
引言(第0节):司法信息化背景→NER重要性→传统方法不足→LLM出现→本文方法
↓
第1节 相关研究:NER技术演进(规则→ML→DL→BERT→LLM)
↓
第2节 涉假司法文书知识图谱本体构建
├── 2.1 本体构建(自顶向下,12类实体+14种语义关系)
└── 2.2 知识图谱实例
↓
第3节 基于本体提示的司法实体识别
├── 3.1 指令提示生成(四部分结构)
└── 3.2 实体识别流程
↓
第4节 实验及结果分析
├── 4.1 数据集与评价指标
├── 4.2 实验设置
├── 4.3 实验结果分析(对比实验)
└── 4.4 消融实验
↓
第5节 结语:贡献总结+局限性+未来方向
↓
参考文献(26篇)
2.2 每章思路
引言:
- 段1:司法信息化背景,海量司法文书需要信息提取
- 段2:NER是基础性工作,支撑知识图谱构建、法律判决预测
- 段3-4:传统方法(规则→ML→DL→BERT)的技术演进和不足
- 段5:司法领域标注数据稀缺(隐私问题),LLM缓解数据不足
- 段6:现有LLM方法列举(ChatExtracter、GPT-NER、多轮问答等)
- 段7:本文切入——现有LLM方法缺乏本体信息,本文加入本体概念+实体定义+关联信息
第1节 相关研究:
- 规则词典方法(泛化差、成本高)
- 机器学习方法(HMM、SVM、CRF,需特征工程)
- 深度学习方法(BiLSTM-CNN+CRF,需大量标注)
- 预训练模型(ELMo、BERT,迁移学习)
- 大语言模型方法(ChatExtracter、GPT-NER、多轮问答、KARP等)
- 每种方法都举例说明,并指出不足
第2节 本体构建:
- 2.1:自顶向下构建,定义12类实体(案号、嫌疑人、罪名、作案时间、作案地点、相关机构、品牌、销售金额、违法所得、销售数量、判决结果、相关法条)和14种语义关系
- 2.2:以"杨某销售假冒注册商标的商品案"为例,展示完整知识图谱实例
第3节 方法:
- 3.1:提示词四部分结构——任务描述+本体描述+任务示例+司法文本
- 3.2:实体识别流程——检索本体→匹配实体→LoRA微调→BIO标注→验证处理
第4节 实验:
- 4.1:自建300份涉假司法文书数据集,4657句,11361个实体
- 4.2:对比ChatGLM2-6B、Baichuan2-7B与4种传统方法
- 4.3:整体结果(F1=88.87%)+细粒度结果(12类实体F1)
- 4.4:消融实验(4组对照:基础/+微调/+本体提示/+微调+本体提示)
第5节 结语:
- 贡献:提出本体提示指导方法,构建数据集,验证效果
- 局限:本体针对特定领域,跨领域迁移有挑战
- 未来:探索更多实体类型识别
2.3 逻辑主线
问题:司法NER标注数据稀缺,传统方法泛化差,LLM方法缺领域知识
↓
本文方案:本体(领域知识骨架)+ 提示工程(传达给LLM)+ LoRA微调(适配任务)
↓
验证:F1达88.87%,优于传统方法最好成绩87.53%
↓
消融实验证明:微调贡献最大(+19.85%),本体提示是增强(+5.36%),两者组合最佳
3. 核心概念与疑问 (Concept & Q&A)
Q1:这个课题为什么值得研究?
原文依据:
"司法领域的命名实体识别,作为管理智能司法系统中的基础性工作,对于后续的知识图谱构建、法律判决预测等任务起到了重要作用,是司法文书信息结构化的关键。"
"司法领域可直接研究的法定命名实体语料库数量较为有限...大部分研究人员主要依赖内部自主标注的数据进行研究,这些数据往往因为隐私问题或者其他特殊原因无法公开共享。"
回答:
NER是知识图谱构建的基础,对法律判决预测等后续任务起关键支撑作用。但司法领域标注数据稀缺(隐私问题无法公开共享),传统深度学习方法需要大量标注数据且泛化能力不足。LLM的出现缓解了数据不足问题,但现有LLM方法在构建提示时未充分考虑领域知识的结构化特性,导致识别不准确。
Q2:目前正在用什么方法处理问题?已经做到了哪一步?
原文依据:
"命名实体识别任务主要包括基于规则和词典的方法、基于机器学习的方法和基于深度学习的方法。"
"随着预训练模型的出现,例如ELMo和BERT模型对丰富的语法和语义理解更进一步。"
"随着大语言模型的出现,标注训练数据不足的问题得到缓解。"
回答:
| 阶段 | 代表方法 | 当前状态 |
|---|---|---|
| 规则词典 | 专家定义规则和词典 | 已有,泛化差、成本高 |
| 机器学习 | HMM、SVM、CRF | 已有,需手工特征工程 |
| 深度学习 | BiLSTM-CRF、CNN-CRF | 效果好但需大量标注数据 |
| 预训练模型 | BERT-CRF、BERT-BiLSTM-CRF | 当前主流,迁移学习 |
| 大语言模型 | ChatExtracter、GPT-NER、KARP | 刚起步,效果好但缺乏领域知识 |
本文处于大语言模型阶段,尝试用本体指导LLM进行NER。
Q3:为什么现有的成果还不够?
原文依据:
"基于大语言模型的方法在构建的提示并没有充分考虑上下文信息,缺乏一定说明性。"
"传统的命名实体识别方法难以对不同类别和不同细粒度类型实体上进行迁移学习,缺乏泛化能力。"
回答:
| 不足 | 说明 |
|---|---|
| LLM方法缺乏领域知识 | 提示词没有加入实体定义和关系信息,LLM不理解专业概念 |
| 传统方法泛化差 | 依赖手工特征,不同实体类型需要不同处理 |
| 嵌套实体识别难 | 传统方法对"广东省广州市海珠区人民法院"这类嵌套实体效果差 |
Q4:现在认为的问题成因、机制是什么?
原文依据:
"当不加入本体提示时,ChatGLM2-6B的基础模型,F1值达到62.55%,这源于大语言模型在通用语料数据训练后的基础能力。"
"若只加入训练数据进行微调,F1值有了显著上升,提升接近20个百分点,说明微调使得模型的性能和任务的特征要求更加匹配。"
"当将两个模块同时叠加加入后,达到了最佳效果。"
回答:
问题成因:
- LLM在通用语料上训练,不懂司法领域的专业概念
- 仅靠提示词不够,LLM需要微调才能真正适应任务
- 微调贡献最大(+19.85%),本体提示是增强(+5.36%)
- 两者组合才能达到最佳效果——微调让模型适应任务,本体提示让模型理解领域知识
Q5:成因、机制的理论基础是什么?
原文依据:
"本体模型的构建主要涉及两种方式:自顶向下和自底向上。借鉴司法领域内专家的指导,采用自顶向下的方式构建涉假司法文书的本体模型。"
"本体是一种形式化的知识表示模型,用于描述特定领域中的概念、实体、属性和它们之间的关系。"
"利用LoRA技术对模型进行微调,以提高识别准确性。"
回答:
| 理论 | 在本研究中的应用 |
|---|---|
| 本体论(Ontology) | 定义实体类型、实体定义、语义关系,构建领域知识骨架 |
| 提示工程(Prompt Engineering) | 将本体信息转化为LLM能理解的指令格式(四部分结构) |
| 参数高效微调(LoRA) | 用少量数据微调LLM,使其适应特定任务,不改变基础模型参数 |
Q6:论文作者建议的未来研究方向是什么?
原文依据:
"然而,本研究还存在一些局限性。首先,由于本体模型的构建是基于特定领域,该方法在其他领域的应用具有一定的适用性挑战。其次,司法实体定义的多样性方面仍然存在挑战,未来的研究可以进一步探索对其他实体的识别,以更好地推动司法文书领域的智能化发展。"
回答:
- 跨领域迁移:本体针对涉假司法文书构建,未来可探索迁移到其他领域(如医疗、金融)
- 扩展实体类型:本研究只覆盖12类实体,未来可扩展到更多类型
Q7:综合以上,你的研究需要填补的真正空白是什么?
原文依据:
"随着我国深入推进法院信息化建设,借助人工智能、大数据等信息技术的迅猛发展,为法院工作信息化提供了更多的工具和方法。"
"在司法领域,大部分研究人员主要依赖内部自主标注的数据进行研究,这些数据往往因为隐私问题或者其他特殊原因无法公开共享。"
回答:
本论文证明了"本体+LLM+LoRA微调"在司法NER中有效。可以考虑把这条技术路线用于临床实践指南的命名实体识别。
临床实践指南与司法文书有相似挑战:
- 标注数据稀缺
- 实体类型多
- 嵌套实体多
但也有不同:
- 医学实体有更严格的语义定义
- 有GRADE等标准化分级体系
- 有RIGHT清单等标准化报告规范
可填补的空白:
- 将本体构建从司法领域迁移到医学领域(基于RIGHT清单+GRADE体系)
- 将NER从司法文书迁移到临床实践指南文本
- 将提取出的实体用于构建指南知识图谱,支撑CDSS
4. 痛点与动机 (Motivation)
-
现有问题:
- 司法领域标注数据稀缺(隐私问题无法公开共享)
- 传统NER方法依赖手工特征,泛化能力差
- 现有LLM方法的提示词缺乏领域知识结构(实体定义和关系)
- 嵌套实体识别是传统方法的难点
-
本文思路:
- 自顶向下构建涉假司法文书本体(12类实体+14种语义关系)
- 将本体信息融入提示词四部分结构(任务描述+本体描述+任务示例+待识别文本)
- 用LoRA微调ChatGLM2-6B,使其适应司法NER任务
- 在少样本条件下实现更准确的命名实体识别
5. 核心方法 (Methodology)
5.1 本体构建
采用自顶向下方式,定义12类实体和14种语义关系。
实体定义(表2):
| 实体类别 | 实体定义 | 实体描述词 |
|---|---|---|
| 案号 | 指对司法文书进行唯一标识和识别的编码,通常包含文书类型标识、地区代码、年份、顺序号和其他标识信息 | 粤判、刑判、终判 |
| 嫌疑人 | 指案件中被怀疑有犯罪行为的个体 | 被告人 |
| 罪名 | 指对嫌疑人所指控的具体犯罪行为进行法律描述或定罪的内容 | 犯...罪、涉嫌...罪、构成...罪 |
| 作案时间 | 指作案人实施犯罪活动从开始到结束的持续时间 | 年、月、日 |
| 作案地点 | 指作案人实施犯罪活动的具体位置描述 | 省、市、县区、乡街道 |
| 相关机构 | 指与涉案事件有关的行政机构和商业机构 | 人民法院、检察院、公安局、公司 |
| 品牌 | 指涉案物品被非法使用或伪造的商标、标识或品牌 | 注册商标、品牌 |
| 销售金额 | 指与涉案物品的商品交易中涉及到的经济数额 | 销售、金额 |
| 违法所得 | 指嫌疑人在法律禁止下手段获取的财物 | 违法所得、违法获利 |
| 销售数量 | 指在涉案物品交易数量的相关统计数字 | 销售、一个、销售量 |
| 判决结果 | 指法院根据案件事实作出的判决决定或裁定,包括对被告人或当事人的判刑、赔偿等决定 | 有期徒刑、判刑、罚金 |
| 相关法条 | 指与案件相关的法律规定或条款,用于支持或解释法院对案件的判断、决定或论证 | 刑法、商标法、诉讼法 |
语义关系(表1):
| 关联概念 | 语义关系 | 被关联概念 | 语义关系说明 |
|---|---|---|---|
| 案件 | 作案时间是 | 作案时间 | 案件发生时间 |
| 案件 | 作案地点在 | 作案地点 | 案件发生地点 |
| 案件 | 有嫌疑人 | 嫌疑人 | 案件涉及嫌疑人 |
| 案件 | 有证据材料 | 证据材料 | 案件关联证据 |
| 案件 | 审理法院是 | 法院 | 案件审理机构 |
| 嫌疑人 | 侵犯品牌 | 品牌 | 嫌疑人侵犯品牌 |
| 嫌疑人 | 引用法条 | 相关法条 | 嫌疑人引用法条 |
| 嫌疑人 | 害结果是 | 判决结果 | 嫌疑人审判结果 |
| 嫌疑人 | 罪名是 | 罪名 | 嫌疑人指控罪名 |
| 检察院 | 指控嫌疑人 | 嫌疑人 | 检察院指控嫌疑人 |
| 判决结果 | 适用法条 | 相关法条 | 判决结果适用法条 |
| 损害结果 | 适用法条 | 相关法条 | 损害结果适用法条 |
| 判决结果 | 依据法条 | 相关法条 | 判决结果依据法条 |
5.2 提示词设计(四部分结构)
原文依据:
"本研究将本体模型转换为由4个部分组成的指令提示,其中任务描述部分用于在微调过程中加入任务定义。本体描述部分加入实体定义与关系信息,使大语言模型能根据实体的定义和本体上下文语义关系。"
| 部分 | 内容 | 作用 |
|---|---|---|
| 任务描述 | 角色设定("你是一位经验丰富的司法领域专家")+任务定义("命名实体识别任务")+输出格式("只输出符合BIO输出格式的实体-类别格式") | 告诉LLM"你是谁、做什么" |
| 本体描述 | 实体列表(嫌疑人、罪名、判决结果等)+实体定义("嫌疑人指案件中被怀疑有犯罪行为的个体")+实体关系 | 告诉LLM"领域知识" |
| 任务示例 | 标注好的输入输出对("被告人/SUSPECT 夏某某/SUSPECT 销售假冒注册商标的商品罪/CRIME...") | 给LLM"示范" |
| 待识别文本 | 原始司法文书 | 给LLM"实际任务" |
提示词示例(图7):
【任务描述】
这是命名实体识别任务。你是一位经验丰富的司法领域专家,
能够轻松地识别司法文书中的司法实体。给定以下本体、
示例和文本,请根据本体定义的12个实体类型识别司法文本
中的实体。在输出中,只输出符合BIO输出格式的实体-类别格式。
【本体描述】
本体概念:嫌疑人、罪名、判决结果
本体定义:嫌疑人指案件中被怀疑有犯罪行为的个体。
罪名:指对嫌疑人所指控的具体犯罪行为进行法律描述
或定罪的内容。
判决结果:指法院根据案件事实作出的判决决定或裁定,
包括对被告人或当事人的判刑、赔偿等决定。
【任务示例】
输入:被告人夏某某销售假冒注册商标的商品罪,判处有期徒刑三年,
缓刑一年,罚金五万元。
输出:被告人/SUSPECT 夏某某/SUSPECT 销售假冒注册商标的
商品罪/CRIME ,判处有期徒刑三年/ JUDGMENT ,缓刑一年/
JUDGMENT ,罚金五万元/JUDGMENT 。
【司法文本】
被告人夏某某销售假冒注册商标的商品罪,判处有期徒刑六个月,
缓刑一年,罚金人民币一万元。
5.3 微调策略
原文依据:
"同时,利用LoRA技术对模型进行微调,以提高识别准确性。"
"实验参数设置如下:句子文本子最大长度设为256,LSTM单元数设为128,初始学习率为5E-5,Batch大小设为16,dropout设为0.5。"
| 参数 | 设置 |
|---|---|
| 基础模型 | ChatGLM2-6B(62亿参数) |
| 微调方法 | LoRA(只训练少量参数,不改变基础模型) |
| 句子最大长度 | 256 |
| LSTM单元数 | 128 |
| 学习率 | 5E-5 |
| Batch大小 | 16 |
| Dropout | 0.5 |
6. 实验与结果 (Experiments)
6.1 数据集
原文依据:
"鉴于司法文书领域缺乏充足的标注语料数据集,本研究所使用的数据集来自自主创建完成的,收集了300份从无北大法宝和中国裁判文书网下载的涉假司法文书。"
"从这些文书中抽取相应的实体类型,采用BIO模式标注,手工标注了案号、嫌疑人、罪名、作案时间、作案地点、相关机构、品牌、销售金额、违法所得、销售数量、判决结果和相关法条这12类细粒度实体。"
"数据集共包含4657个句子和11361个实体。"
| 维度 | 内容 |
|---|---|
| 来源 | 北大法宝、中国裁判文书网 |
| 数量 | 300份涉假司法文书 |
| 句子数 | 4657个 |
| 实体数 | 11361个 |
| 实体类型 | 12类(案号、嫌疑人、罪名、作案时间、作案地点、相关机构、品牌、销售金额、违法所得、销售数量、判决结果、相关法条) |
| 标注格式 | BIO |
| 划分 | 训练:验证:测试 = 4:1:1 |
数据集统计(表3):
| 实体类别 | 示例 | 实体数量 | 占比 |
|---|---|---|---|
| 案号 | (2016)粤0105刑初439号 | 532 | 4.7% |
| 嫌疑人 | 李某某 | 3509 | 30.9% |
| 罪名 | 销售假冒注册商标的商品罪 | 1211 | 10.6% |
| 作案地点 | 广州市海珠区村队工业区某栋三楼 | 283 | 2.5% |
| 作案时间 | 2019年8月至2020年8月 | 291 | 2.6% |
| 相关机构 | 广东省广州市海珠区人民法院 | 2533 | 22.4% |
| 品牌 | PRADA | 979 | 8.6% |
| 销售金额 | 人民币20余万元 | 271 | 2.4% |
| 违法所得 | 人民币4万元 | 237 | 2.1% |
| 销售数量 | 一 | 252 | 2.2% |
| 判决结果 | 判处有期徒刑一年六个月 | 700 | 6.2% |
| 相关法条 | 《中华人民共和国刑法》第二百一十四条 | 585 | 5.1% |
数据不平衡问题:
"嫌疑人""罪名"和"相关机构"三类实体占比较高合计达63.9%,而"作案时间""作案地点""违法所得""销售数量"这四类实体合计仅占11.8%。
6.2 对比实验设置
原文依据:
"本文选择参数量较少、性能开销较小的ChatGLM2-6B和Baichuan2-7B大语言模型作为实验对象,同时为了与传统实体识别方法进行对比,选取BiLSTM-CRF、BERT-CRF、BERT-BiLSTM-CRF和GlobalPointer四种较为主流的方法进行了实验。"
| 模型 | 类型 | 模型特征 |
|---|---|---|
| BiLSTM-CRF | 传统深度学习 | 将BiLSTM作为特征提取器,CRF对标签序列进行解码和优化 |
| BERT-CRF | 预训练+CRF | 利用BERT的预训练能力,学习到更丰富的语义和上下文信息 |
| BERT-BiLSTM-CRF | 预训练+BiLSTM+CRF | BERT作为中间层,BiLSTM更全面地捕捉句子中的上下文信息 |
| GP(RoBERTa) | GlobalPointer | BERT替换为RoBERTa |
| GP(BERT) | GlobalPointer | 利用全局归一化的方法,结合BERT和针锋网络 |
| ChatGLM2-6B | 本体提示+LoRA | 基于GLM架构,62亿参数 |
| Baichuan2-7B | 本体提示+LoRA | 采用SwiGLU激活函数,70亿参数 |
6.3 整体实验结果(表5)
| 模型 | P(%) | R(%) | F1(%) |
|---|---|---|---|
| BiLSTM-CRF | 77.34 | 81.52 | 79.38 |
| BERT-CRF | 83.08 | 87.25 | 85.11 |
| BERT-BiLSTM-CRF | 83.51 | 87.92 | 85.66 |
| GP(RoBERTa) | 81.93 | 90.78 | 86.14 |
| GP(BERT) | 85.01 | 90.21 | 87.53 |
| ChatGLM2-6B | 87.23 | 90.58 | 88.87 |
| Baichuan2-7B | 87.56 | 91.03 | 89.26 |
关键发现:
"与传统基线模型相比,基于本体提示指导大语言模型识别的ChatGLM2-6B和Baichuan2-7B表现较好效果,与传统基线模型表现最好的GP(BERT)相比,大语言模型在准确率方面相对于召回率有着明显的优势。"
6.4 细粒度实体识别结果(表6)
| 模型 | 案号 | 嫌疑人 | 罪名 | 作案时间 | 作案地点 | 相关机构 | 品牌 | 销售金额 | 违法所得 | 销售数量 | 判决结果 | 相关法条 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BiLSTM-CRF | 78.53 | 77.74 | 89.43 | 81.10 | 60.03 | 87.42 | 69.36 | 68.41 | 76.97 | 91.57 | 91.09 | - |
| BERT-CRF | 85.21 | 83.88 | 95.66 | 87.31 | 67.21 | 85.52 | 94.42 | 74.07 | 73.08 | 80.27 | 96.39 | 96.88 |
| BERT-BiLSTM-CRF | 84.48 | 84.21 | 96.22 | 88.38 | 63.60 | 85.59 | 93.51 | 77.77 | 76.84 | 82.78 | 96.24 | 96.96 |
| GP(RoBERTa) | 81.93 | 90.78 | 86.14 | 83.15 | 65.07 | 84.69 | 95.93 | 88.00 | 88.33 | 87.30 | 90.17 | 94.18 |
| GP(BERT) | 83.76 | 89.18 | 94.04 | 86.12 | 68.16 | 82.95 | 95.11 | 84.65 | 87.92 | 97.49 | 97.30 | - |
| ChatGLM2-6B | 91.42 | 85.64 | 98.23 | 85.32 | 74.83 | 90.95 | 89.49 | 91.13 | 90.38 | 88.23 | 87.92 | 92.38 |
关键发现:
-
LLM在嵌套实体上优势明显:
"特别在作案地点和相关机构这两类实体多和嵌套实体上,ChatGLM2-6B的F1值均提升了超过5个百分点。"
-
LLM在某些简单实体上不如传统方法:
"ChatGLM2-6B在嫌疑人、作案时间、品牌、判决结果和相关法条这5类实体上略逊于GP(BERT)模型...主要因为这类实体的词汇表达较为单一...这些词汇特征在BERT模型上的训练效果提升较为显著,并不需要考虑上下文信息。"
6.5 消融实验结果(表7)
| 模型 | P(%) | R(%) | F1(%) | 相比基础提升 |
|---|---|---|---|---|
| ChatGLM2-6B(基础,无微调无本体) | 60.53 | 64.71 | 62.55 | - |
| ChatGLM2-6B-Tune(只微调,无本体) | 81.51 | 83.52 | 82.40 | +19.85% |
| ChatGLM2-6B-Prompt(只加本体提示,不微调) | 65.82 | 70.14 | 67.91 | +5.36% |
| ChatGLM2-6B-Tune-Prompt(本体提示+微调) | 87.23 | 90.58 | 88.87 | +26.32% |
消融实验分析:
"当不加入本体提示时,ChatGLM2-6B的基础模型,F1值达到62.55%,这源于大语言模型在通用语料数据训练后的基础能力。若只加入训练数据进行微调,F1值有了显著上升,提升接近20个百分点,说明微调使得模型的性能和任务的特征要求更加匹配。在不加微调时,只加入本体提示信息,F1值仅上升了5个百分点,模型仍不能更好地理解任务,导致识别错误。然而,经过微调后,模型不仅能更好地理解任务,还能准确的识别实体。"
"而当将两个模块同时叠加加入后,达到了最佳效果。这说明将两个模块叠加同时加入后,进行了进一步的司法命名实体识别能力的提升,从而证实了本文基于本体提示指导的改进在微调的基础上的有效性。"
关键结论:
| 模块 | 单独贡献 | 说明 |
|---|---|---|
| 微调 | +19.85% | 贡献最大,让模型适应任务 |
| 本体提示 | +5.36% | 有帮助,但不够 |
| 微调+本体提示 | +26.32% | 组合效果最好 |
微调是基础,本体提示是增强。两者缺一不可,但微调是核心。
7. 思考与评价 (Comments)
-
优点:
- 技术路线清晰:本体→提示词→微调→识别,逻辑完整
- 消融实验设计好:4组对照,清晰证明各模块贡献
- 诚实承认不足:在品牌、判决结果等实体上不如传统方法
- 提示词设计有参考价值:四部分结构可迁移
- 本体构建方法规范:自顶向下,结合领域专家
- 图表清晰:图1(本体构建流程)、图2(本体概念图)、图4(知识图谱实例)、图5(识别流程)、图7(提示微调流程)
-
不足:
- 数据集较小(300份文书),未在公开数据集上验证
- 仅在涉假司法文书中验证,泛化性未充分讨论
- 未与其他LLM方法(如GPT-NER、ChatExtracter)直接对比
- 引言与综述有较多重合
- 12类实体中,嫌疑人占比30.9%,数据不平衡问题未充分解决
-
启发:
- 本体构建的自顶向下方法可迁移到临床指南领域
- 四部分提示词结构(任务描述+本体描述+任务示例+待识别文本)可直接套用
- 消融实验设计(基础/+微调/+本体提示/+微调+本体提示)可参考
- 微调是核心,本体是增强这个结论对后续研究有指导意义
- 本体描述中加入实体定义和关系是关键创新点
记录时间:20260804

浙公网安备 33010602011771号