2026-08-03 面向医疗问答的KG与LLMs协同推理机制
2026-08-03 面向医疗问答的KG与LLMs协同推理机制
阅读目的:了解医学知识图谱+大语言模型协同推理的最新技术方法,学习CRM(协同推理机制)的整体架构和实现思路,为论文3的CDSS系统设计提供技术路线参考。重点关注:LLM+KG如何协作、实体扩展方法、子图生成和剪枝策略、推理融合机制。
核心贡献:提出CRM协同推理机制,通过LLM初步诊断→KG扩展实体→构建关联子图→剪枝去冗余→协同推理融合的流程,解决LLM在医疗问答中的幻觉、知识陈旧和推理不透明三大问题。在GenMedGPT-5k和CMCQA两个数据集上验证了方法的有效性。
1. 文献档案 (Metadata)
引用格式:袁嵩, 程蓉, 顾进广. 面向医疗问答的KG与LLMs协同推理机制[J]. 计算机工程与设计, 2026, 47(1): 253-261.
- 题目:面向医疗问答的KG与LLMs协同推理机制
- 英文题目:KG-LLMs collaborative reasoning framework for medical question answering
- 作者:袁嵩、程蓉、顾进广
- 机构:武汉科技大学计算机科学与技术学院;中国科学技术信息研究所;武汉科技大学智能信息处理与实时工业系统湖北省重点实验室;武汉科技大学大数据科学与工程研究院
- 期刊/会议:计算机工程与设计, 2026年, 第47卷, 第1期
- 级别:中国科技核心期刊
- 链接:中国知网 https://www.cnki.net
- DOI:10.16180/j.cnki.issn1000-7024.2026.01.031
- 基金:国家自然科学基金资助项目(20232031023023009)
- 收稿日期:2024-11-15;修订日期:2025-01-08
- 标签:知识图谱、大语言模型、医疗问答、协同推理、实体扩展、子图生成、剪枝、推理融合
2. 文章框架与思路 (Structure)
2.1 整体结构
0 引言
├── 背景:医疗问答的重要性
├── LLM的三个问题:幻觉、知识陈旧、不透明
├── 现有方法的四个方向及其不足
├── 本文三个贡献
└── 实验结果概览
1 相关工作
├── 方向1:微调适配(Qilin-Med, BenTsao)→ 更新慢、解释性差
├── 方向2:检索增强RAG(KG-RAG, ChatKQBQA)→ 只做信息匹配,没有推理
├── 方向3:动态推理路径(GraphCare, D2R-KNOWS)→ LLM只做总结工具
├── 方向4:迭代探索策略 → 复杂问题效率低
└── 本文定位:CRM协同推理机制
2 方法
├── 2.1 实体识别与扩展(LLM初步诊断+扩展实体+BERT匹配KG节点)
├── 2.2 关联子图生成(路径搜索+邻居扩展+剪枝去重)
└── 2.3 协同推理(距离计算+关联分数+排序)
3 实验与结果分析
├── 3.1 模型和数据集(GenMedGPT-5k + CMCQA)
├── 3.2 评价指标(BERTScore + ChatGLM4 Ranking + 关键实体匹配率)
├── 3.3 实验结果(CRM在所有指标上最优)
├── 3.4 消融实验(去掉任何模块效果都下降)
└── 3.5 案例分析
4 结束语
2.2 每章思路
| 章节 | 核心内容 | 写作功能 |
|---|---|---|
| 0 引言 | LLM三个问题→现有方法不足→本文贡献 | 提出问题,定位贡献 |
| 1 相关工作 | 四个方向的优缺点对比 | 文献综述,引出gap |
| 2.1 实体识别与扩展 | LLM初步诊断+BERT匹配KG | 解决"实体对不上号"问题 |
| 2.2 关联子图生成 | 路径搜索+邻居扩展+剪枝 | 解决"信息太杂"问题 |
| 2.3 协同推理 | 距离打分+排序 | 解决"候选太多"问题 |
| 3 实验 | 两个数据集+三个指标+消融实验 | 验证方法有效性 |
| 4 结束语 | 总结贡献 | 收尾 |
2.3 逻辑主线
问题:LLM在医疗问答中有三个毛病(幻觉、知识陈旧、不透明)
↓
现有方法:微调、RAG、动态推理、迭代探索
↓
现有方法的不足:实体对不上、推理冗余、不透明
↓
本文方法CRM:
2.1 扩展实体(解决实体对不上)
2.2 构建子图(解决信息太杂)
2.3 协同推理(打分排序选最佳诊断)
↓
实验:两个数据集,三个指标,CRM都最好
↓
消融实验:去掉任何模块效果都下降
↓
结论:LLM+KG协同比单独用任何一个都好
3. 核心概念与疑问 (Concept & Q&A)
Q1:这篇文章要解决什么问题?
LLM在医疗问答中有三个核心问题:幻觉(编造信息)、知识陈旧(不知道最新指南)、推理不透明(不知道为什么这么回答)。现有的KG+LLM结合方法也有不足:实体对不上号、只做信息匹配没有推理、复杂问题效率低。
Q2:CRM协同推理机制整体流程是什么?
用户提问 → 2.1 LLM初步诊断+扩展实体 → 2.2 构建关联子图+剪枝 → 2.3 距离打分排序 → 融合推理 → 最终答案
每一步的输出是下一步的输入,形成完整流水线。
Q3:E_all和D_all有什么区别?
E_all是所有相关实体的集合(疾病、症状、药物、检查等),D_all只取其中疾病类型的子集。E_all用于构建子图,D_all用于确定可能的诊断。
Q4:剪枝是怎么实现的?
计算每个节点和用户问题的相关性分数(基于距离),低于阈值的节点砍掉,重复的三元组去掉,只保留有用的信息。论文用最短路径距离计算关联分数:S(d_j) = 1/(1+dis(d_j,e))。
Q5:如果实体在KG里找不到怎么办?
论文假设KG能覆盖所有需要的实体,用BERT最近邻匹配来处理。但没有讨论KG覆盖不全时的处理策略。如果最近邻的相似度也不高,系统可能会匹配到错误的节点。
Q6:三个评价指标分别衡量什么?
| 指标 | 衡量层面 | 区分度 |
|---|---|---|
| BERTScore | 语义相似度(话通不通顺) | 差(所有方法都差不多) |
| ChatGLM4 Ranking | 事实正确性(话对不对) | 好(CRM明显最好) |
| 关键实体匹配率 | 关键词准确性(关键词对不对) | 好(CRM最精确) |
Q7:作者是提出理论方法还是做了具体实现?
这是一篇方法论论文,不是工程实现论文。提出了CRM框架,在公开数据集上做实验验证,但没有开源代码,也没有详细工程实现说明。基于已有的大模型(ChatGLM4)做方法层面的改进。
4. 痛点与动机 (Motivation)
-
现有问题:LLM在医疗问答中会编造信息(幻觉)、知识过时、推理不透明,医生不敢用。现有的KG+LLM结合方法也各有不足:微调更新慢、RAG只做匹配没有推理、迭代策略在复杂问题上效率低。
-
本文思路:提出CRM协同推理机制,让LLM和KG互相配合。LLM负责理解问题和初步诊断,KG负责提供结构化知识和扩展实体,最后通过距离打分排序+融合推理给出最终答案。核心理念是"减少对LLM或KG的过度依赖",让两边互相验证。
5. 核心方法 (Methodology)
5.1 2.1 实体识别与扩展
用户问题Q
↓
第1步:直接提取问题中的实体 E_initial
↓
第2步:LLM初步诊断 → 候选疾病 D_exist
↓
第3步:LLM扩展相关实体 E_extended
↓
E_all = E_initial ∪ E_extended
↓
第4步:用BERT将E_all中的实体与KG节点做余弦相似度匹配
↓
得到映射关系:扩展实体 → KG节点
关键公式:
5.2 2.2 关联子图生成
路径搜索: 从实体出发,在KG里用迭代方法搜索k范围内邻居,逐步扩展搜索边界,直到没有新节点为止。
邻居扩展: 对每个节点的k邻域三元组进行相关性分析,筛除低相关性的三元组。
剪枝: 基于距离计算关联分数,低于阈值的节点和路径砍掉,重复的三元组去掉。
5.3 2.3 协同推理
关联分数公式:

排序: 按S(di)降序排序,返回前k个最可能的候选疾病。
算法流程: 对每个候选疾病,计算和$E_{all}$中每个实体的最短路径距离,距离越近加分越多,总分最高的最可能。
6. 实验与结果 (Experiments)
6.1 数据集
| 数据集 | 语言 | 问题数 | 实体数 | 三元组数 |
|---|---|---|---|---|
| GenMedGPT-5k | 英文 | 600 | 11,222 | 5,802 |
| CMCQA | 中文 | 600 | 62,182 | 506,490 |
6.2 对比方法
| 类别 | 方法 |
|---|---|
| 纯LLM | Baichuan2, ChatGLM3, ChatGLM4 |
| 推理方法 | ToG, Graph Chain-of-Thought |
| 检索方法 | BM25 Retriever, KG Retriever |
6.3 核心结果
CMCQA数据集:
| 方法 | F1 Score | ChatGLM4 Ranking | 关键实体匹配率 |
|---|---|---|---|
| CRM(本文) | 0.934 | 1.51 | 90.4% |
| ToG | 0.933 | 2.95 | 87.4% |
| BM25 Retriever | 0.927 | 2.64 | 88.2% |
| ChatGLM4 | 0.914 | 3.17 | 86.3% |
关键发现: CRM在ChatGLM4 Ranking上的优势最大(1.51 vs 最好的对比方法2.64),说明CRM生成的答案质量明显更高。BERTScore区分度差,所有方法分数差不多。
6.4 消融实验
去掉LLM初步诊断(w/o LCM)或去掉实体扩展模块(w/o EXT),效果都下降。说明每个模块都有贡献。
7. 思考与评价 (Comments)
-
优点:
- 解决了LLM医疗问答的三个核心问题(幻觉、知识陈旧、不透明)
- 整体架构清晰:扩展实体→构建子图→协同推理→融合输出
- 用BERT做实体匹配,用距离打分做推理排序,方法可操作
- 消融实验验证了每个模块的贡献
- 对比方法覆盖全面(纯LLM、推理方法、检索方法三类共7种)
-
不足:
- 方法论论文,没有开源代码,没有详细工程实现
- 假设KG能覆盖所有实体,没有讨论KG覆盖不全的处理策略
- BERT用的是通用模型,没有针对医学领域优化,实体匹配可能不准
- 数据集规模较小(各600条),未在大规模真实场景中验证
- 没有讨论算力消耗问题(路径搜索和距离计算可能很耗资源)
- 作者来自武汉科技大学计算机学院,不是医学背景,对临床场景的理解可能有限
-
启发:
- CRM的"LLM初步诊断→KG扩展→融合推理"的流程可以直接借鉴到CDSS设计中
- 剪枝策略值得在CDSS中应用——指南KG很大,需要只提取与当前患者相关的知识子图
- ChatGLM4 Ranking作为评价指标比BERTScore更有效——评价CDSS时也可以考虑用LLM评判答案质量
- 这篇证明了"LLM+KG协同推理在医疗问答中有效",但用的是通用医学KG。如果把通用KG换成临床实践指南KG,就是你的研究方向
记录时间:2026-08-03

浙公网安备 33010602011771号