2025-07-29 临床指南和专家共识制定中循证医学证据等级和推荐强度确定方法
2025-07-29 临床指南和专家共识制定中循证医学证据等级和推荐强度确定方法
阅读目的:了解临床实践指南制定过程中证据等级和推荐强度的确定方法,理解指南中"元知识"(证据等级、推荐强度)的来源和结构,为临床实际指南中知识分类框架提供基础。
核心贡献:梳理了临床指南制定中从文献检索到推荐意见形成的全流程方法学框架,包括按文献类型选择对应质量评价工具及其量化标准,综合多个分级体系确定证据等级,以及通过德尔菲法达成专家共识的标准和阈值。
1. 文献档案 (Metadata)
引用格式:王瑞平, 李斌. 临床指南和专家共识制定中循证医学证据等级和推荐强度确定方法[J]. 上海医药, 2025, 46(8): 26-31.
- 题目:临床指南和专家共识制定中循证医学证据等级和推荐强度确定方法
- 英文题目:Methods for determining the levels of evidence and strength of recommendations in the development of clinical guidelines and expert consensus
- 作者:王瑞平, 李斌
- 机构:上海市皮肤病医院临床研究与创新转化中心
- 期刊/会议:上海医药, 2025, 第46卷, 第8期
- 级别:中国科技核心期刊
- 链接:中国知网 https://www.cnki.net
- DOI:未提供
- 基金:上海市卫生健康委员会促进市级医院临床技能与临床创新三年行动计划—研究型型医院创新能力培养项目(SHDC2022CRB033);第二期促进市级医院临床技能与临床创新三年行动计划(2023—2025年)CRU协同医疗质量提升项目(SHDC2024CRX032);上海市皮肤病医院引进人才科研基金(2021KYQD001);上海人才发展基金(2021SHRCFZ011);上海市卫生健康委员会、上海市中医药管理局2025年度中医药标准化项目(2025BZ004)
- 标签:循证医学、临床实践指南、证据等级、推荐强度、GRADE、德尔菲法、文献质量评价
2. 文章框架与思路 (Structure)
2.1 整体结构
引言(为什么写这篇文章)
↓
文献检索策略(检索什么、从哪里检索)
↓
文献质量评价(不同文献类型用什么工具)
├── 系统综述/meta分析 → AMSTAR2量表
├── RCT → Jadad量表
├── 病例对照/队列 → NOS量表
└── 横断面研究 → AHRQ量表
↓
证据等级确定和推荐意见
├── 综合Cochrane、牛津、GRADE体系
└── 德尔菲法 + Likert 5级评分
↓
总结
2.2 每章思路
| 章节 | 内容 | 作用 |
|---|---|---|
| 引言 | 指南制定的背景和编写团队面临的困难 | 提出问题 |
| 文献检索策略 | 覆盖哪些数据库、检索什么时间范围 | 第一步操作 |
| 文献质量评价 | 四种文献类型对应四种评价工具+量化评分标准 | 第二步操作(核心) |
| 证据等级确定和推荐意见 | 综合多个分级体系+德尔菲法 | 第三步操作(核心) |
| 总结 | 定位为方法学参考 | 收尾 |
2.3 逻辑主线
现实问题:编写团队不知道证据等级怎么定、推荐强度怎么定
↓
原因分析:工具多但分散,缺乏整合性操作指南
↓
本文贡献:提供一站式的操作链
文献检索 → 质量评价 → 证据分级 → 推荐形成
(每步都给出具体工具、量化标准、操作阈值)
↓
预期效果:编写团队可以按此流程操作
3. 核心概念与疑问 (Concept & Q&A)
Q1:GRADE证据等级系统是什么?
GRADE将证据分为5个级别,对应4个推荐强度:
| 证据级别 | 描述 | 推荐强度 |
|---|---|---|
| 1级 | 高质量RCT的系统综述/meta分析 | A级(强推荐) |
| 2级 | 高质量队列研究的系统综述/meta分析 | B级(一般性推荐) |
| 3级 | 高质量病例对照研究的系统综述/meta分析 | C级(弱推荐) |
| 4级 | 病例报道、横断面研究 | D级(不推荐) |
| 5级 | 专家意见、传统经验 | D级(不推荐) |
Q2:四种文献质量评价工具分别评什么?
| 工具 | 评价对象 | 评价维度 | 质量判定标准 |
|---|---|---|---|
| AMSTAR2 | 系统综述/meta分析 | 16个条目 | 关键条目不符合数量 |
| Jadad | RCT | 随机、双盲、失撤(0-5分) | ≤3分低质量,≥4分高质量 |
| NOS | 病例对照/队列研究 | 选择、可比性、暴露/结果(星级) | ≥9星高质量,5-6星中等,≤4星低质量 |
| AHRQ | 横断面研究 | 11个条目(是/否/不清楚) | ≥8分高质量,6-7分中等,≤5分低质量 |
Q3:德尔菲法怎么操作?
- 邀请15-30名该领域专家
- 每名专家对每条推荐意见用Likert 5级评分(1=非常不同意,5=非常同意)
- 评分≥4分的专家比例≥75%时,视为该推荐意见达成共识
Q4:PICO框架是什么?
PICO = Patient/problem(患者/问题) + Intervention(干预) + Comparison(对照) + Outcome(结局)。这是构建系统综述和meta分析研究问题的标准框架。
Q5:本文中的流程图(图1和图2)分别展示什么?
- 图1(德尔菲专家会商法工作流程图):展示了从组建筹备→文献检索→文献分析→专家推荐→共识度评价的完整流程
- 图2(临床诊疗指南和专家共识的制定流程和方法示意图):展示了从文献检索→质量评价(按文献类型选择工具)→证据等级确定→推荐意见形成的全流程
Q6:PRISMA声明是什么?
PRISMA(Preferred Reporting Items for Systematic Reviews and Meta-Analyses)是系统综述和meta分析的国际报告规范,用于规范文献检索和筛选过程的报告。
4. 痛点与动机 (Motivation)
- 现有问题:编写团队在制定临床诊疗指南和专家共识时,面临如何确定循证医学证据等级和专家推荐强度的方法学困难。现有的分级体系(GRADE、Cochrane、牛津)各自独立,缺乏整合性的操作指南。
- 本文思路:从文献检索入手,按文献类型选择对应的质量评价工具,综合多个分级体系确定证据等级,最后通过德尔菲法达成专家共识,形成一站式的操作链。
5. 核心方法 (Methodology)
本文的方法学框架包含四个步骤:
步骤1:文献检索
- 数据库:PubMed、Embase、Cochrane Library、Web of Science、中国知网、万方数据、维普资讯
- 时间范围:数据库创建起至本年年末
- 检索词:以"药物治疗"和"非药物疗法"为关键词
步骤2:文献质量评价(按文献类型选择工具)
| 文献类型 | 评价工具 | 评分标准 |
|---|---|---|
| 系统综述/meta分析 | AMSTAR2 | 关键条目不符合数量决定质量等级 |
| RCT | Jadad | 3分以下=低质量,4分以上=高质量 |
| 病例对照/队列 | NOS | ≥9星=高质量,5-6星=中等,≤4星=低质量 |
| 横断面研究 | AHRQ | ≥8分=高质量,6-7分=中等,≤5分=低质量 |
步骤3:证据等级确定
- 综合Cochrane协作网、牛津循证医学中心、GRADE评价系统
- 证据1-5级 → 推荐A-D级
步骤4:推荐意见形成
- 德尔菲专家会商法
- 邀请15-30名专家
- Likert 5级评分
- ≥4分专家比例≥75%即达成共识
6. 实验与结果 (Experiments)
本文为方法学综述类文章,无实验和数据结果。本文以操作框架和评分标准的梳理为核心产出。
7. 思考与评价 (Comments)
-
优点:
- 将分散的文献质量评价工具整合为一条完整的操作链,具有很强的实用性
- 给出了每个工具的量化评分标准和阈值,可操作性强
- 覆盖了四种主要研究类型的评价方法,较为全面
- 流程图(图2)清晰展示了从检索到推荐形成的全流程
-
不足:
- 没有对指南产出的知识本身进行分类——只讨论了"怎么写指南",没讨论"指南写好后里面有什么知识"
- 缺乏对不同类型指南(如药物指南、手术指南、筛查指南)之间差异的讨论
- 作为方法学参考,缺少实际指南制定的案例验证
-
启发:
- 本文梳理的GRADE分级体系、推荐强度、文献质量评价标准等,都是指南中典型的元知识
记录时间:2025-07-29

浙公网安备 33010602011771号