FDA 正考虑像考核医生一样评估 AI 医疗器械
FDA 正在讨论用一种“基于能力的评估方法”审查生成式 AI 医疗器械
在2026 年 8 月,FDA发布讨论的文件中提出了一种“能力本位”的评估思路。Axios 将其概括为:像评价和认证医生一样评价医疗 AI——设定能力标准、通过基准测试,再确认它在真实临床环境中的表现。
这套思路借鉴了医生的考核与资质认证:先针对特定临床任务设定能力标准,通过基准测试评估模型,再确认它在真实临床环境中的表现。
让 AI 参加执业医师考试?
“让 AI 参加执业医师考试”,更准确的含义是“能力本位评估”。
可以拆成三个层次:
第一,按临床任务定义能力。
例如,AI 是负责排除疾病、分诊、生成报告、提供诊断建议,还是直接提出治疗方案?不同任务的错误后果不同,考核标准也不应相同。
第二,设置有临床意义的能力基准。
不只是计算准确率,还要考查它能否识别紧急情况、处理不确定信息、拒绝超出能力范围的问题,以及在信息缺失时是否会安全地请求补充资料。
第三,在真实临床环境中验证。
同一个模型在标准题库上表现很好,并不代表它能适应真实医院里的病历格式、患者构成、设备差异和医生工作流。FDA 讨论的是“基准测试 + 临床环境确认”,而不是只进行一次闭卷考试。
FDA 认为,生成式 AI 与传统医疗软件有明显区别。它的输出存在变化,能力可能随模型更新而改变,而且应用范围可能从提供信息一直延伸到直接参与患者诊疗。因此,仅在上市前测试某个固定版本,可能不足以持续证明产品安全有效。
讨论文件提出,评估风险时可以同时考虑两个因素:
- AI 执行的任务类型;
- 错误输出可能造成的后果有多严重。
在上市前评估方面,FDA 提出一个关键问题:AI 应当和谁比较?可能的参照标准包括由合格医生组成的专家组,其共识代表临床标准;也可能是现实医疗环境中的“中位数医生”。
从一次审批转向持续监管
FDA 正在讨论,是否可以接受生成式 AI 上市前存在较多不确定性,同时通过更严格的上市后监测来控制风险。这意味着监管可能从“一次审批”逐渐转向持续观察模型在真实世界中的表现。
这是一次意见征求
不过,这项方案仍处于非常早期的讨论阶段。FDA 明确表示,该文件不是正式或草案指南,也没有改变当前监管政策,主要目的是向医生、企业、研究人员和公众征求意见。
浙公网安备 33010602011771号