谷歌新的人工智能系统在复杂诊断中超越医生

谷歌新的人工智能系统在复杂诊断中超越医生

原文链接

想象一下带着令人困惑的症状去看医生。快速得到正确的诊断至关重要,但有时即使是经验丰富的医生在拼凑谜团时也会面临挑战。有时可能根本不是什么严重的事情;而有时可能需要进行深入的调查。难怪人工智能系统在这里取得了进展,因为我们已经看到它们在越来越多地协助需要思考文档模式的任务。但谷歌似乎在实现“人工智能医生”这一目标上迈出了非常坚实的一步。

人工智能进入医学领域并非完全新鲜;算法(包括许多基于人工智能的算法)多年来一直在帮助临床医生和研究人员进行图像分析等任务。我们最近看到了一些轶事证据,以及一些记录在案的证据,表明人工智能系统,特别是大型语言模型(LLMs),可以帮助医生进行诊断,有些声称其准确性几乎相似。但在这个案例中,情况完全不同,因为谷歌研究的新工作引入了一个专门针对与诊断相关的数据集进行训练的 LLM。虽然这只是一个起点,而且许多挑战和考虑因素在我将要讨论的方面还有很多,但事实是明确的:一个强大的新人工智能玩家正在进入医疗诊断领域,我们最好为此做好准备。在这篇文章中,我将主要关注这个新系统是如何工作的,沿途指出各种出现的考虑因素,其中一些在《自然》杂志的谷歌论文中讨论过,而另一些则在相关社区中辩论过——即医生、保险公司、政策制定者等。

介绍谷歌新的人工智能医疗诊断系统

复杂的大型语言模型的出现,正如你肯定知道的,这些是经过大量数据集训练以“理解”和生成类似人类文本的人工智能系统,这代表着我们在处理、分析和生成信息(在本文末尾我发布了一些与此相关的其他文章——去看看它们!)方面的重大转变。特别是最新的模型带来了一种新的能力:参与细微的基于文本的推理和对话,使它们成为复杂认知任务(如诊断)的潜在合作伙伴。实际上,我在这里讨论的谷歌的新工作只是快速发展的一个领域中的一个点,该领域正在探索这些先进的 AI 工具如何理解和贡献于临床工作流程。

我们正在研究的这项研究以同行评审的形式发表在享有盛誉的期刊《自然》上,在医学界引起了波澜。在他们的文章《利用大型语言模型实现准确的鉴别诊断》中,谷歌研究团队介绍了一种称为 AMIE(Articulate Medical Intelligence Explorer)的专用 LLM,它专门使用临床数据进行训练,旨在辅助医疗诊断甚至完全自主运行。该研究的作者测试了 AMIE 为数百个复杂、真实世界的医疗案例生成可能诊断列表的能力——医生称之为“鉴别诊断”。这些案例以挑战性案例报告的形式发表。

下面是包含完整技术细节的论文:

www.nature.com/articles/s41586-025-08869-4

意想不到的结果

研究结果引人注目。当 AMIE 独立工作时,仅分析案例报告的文本,其诊断准确率显著高于无辅助的资深医生!AMIE 几乎 60%的时间将其正确诊断列入前十位,而未经辅助的医生这一比例约为 34%。

非常有趣的是,并且有利于 AI 系统,AMIE 单独略优于由 AMIE 本身辅助的医生!虽然使用 AMIE 的医生与使用标准工具(如 Google 搜索)相比,其准确性显著提高(达到超过 51%的准确性),但 AI 在这个特定指标上仍然略胜一筹,因为这些病例具有挑战性。

另一个让我感到敬畏的“亮点”是,在这项将 AMIE 与人类专家进行比较的研究中,AI 系统仅分析了用于测试它的案例报告中的基于文本的描述。然而,人类临床医生可以访问完整的报告,即 AMIE 可以获得的相同文本描述,以及图像(如 X 光片或病理切片)和表格(如实验室结果)。AMIE 在没有这种多模态信息的情况下仍然优于无辅助的临床医生,这一事实一方面令人瞩目,另一方面也突显了未来发展的一个明显领域:整合和推理多种数据类型(文本、成像、可能还包括原始基因组学和传感器数据)是医疗 AI 真正反映全面临床评估的关键前沿。

AMIE 作为一个超级专业的大型语言模型(LLM)

那么,像 AMIE 这样的 AI 是如何取得如此令人印象深刻的成果,甚至优于一些可能拥有多年诊断疾病经验的专家的呢?

在其核心,AMIE 建立在 LLM 的基础技术之上,类似于 GPT-4 或谷歌自己的 Gemini 等模型。然而,AMIE 不仅仅是一个具有医学知识的通用聊天机器人。它专门针对临床诊断推理进行了优化。正如 Nature 论文中更详细地描述的那样,这包括:

  • 专业训练数据:在包含诊断的大量医学文献语料库上微调基础 LLM。

  • 指令调整:训练模型遵循与生成鉴别诊断、解释其推理以及在临床环境中有益互动相关的特定指令。

  • 从人类反馈中进行强化学习:可能使用临床医生的反馈来进一步细化模型的响应,以提高准确性、安全性和实用性。

  • 推理增强:旨在提高模型将症状、病史和潜在条件进行逻辑连接的能力的技术;类似于在像 Google 自己的 Gemini 2.5 Pro 这样的非常强大的模型推理步骤中使用的技术!

注意,该论文本身表明,AMIE 在针对此任务的自动评估中优于 GPT-4,突出了领域特定优化的好处。值得注意的是,但也是负面的,该论文没有将 AMIE 的性能与其他通用 LLM 进行比较,甚至没有与 Google 自己的“智能”模型如 Gemini 2.5 Pro 进行比较。这相当令人失望,我无法理解这篇论文的审稿人如何忽略了这一点!

重要的是,AMIE 的实施旨在支持交互式使用,以便临床医生可以提出问题来探究其推理——这与常规诊断系统的一个关键区别。

测量性能

在产生的诊断中测量性能和准确性并不简单,对于具有数据科学思维的你读者来说很有趣。在他们的工作中,研究人员并没有孤立地评估 AMIE;相反,他们采用了一种随机对照设置,其中 AMIE 与未受协助的临床医生、受标准搜索工具(如 Google、PubMed 等)协助的临床医生以及由 AMIE 本身协助的临床医生(他们也可以使用搜索工具,尽管他们使用得较少)进行了比较。

研究中产生数据的分析涉及了多个指标,而不仅仅是简单的准确性,最显著的是 top-n 准确性(询问:正确的诊断是否在前 1、3、5 或 10 位?),质量分数(列表与最终诊断的接近程度如何?),适宜性和全面性——后两者由对诊断列表来源不知情的独立专家医生进行评分。

这种广泛的评估比单一的准确性数字提供了更稳健的图像;并且与未受协助的性能和标准工具的比较有助于量化 AI 的实际增值。

为什么 AI 在诊断方面做得如此出色?

与其他专业医疗 AI 一样,AMIE 是在大量的医学文献、案例研究和临床数据上训练的。这些系统可以处理复杂信息,识别模式,并且比人类大脑在处理无数其他任务时更快、更全面地回忆起罕见的条件。特别是,AMIE 被特别优化以适应医生在诊断时使用的推理方式,类似于其他推理模型,但在这种情况下专门针对诊断。

对于研究中特别棘手的“诊断谜题”(来源于享有盛誉的《新英格兰医学杂志》),AMIE 在没有人类偏见的情况下筛选可能性的能力可能给它带来优势。正如一位观察者在社交媒体上引发的大量讨论中指出的,AI 不仅在简单病例上表现出色,而且在一些相当具有挑战性的病例上也表现出色。

AI 单独与 AI + 医生

发现 AMIE 单独略优于 AMIE 辅助的人类专家令人困惑。从逻辑上讲,将熟练医生的专业判断与强大的 AI 相结合应该会产生最佳结果(正如之前的研究所显示)。确实,使用 AMIE 的医生比没有使用它的医生表现更好,产生了更全面和准确的诊断列表。但 AMIE 单独工作略优于辅助它的医生。

为什么在这个研究中 AI 单独有轻微的优势?正如一些医学专家在社交媒体上强调的,这个小小的差异可能并不意味着医生使 AI 变得更糟,或者反过来。相反,它可能表明,由于不熟悉该系统,医生还没有找到与具有比人类更强的原始分析能力、针对特定任务和目标的 AI 系统最佳合作的方式。这就像当我们需要 LLM 的帮助时,我们可能并没有与常规 LLM 完美互动一样。

再次很好地平行于我们与常规 LLMs 的互动方式,医生可能最初过于坚持自己的观点(“锚定偏见”)或者不知道如何最好地“质询”AI 以获得最有用的见解。这全是一种我们需要学习的新团队合作方式——人与机器的结合。

等等——AI 明天会取代医生吗?

当然绝对不是。理解局限性至关重要:

  • 诊断“谜题”与真实患者对比: 在展示 AMIE 的研究中使用了书面病例报告,这是一种浓缩、预包装的信息,与医生在与患者互动过程中所接触到的原始输入大相径庭。真正的医学涉及与患者交谈,了解他们的病史,进行体格检查,解读非言语线索,建立信任,以及管理持续的治疗——这些都是 AI 目前至少无法做到的事情。医学甚至涉及人类联系、同理心和应对不确定性的能力,而不仅仅是数据处理。例如,考虑一下安慰剂效应、幽灵疼痛、体格检查等。

  • AI 并不完美: LLM 仍然可能犯错误或“产生幻觉”信息,这是一个主要问题。所以即使 AMIE 被部署(这不会发生),它也需要熟练的专业人士的非常密切的监督。

  • 这只是一个具体任务:生成诊断清单只是医生工作的一部分,而医生访问的其余部分当然还有许多其他组成部分和阶段,这些都不是由这样的专门系统处理的,并且可能非常难以实现,正如所讨论的原因。

连续发表:向对话式诊断人工智能迈进

更令人惊讶的是,在同一期的《自然》杂志中,紧随 AMIE 文章之后,谷歌研究部门发表的另一篇论文显示,在诊断对话中(即不仅仅是症状分析,而是患者与医生或 AMIE 之间的实际对话)该模型也优于医生!因此,尽管前一篇论文发现 AMIE 的诊断客观上更好,但第二篇论文则表明,AI 系统在向患者传达结果(在质量和同理心方面)方面做得更好!

结果并非微不足道:在 159 个模拟案例中,专科医生在 32 个指标中有 30 个认为 AI 优于初级保健医生,而测试患者中有 25 个指标更倾向于 AMIE。

这篇第二篇论文就在这里:

www.nature.com/articles/s41586-025-08866-7

真的:医学协会现在必须引起注意

尽管存在许多局限性,这项研究和类似的研究发出了强烈的呼声。专门的 AI 正在迅速发展,并展现出可以增强,在某些狭窄任务中甚至超越人类专家的能力。

医学协会、执照委员会、教育机构、政策制定者、保险公司,以及为什么不是世界上所有可能成为基于 AI 健康调查对象的每个人,都需要了解这一点,并且这个话题必须被放在政府议程的高位。

AI 工具如 AMIE 和未来的工具可以帮助医生更快、更准确地诊断复杂情况,可能改善患者结果,特别是在缺乏专业知识的领域。它还可能帮助快速诊断并排除健康或低风险患者,减轻必须评估更严重病例的医生的负担。当然,所有这些都可以提高解决患者复杂健康问题的机会,同时降低成本和等待时间。

就像在许多其他领域一样,医生的角色将随着 AI 的出现而演变,迟早会如此。也许 AI 可以承担更多的初步诊断工作,从而让医生有更多时间与患者互动、进行复杂决策和治疗规划——这也许可以缓解因过度文书工作和匆忙预约而导致的职业倦怠,正如一些人所希望的那样。正如有人在社交媒体上讨论这篇论文时所指出的,并不是每位医生都乐于每小时接待 4 名或更多患者,并完成所有相关的文书工作。

为了推进类似 AMIE 这样的系统即将到来的应用,我们需要指导方针。这些工具应该如何安全、合乎道德地整合?我们如何确保患者安全并避免过度依赖?当人工智能辅助诊断出错时,谁应该负责?对这些问题的答案还没有明确的共识。

当然,医生需要接受如何有效使用这些工具的培训,了解它们的优缺点,并学习将本质上是一种新的形式的人机协作。这一发展必须得到医疗专业人士的支持,而不是强加给他们。

最后,正如它总是回到桌面上:我们如何确保这些强大的工具不会加剧现有的健康差距,反而帮助弥合获取专业知识方面的差距?

结论

目标不是取代医生,而是赋予他们力量。显然,像 AMIE 这样的 AI 系统作为高度知识渊博的助手,在日常生活中以及特别是在灾难、流行病期间或海外船只、太空船或外星殖民地等偏远和孤立的地方等复杂环境中具有巨大的潜力。但安全有效地实现这一潜力需要医疗界积极、批判性地、紧急地与这项快速发展的技术互动。诊断的未来很可能是 AI 协作的,因此我们需要从现在开始制定互动规则。

参考文献

展示 AMIE 的文章:

使用大型语言模型实现准确鉴别诊断

这里是测试患者对 AMIE 评估的结果:

迈向对话式诊断人工智能

这里还有一些你可能喜欢的我的其他帖子

测试多模态 AI 系统在阅读和解释照片、地图、图表等方面的能力

posted @ 2026-03-27 10:29  布客飞龙III  阅读(8)  评论(0)    收藏  举报