Detecting Clinical Discrepancies in Health Coaching Agents with Dual-Stream Memory

一、论文核心内容

1. 研究背景痛点

健康随访辅导智能体存在两类信息源天然冲突的安全隐患:
 
1)患者自述记忆:时效性强,但存在记忆偏差、主观夸大、口误、AI 幻觉;
 
2)标准化电子病历 EHR(FHIR 规范):具备医学权威验证,但数据更新滞后,无法实时反映患者当下状态。
 
传统通用记忆架构会直接用最新对话覆盖旧病历信息,强制抹平矛盾,极易把患者错误主诉固化为诊疗依据,引发用药、健康指导安全风险;现有方案缺少专门机制识别、分类、调和两类数据源的临床冲突。

2. 核心架构:双流分离记忆 + 冲突调和引擎

(1)Dual-Stream Memory 双流隔离存储(核心创新)

两条记忆流物理独立、互不覆盖,全程分开存储,不互相覆写:
  1. 患者自述记忆流(Narrative Stream)
     
    存储每轮随访对话提取的患者主观描述、即时症状、生活反馈,随会话持续增量更新,保留完整时序主观表述,不做自动覆盖。
  2. 权威病历记忆流(FHIR Stream)
     
    存储结构化、医院核验的客观检查、病史、用药记录,仅在医院同步更新 EHR 时才修改,属于静态可信基准库。

(2)Reconciliation Engine 冲突调和检测引擎

每抽取一条患者记忆,自动和 FHIR 病历流做交叉校验,完整流程:
  1. 冲突分类:按冲突类型(数值偏差 / 症状矛盾 / 用药冲突 / 过时病历)、风险等级(普通 / 安全高危)标记;
  2. 溯源定位:绑定对应 FHIR 字段与对话原文,记录冲突产生会话轮次;
  3. 分级调和策略:
    • 高危冲突:智能体输出提示,暂缓给出健康建议,引导患者核对 / 同步病历;
    • 普通时序偏差:同时展示两条记忆来源,不单方面覆盖任意一方;
    • 病历过期冲突:标记 EHR 时效性,提醒同步最新检查数据。

3. 完整运行流程

  1. 健康辅导智能体和患者完成一轮随访对话;
  2. 抽取结构化临床信息存入患者自述记忆流;
  3. 调和引擎将新记忆与FHIR 病历流逐条比对,识别临床不一致;
  4. 按冲突风险分级处理,生成带双来源证据的健康指导回复;
  5. 长期持续保存两条记忆流,不自动删除、覆盖任一数据源。

4. 实验设置与结果

  • 数据集:26 名患者、675 轮纵向随访会话,真实医患对话 + FHIR 标准合成临床场景混合;
  • 核心指标:冲突检测准确率 84.4%,高危安全冲突召回率 86.7%;
  • 关键结论:传统单一流记忆存在 13.6% 误差连锁传导,误差根源是对话文本提取丢失临床细节,而非冲突分类模块;双流架构可完全阻断错误主诉覆盖权威病历的安全风险。

5. 核心贡献

  1. 提出双流隔离记忆架构,分离主观患者自述与客观权威病历,杜绝单方信息覆盖带来的临床安全隐患;
  2. 设计专用临床冲突调和引擎,可自动分类、分级溯源医患信息不一致;
  3. 量化验证记忆抽取环节的误差传导问题,为医疗智能体记忆安全提供评测范式。

二、论文固有局限性

1. 记忆机制层面短板

  1. 无记忆准入筛选机制
     
    两条记忆流仅做隔离存储,缺少验证、巩固流程,患者单次偶然错误、AI 幻觉会永久保存在自述流中,仅靠冲突检测事后拦截,无法从源头过滤污染记忆;无成熟度评估、自动淘汰失效主观信息的逻辑。
  2. 缺少记忆自主进化能力
     
    仅做静态存储与冲突比对,不会自动提炼长期健康规律、合并重复随访信息;长期多轮会话后两条记忆库持续膨胀,检索效率逐步下降,无自动精简治理模块。
  3. 冲突调和规则偏启发式
     
    风险分级、矛盾判定依靠人工预设规则,无法自适应罕见病、特殊并发症等小众临床场景,泛化性不足;无多智能体辩证校验机制,单一 LLM 判定冲突易出现漏检。

2. 数据与临床场景局限

  1. 数据集规模小、场景单一
     
    仅 26 名患者随访数据,以慢性病健康辅导为主;未覆盖肿瘤、急诊、精神心理等高危诊疗场景,缺少大规模多中心真实脱敏 EHR 验证。
  2. 仅支持纯文本时序数据,无多模态兼容
     
    双流记忆只存储文字病历与对话,无法融合 CT/MRI 影像、检验影像时序病灶信息,不能处理影像与文字主诉的跨模态临床冲突。
  3. 依赖 FHIR 标准化结构化病历
     
    对无规范结构化电子病历的基层医疗机构、线下纸质病历兼容性差,落地门槛高。

3. 实验与评测缺陷

  1. 缺少临床医师人工盲测
     
    性能仅依靠自动指标统计,未邀请全科 / 慢病医师评估冲突识别的临床实用价值、指导方案安全性。
  2. 横向对比不充分
     
    仅对比传统单一流基线,未对标 A-MEM、SkeMex、海马体渐进准入等前沿医疗记忆框架,无法证明双流架构相对现有先进方案的增量优势。
  3. 无超长周期长期仿真实验
     
    仅数百轮短期随访测试,未验证跨数年、上千轮会话下记忆检索速度、冲突漏检率的长期稳定性。

4. 工程与落地短板

  1. 双记忆并行存储带来算力与 Token 开销翻倍
     
    同时维护两条独立记忆流,上下文输入长度、向量检索成本显著高于单流记忆,轻量化部署成本高;
  2. 隐私保护设计缺失
     
    双流完整留存患者全部主观对话与完整病历,未设计分级脱敏、访问权限管控,不符合医疗数据隐私合规要求;
  3. 无法自动更新过时病历
     
    仅能检测 EHR 过期,没有对接医院数据接口自动同步最新检查结果的工具调用链路,依赖人工更新病历库。
 
 https://arxiv.org/abs/2604.27045

posted on 2026-08-05 17:40  limingqi  阅读(9)  评论(0)    收藏  举报

导航