Detecting Clinical Discrepancies in Health Coaching Agents with Dual-Stream Memory
一、论文核心内容
1. 研究背景痛点
健康随访辅导智能体存在两类信息源天然冲突的安全隐患:
1)患者自述记忆:时效性强,但存在记忆偏差、主观夸大、口误、AI 幻觉;
2)标准化电子病历 EHR(FHIR 规范):具备医学权威验证,但数据更新滞后,无法实时反映患者当下状态。
传统通用记忆架构会直接用最新对话覆盖旧病历信息,强制抹平矛盾,极易把患者错误主诉固化为诊疗依据,引发用药、健康指导安全风险;现有方案缺少专门机制识别、分类、调和两类数据源的临床冲突。
2. 核心架构:双流分离记忆 + 冲突调和引擎
(1)Dual-Stream Memory 双流隔离存储(核心创新)
两条记忆流物理独立、互不覆盖,全程分开存储,不互相覆写:
- 患者自述记忆流(Narrative Stream)
存储每轮随访对话提取的患者主观描述、即时症状、生活反馈,随会话持续增量更新,保留完整时序主观表述,不做自动覆盖。
- 权威病历记忆流(FHIR Stream)
存储结构化、医院核验的客观检查、病史、用药记录,仅在医院同步更新 EHR 时才修改,属于静态可信基准库。
(2)Reconciliation Engine 冲突调和检测引擎
每抽取一条患者记忆,自动和 FHIR 病历流做交叉校验,完整流程:
- 冲突分类:按冲突类型(数值偏差 / 症状矛盾 / 用药冲突 / 过时病历)、风险等级(普通 / 安全高危)标记;
- 溯源定位:绑定对应 FHIR 字段与对话原文,记录冲突产生会话轮次;
- 分级调和策略:
- 高危冲突:智能体输出提示,暂缓给出健康建议,引导患者核对 / 同步病历;
- 普通时序偏差:同时展示两条记忆来源,不单方面覆盖任意一方;
- 病历过期冲突:标记 EHR 时效性,提醒同步最新检查数据。
3. 完整运行流程
- 健康辅导智能体和患者完成一轮随访对话;
- 抽取结构化临床信息存入患者自述记忆流;
- 调和引擎将新记忆与FHIR 病历流逐条比对,识别临床不一致;
- 按冲突风险分级处理,生成带双来源证据的健康指导回复;
- 长期持续保存两条记忆流,不自动删除、覆盖任一数据源。
4. 实验设置与结果
- 数据集:26 名患者、675 轮纵向随访会话,真实医患对话 + FHIR 标准合成临床场景混合;
- 核心指标:冲突检测准确率 84.4%,高危安全冲突召回率 86.7%;
- 关键结论:传统单一流记忆存在 13.6% 误差连锁传导,误差根源是对话文本提取丢失临床细节,而非冲突分类模块;双流架构可完全阻断错误主诉覆盖权威病历的安全风险。
5. 核心贡献
- 提出双流隔离记忆架构,分离主观患者自述与客观权威病历,杜绝单方信息覆盖带来的临床安全隐患;
- 设计专用临床冲突调和引擎,可自动分类、分级溯源医患信息不一致;
- 量化验证记忆抽取环节的误差传导问题,为医疗智能体记忆安全提供评测范式。
二、论文固有局限性
1. 记忆机制层面短板
- 无记忆准入筛选机制
两条记忆流仅做隔离存储,缺少验证、巩固流程,患者单次偶然错误、AI 幻觉会永久保存在自述流中,仅靠冲突检测事后拦截,无法从源头过滤污染记忆;无成熟度评估、自动淘汰失效主观信息的逻辑。
- 缺少记忆自主进化能力
仅做静态存储与冲突比对,不会自动提炼长期健康规律、合并重复随访信息;长期多轮会话后两条记忆库持续膨胀,检索效率逐步下降,无自动精简治理模块。
- 冲突调和规则偏启发式
风险分级、矛盾判定依靠人工预设规则,无法自适应罕见病、特殊并发症等小众临床场景,泛化性不足;无多智能体辩证校验机制,单一 LLM 判定冲突易出现漏检。
2. 数据与临床场景局限
- 数据集规模小、场景单一
仅 26 名患者随访数据,以慢性病健康辅导为主;未覆盖肿瘤、急诊、精神心理等高危诊疗场景,缺少大规模多中心真实脱敏 EHR 验证。
- 仅支持纯文本时序数据,无多模态兼容
双流记忆只存储文字病历与对话,无法融合 CT/MRI 影像、检验影像时序病灶信息,不能处理影像与文字主诉的跨模态临床冲突。
- 依赖 FHIR 标准化结构化病历
对无规范结构化电子病历的基层医疗机构、线下纸质病历兼容性差,落地门槛高。
3. 实验与评测缺陷
- 缺少临床医师人工盲测
性能仅依靠自动指标统计,未邀请全科 / 慢病医师评估冲突识别的临床实用价值、指导方案安全性。
- 横向对比不充分
仅对比传统单一流基线,未对标 A-MEM、SkeMex、海马体渐进准入等前沿医疗记忆框架,无法证明双流架构相对现有先进方案的增量优势。
- 无超长周期长期仿真实验
仅数百轮短期随访测试,未验证跨数年、上千轮会话下记忆检索速度、冲突漏检率的长期稳定性。
4. 工程与落地短板
- 双记忆并行存储带来算力与 Token 开销翻倍
同时维护两条独立记忆流,上下文输入长度、向量检索成本显著高于单流记忆,轻量化部署成本高;
- 隐私保护设计缺失
双流完整留存患者全部主观对话与完整病历,未设计分级脱敏、访问权限管控,不符合医疗数据隐私合规要求;
- 无法自动更新过时病历
仅能检测 EHR 过期,没有对接医院数据接口自动同步最新检查结果的工具调用链路,依赖人工更新病历库。
https://arxiv.org/abs/2604.27045
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22254506
浙公网安备 33010602011771号