ClinicalAgents: Clinical Trial Multi-Agent System with Longitudinal Memory

一、论文核心内容

1. 研究背景痛点

现有临床试验智能体存在三大缺陷:
 
1)仅单次静态读取试验方案,无法留存纵向时序患者数据、多轮随访演变信息,不能跟踪受试者长期健康变化;
 
2)单智能体包揽全部任务,临床试验流程拆分粗糙,无法专业化分工(招募、药效、安全、方案规划);
 
3)记忆无分层隔离,试验方案、患者时序记录、医学指南混杂,检索效率低,易产生临床幻觉、数据时序泄露。

2. 整体架构:多角色分工智能体 + 纵向双记忆系统

(1)五类专业化临床试验智能体(协同调度)

image
多智能体分工架构图
 
  1. 规划智能体:采用 Least-to-Most 拆解复杂试验任务,分配子任务至对应专业智能体;
  2. 招募智能体:匹配患者入排标准,评估受试者招募难度;
  3. 药效智能体:分析干预手段疗效、对比历史同类试验数据;
  4. 安全智能体:核查不良反应、药物禁忌、风险事件;
  5. 推理调度智能体:调用外部医学数据库(DrugBank、ClinicalTrials.gov)、预测模型,汇总各智能体结论输出试验预测结果。

(2)核心创新:Longitudinal Memory 纵向分层记忆

双存储隔离设计,专门适配长期随访、跨周期临床试验时序需求:
  1. 短期工作记忆(Working Memory)
     
    实时存储当前受试者单次访视检查、症状、用药,仅保留本次会话时序状态,会话结束不永久留存;动态更新患者实时健康快照。
  2. 纵向长期经验记忆(Longitudinal Experience Memory)
     
    结构化归档受试者全周期随访记录、历史完整试验方案、已验证临床指南;带时间戳时序索引,支持跨数月 / 数年的纵向回溯对比;
     
    记忆按「患者 ID + 时间轴」分层存储,区分试验通用知识与个体专属病程,规避时序混淆。

(3)推理机制

融合 ReAct 推理循环 + MCTS 动态调度:智能体交互迭代生成试验假设,依托纵向记忆调取历史病程证据,缺失信息则自动调用外部医学数据库补全;出现矛盾病程数据时回溯记忆重新校验。

3. 实验设置与效果

  1. 任务:临床试验结局预测、入组患者匹配、试验方案风险筛查;
  2. 数据集:ClinicalTrials.gov 公开试验记录、模拟纵向随访 EHR 时序数据;
  3. 基线:单 LLM、普通单层记忆医疗智能体、无分工简易多智能体;
  4. 结果:试验结局预测 PR-AUC 达 0.7908,较无纵向记忆基线提升 0.3326;长期随访任务幻觉发生率下降 41%,跨周期患者病程匹配准确率显著提升。

4. 核心贡献

  1. 面向临床试验场景,构建专业化分工多智能体协同框架,覆盖招募 / 药效 / 安全全流程;
  2. 提出纵向时序分层记忆,专门解决长周期受试者随访数据留存、时序追溯难题;
  3. 打通多智能体协作与时序记忆联动,大幅降低临床试验推理幻觉,提升长期病例分析可靠性。

二、论文固有局限性

1. 记忆机制层面(核心短板)

  1. 无记忆准入筛选机制:短期记忆全部直接写入长期纵向库,缺少验证、巩固流程,患者主诉、AI 推断的未证实病程会永久固化,存在记忆污染风险;
  2. 记忆仅做时序存储,无自主进化、知识提炼能力,无法自动合并同类病程、淘汰过时失效信息,长期运行记忆库持续膨胀、检索效率衰减;
  3. 不支持冲突记忆自动消解:同一患者前后矛盾的检查数据仅做标记,无自动回退、降级观察逻辑,依赖人工事后清理。

2. 多智能体协作短板

  1. 智能体分工、交互规则完全人工预设,无法根据新型临床试验(罕见病、多中心交叉试验)自适应调整角色与协作流程,可扩展性差;
  2. 无辩论纠错机制,各智能体输出冲突结论时仅由调度智能体简单加权,缺少多方证据辩证校验,无法抑制单方智能体的片面推理幻觉。

3. 临床落地与数据约束

  1. 实验仅使用公开文本试验方案 + 模拟 EHR 时序数据,未接入真实医院脱敏纵向患者病历,缺少真实临床环境验证;
  2. 不兼容多模态医学影像,纵向记忆仅存储文本病程,无法关联 CT/MRI 影像时序病灶变化,适配场景局限于纯文本临床试验;
  3. 未设计完整隐私隔离模块,纵向记忆集中存储全患者时序数据,缺少患者数据分级脱敏、访问权限管控,不符合临床数据合规要求。

4. 算法与工程局限

  1. 重度依赖 GPT-4 闭源大模型基座,未验证开源轻量医疗大模型适配效果,部署成本高;
  2. 缺少长周期(数年)连续仿真测试,无法验证上万条随访记录下记忆检索、调度模块的稳定性;
  3. 未做临床医师盲测人工评估,性能仅依赖自动量化指标,缺少临床专家对推理可信度、安全性的主观校验。

5. 对比实验缺陷

仅对比无记忆 / 单层记忆基线,未和同期 A-MEM、SkeMex、海马体渐进记忆等前沿认知启发记忆框架横向对标,无法证明纵向时序记忆的相对增量优势。
https://arxiv.org/abs/2601.01170

posted on 2026-08-05 16:36  limingqi  阅读(13)  评论(0)    收藏  举报

导航