Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory
1. 研究问题
面向交互式临床诊疗医疗智能体,现有记忆模块存在四点缺陷:
1)直接存储完整原始交互轨迹,存储冗余、混杂无效噪声,无法区分经验对推理任务的增益;
2)病例间推理流程相互隔离,缺少可复用标准化诊疗流程,跨病种泛化能力弱;
3)模型性能迭代依赖大模型权重微调,算力成本高,易出现灾难性遗忘;
4)缺少自动化记忆库维护机制,随病例累积记忆持续膨胀,检索效率持续下降。
2. 提出方法:SkeMex(基于技能进化的无参数自进化记忆框架)
整体采用Read-Write-Assess-Govern四阶段闭环循环,全程不更新基础多模态模型权重,外置独立技能仓库实现经验迭代。
(1)分层技能仓库
将诊疗交互轨迹蒸馏为三级结构化技能单元存储:
- 通用层技能:跨病种通用阅片、问诊、基础影像工具调用流程;
- 任务专属技能:单病种定向病灶筛查、多模态影像配准、纵向对比诊断流程;
- 动作级技能:窗宽调节、ROI 勾画、病灶尺寸测量等基础影像操作原语。
(2)价值感知检索模块
推理阶段执行双重匹配:语义相似度匹配 + 临床效用估值。基于历史诊断反馈量化单条技能推理正确率,高效用技能分配更高检索权重,过滤误导性历史经验。
(3)轨迹转技能蒸馏模块
单次诊疗交互完成后,过滤无效操作步骤,将完整有效推理链路压缩为标准化结构化技能条目,写入分层仓库。
(4)效用评估模块
以诊断真值、临床反馈为监督信号,为每条技能生成量化得分,区分高价值有效技能与低质量失效技能。
(5)仓库治理模块
自动执行三项维护操作:合并内容重复的同质技能、淘汰低分易误诊技能、提升高频高收益技能检索权重,控制仓库存储规模。
完整闭环执行流程
- Read:接收 DICOM 影像与临床问题,检索分层技能库中高匹配、高效用诊疗技能辅助推理;
- 智能体依托检索技能完成交互式阅片、多工具联动、多步推理,输出初步诊断;
- Write:基于本次完整交互轨迹蒸馏新技能条目存入仓库;
- Assess:结合诊断真值计算本次所用技能效用分数;
- Govern:执行仓库精简、权重更新、劣质技能淘汰;
- 进入下一例病例推理循环。
3. 实验设置
数据集
采用放射影像 VQA 数据集 VQA-RAD、SLAKE、PathVQA,覆盖脑部 MRI、肺部 CT 多模态完整影像病例。
基线模型
1)无记忆基础医疗智能体;
2)原始轨迹存储型记忆智能体;
3)基于模型微调的持续学习医疗智能体。
评测指标
诊断准确率、工具调用有效率、推理步骤长度、记忆检索耗时、跨病种泛化精度。
4. 实验结果
- 搭载 SkeMex 框架后,全部数据集诊断准确率显著优于各类基线;
- 推理冗余步骤减少,无效影像工具调用频次大幅下降;
- 跨少见病种病例泛化能力提升,可复用同类疾病历史诊疗技能;
- 对比微调方案,无权重更新带来算力开销降低,不存在灾难性遗忘现象;
- 仓库治理机制可稳定控制存储规模,长期运行检索效率无明显衰减。
5. 论文核心贡献
- 提出部署后无参数自进化框架 SkeMex,外置技能记忆实现智能体性能提升,无需微调基础模型;
- 设计轨迹 - 技能蒸馏范式,将无序交互记录转化为分层可复用程序性临床知识;
- 构建价值感知检索与自动化仓库治理体系,以临床诊断反馈完成非参数化经验优胜劣汰;
- 在多组医疗影像问答基准验证方法有效性,提升医疗智能体跨病例泛化推理能力。
6. 结论
SkeMex 通过结构化技能沉淀与闭环自主进化,解决传统医疗智能体经验复用难、迭代成本高、记忆库冗余问题,可直接外挂集成至现有医疗多模态智能体系统,适配临床线上持续迭代场景。
https://www.modelscope.cn/papers/2606.09365
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22208842
浙公网安备 33010602011771号