MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis
MedEyes(AAAI 2026)论文完整解读
一、核心背景(现有医疗 VLM 痛点)
现有医疗多模态大模型 + 思维链 CoT + 强化学习 RLVR 存在明显缺陷:
- 模型一次性读取整张医学影像,没有模拟医生 “先全局扫视、再聚焦病灶细查” 的渐进诊断流程;
- 纯在线策略强化学习只会重复表面通顺、但临床逻辑错误的推理路径;
- 视觉注意力不可控,容易忽略微小病灶、无关区域占用大量算力,推理可解释性差;
- 缺少专家阅片视线轨迹(gaze)的外部引导,模型视觉搜索不符合临床规范。
二、论文核心目标
提出MedEyes强化学习框架,让医疗视觉语言模型模仿临床医生动态渐进式视觉聚焦:先全局扫描定位可疑区域,再放大病灶精细分析,分步完成医学影像问答(Medical VQA),同时引入专家阅片轨迹约束,提升诊断准确率与临床可信度。
三、三大核心创新模块
1. GRN 注视引导推理导航器(Gaze-guided Reasoning Navigator)
双模式探索机制,复刻医生阅片两步逻辑:
- 扫描模式(Scan):粗粒度全局遍历,批量标记所有潜在异常候选区域;
- 深挖模式(Drill):对可疑病灶裁剪放大,提取细粒度病理特征;
交替执行扫描 - 深挖,形成多轮渐进视觉推理路径,而不是一次性全局编码整张图。
2. CVS 置信度采样器(Confidence Value Sampler)
平衡「模仿专家视线」与「自主探索病灶」:
- 核采样生成多条合理视觉搜索路径;
- 自适应终止机制:病灶证据充足自动停止聚焦,避免无效重复扫描;
兼顾多样性与临床合理性,防止模型单一固化的错误阅片逻辑arXiv。
3. 双流 GRPO 优化框架
解决传统 RLVR 在线学习偏见问题:
- 在线分支:模型自主生成视觉路径与诊断推理;
- 离线分支:导入真实专家阅片视线轨迹作为监督信号;
解耦两类梯度,缓解奖励同化、熵坍缩,让视觉行为贴合临床规范。
四、整体工作流程
- 输入医学影像 + 临床问题;
- GRN 先全局扫描,圈出疑似病变区域;
- CVS 生成多条可信细粒度深挖路径;
- 模型反复聚焦病灶提取视觉证据,搭配思维链输出诊断;
- 双流强化学习同时用专家视线 + 诊断奖励联合优化视觉聚焦策略。
五、实验与效果
测试数据集:VQA-RAD、SLAKE、PathVQA 等 5 个主流医疗视觉问答基准
- 整体指标平均提升 +8.5 个百分点;
- SLAKE 数据集达到 79.1%,显著超越 GPT-4o、InternVL2 等通用多模态大模型;
- 病灶召回率大幅提升,微小病变漏诊明显减少;
- 视觉推理过程可可视化,医生能看清模型 “先看哪里、再看哪里”,可解释性更强。
六、核心贡献总结
- 首个基于动态渐进视觉聚焦的医疗 VQA 强化学习框架,模拟真实临床阅片流程;
- GRN 双模式扫描 + 深挖,解决模型一次性全局看图的缺陷;
- 离线专家视线引导 + 双流 GRPO,修正纯在线 RL 的临床逻辑偏差;
- 大幅提升医疗问答精度,推理路径可视化,更适合临床辅助诊断落地。
七、适配你的医工 AI 赛道价值
- 思路贴合医学影像 VLM、Medical Agent、病灶定位方向;
- 核心创新点「动态视觉注意力渐进检索」可迁移到你的医学多模态智能体课题;
- 完整强化学习 + 视觉检索范式,适合用于 NeurIPS/MICCAI 类顶会创新写作参考。
https://www.modelscope.cn/papers/2511.22018
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22185223
浙公网安备 33010602011771号