MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis

MedEyes(AAAI 2026)论文完整解读

一、核心背景(现有医疗 VLM 痛点)

现有医疗多模态大模型 + 思维链 CoT + 强化学习 RLVR 存在明显缺陷:
  1. 模型一次性读取整张医学影像,没有模拟医生 “先全局扫视、再聚焦病灶细查” 的渐进诊断流程;
  2. 纯在线策略强化学习只会重复表面通顺、但临床逻辑错误的推理路径;
  3. 视觉注意力不可控,容易忽略微小病灶、无关区域占用大量算力,推理可解释性差;
  4. 缺少专家阅片视线轨迹(gaze)的外部引导,模型视觉搜索不符合临床规范。

二、论文核心目标

提出MedEyes强化学习框架,让医疗视觉语言模型模仿临床医生动态渐进式视觉聚焦:先全局扫描定位可疑区域,再放大病灶精细分析,分步完成医学影像问答(Medical VQA),同时引入专家阅片轨迹约束,提升诊断准确率与临床可信度。

三、三大核心创新模块

1. GRN 注视引导推理导航器(Gaze-guided Reasoning Navigator)

双模式探索机制,复刻医生阅片两步逻辑:
  • 扫描模式(Scan):粗粒度全局遍历,批量标记所有潜在异常候选区域;
  • 深挖模式(Drill):对可疑病灶裁剪放大,提取细粒度病理特征;
     
    交替执行扫描 - 深挖,形成多轮渐进视觉推理路径,而不是一次性全局编码整张图。

2. CVS 置信度采样器(Confidence Value Sampler)

平衡「模仿专家视线」与「自主探索病灶」:
  • 核采样生成多条合理视觉搜索路径;
  • 自适应终止机制:病灶证据充足自动停止聚焦,避免无效重复扫描;
     
    兼顾多样性与临床合理性,防止模型单一固化的错误阅片逻辑arXiv。

3. 双流 GRPO 优化框架

解决传统 RLVR 在线学习偏见问题:
  • 在线分支:模型自主生成视觉路径与诊断推理;
  • 离线分支:导入真实专家阅片视线轨迹作为监督信号;
     
    解耦两类梯度,缓解奖励同化、熵坍缩,让视觉行为贴合临床规范。

四、整体工作流程

  1. 输入医学影像 + 临床问题;
  2. GRN 先全局扫描,圈出疑似病变区域;
  3. CVS 生成多条可信细粒度深挖路径;
  4. 模型反复聚焦病灶提取视觉证据,搭配思维链输出诊断;
  5. 双流强化学习同时用专家视线 + 诊断奖励联合优化视觉聚焦策略。

五、实验与效果

测试数据集:VQA-RAD、SLAKE、PathVQA 等 5 个主流医疗视觉问答基准
  1. 整体指标平均提升 +8.5 个百分点;
  2. SLAKE 数据集达到 79.1%,显著超越 GPT-4o、InternVL2 等通用多模态大模型;
  3. 病灶召回率大幅提升,微小病变漏诊明显减少;
  4. 视觉推理过程可可视化,医生能看清模型 “先看哪里、再看哪里”,可解释性更强。

六、核心贡献总结

  1. 首个基于动态渐进视觉聚焦的医疗 VQA 强化学习框架,模拟真实临床阅片流程;
  2. GRN 双模式扫描 + 深挖,解决模型一次性全局看图的缺陷;
  3. 离线专家视线引导 + 双流 GRPO,修正纯在线 RL 的临床逻辑偏差;
  4. 大幅提升医疗问答精度,推理路径可视化,更适合临床辅助诊断落地。

七、适配你的医工 AI 赛道价值

  1. 思路贴合医学影像 VLM、Medical Agent、病灶定位方向;
  2. 核心创新点「动态视觉注意力渐进检索」可迁移到你的医学多模态智能体课题;
  3. 完整强化学习 + 视觉检索范式,适合用于 NeurIPS/MICCAI 类顶会创新写作参考。

https://www.modelscope.cn/papers/2511.22018

posted on 2026-08-03 18:08  limingqi  阅读(15)  评论(0)    收藏  举报

导航