医学影像论文精读

核心目标

医学影像的核心目标是用计算机视觉方法,从 MRI/CT/超声/X 光/病理切片/内窥镜视频等医学影像中自动完成分割、检测、重建、诊断与预后,在不加重医生负担、不乱用敏感数据的前提下,提升诊疗的效率、精度与可及性。

一、趋势 · 四个方向与意义

① 简单介绍 CVPR 2026 医学影像方向约 174 篇,是会议里最活跃的应用赛道之一,覆盖脑科学、数字病理、手术感知、影像重建、分割检测、多模态诊断等。方法上呈现「大模型化 + 生成式」双引擎主导的格局,同时可信与可部署(域适应/不确定性)成为明显的落地导向。

② 大模型化与多模态语言接口 多模态大模型(MLLM/VLM)成为全场最强信号——让影像「会看、会说、会推理」,支撑视觉问答(VQA)、放射报告自动生成、视觉定位与链式诊断推理。全局热度:多模态融合 49、多模态大模型 26、报告生成 12、VQA 11。

③ 生成式合成与数据稀缺 扩散模型等生成式方法(19 篇)缓解医学数据稀缺与隐私壁垒,做可控合成、虚拟染色、跨模态翻译,为下游分割/检测提供高质量的「数据燃料」,也用于数据增广与隐匿信息保护。

④ 可信与可部署 域泛化(16)/域适应(12)/不确定性(11)/OOD 等直面跨中心、跨设备落地与「模型何时会错」,是论文真正进医院的前置条件;可解释、因果去偏也在此列。

二、方法 · 叠加而非替代

各种方法之间是叠加而非替代关系——一篇论文常常同时用多种方法,例如「扩散生成 + 基础模型」或「分割网络 + 半监督 + 基础模型」。真正的分歧不在「用不用深度学习」,而在「用哪一种监督/自监督信号 + 怎么接下游任务」。

三、主题 · 14 类

这 174 篇可归为 14 类,每类有其不同的临床应用场景。

1. 基准与数据集

简述:提出新的医学影像数据集与评测基准,为方法提供公平比较的标尺。

意义:数据集与基准是领域进步的地基,决定方法能否被公平衡量、短板能否被看见。

代表论文

RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation

一句话总结:构建了包含 456 张儿童面部图像、覆盖 103 种罕见遗传疾病的标准化基准数据集 RDFace,并系统研究了表型感知的合成数据增强(DreamBooth/FastGAN)在超低样本罕见病诊断中的效果,DreamBooth 增强在极端低数据场景下最高可提升 13.7% 的诊断准确率。

2. 脑科学与神经影像

简述:聚焦 fMRI/dMRI/sMRI/EEG 及脑图谱,涉及脑活动解码、神经形态、脑疾病诊断与脑图学习。

意义:把 AI 与神经科学打通,既服务脑疾病早筛诊断,也反过来解码大脑如何表征世界。

代表论文

EEGiT: Teaching Vision Transformers to Understand the EEG signal

一句话总结:EEGiT 把一维 EEG 时序信号"画"成形如图像 patch 的二维 EEG patch,从而能直接拿在 ImageNet-21K 上预训练好的 ViT 当 EEG 编码器,用图像域的视觉先验缓解 EEG 数据稀缺,在 THINGS-EEG 检索与 EEG-3D 分类上都刷到 SOTA。

3. 手术与内窥镜视频

简述:面向内窥镜/腹腔镜/手术视频的复原、深度估计、器械/出血/事件识别等术中感知任务。

意义:直接面向手术室的实时感知,关系术中安全、效率与可量化的手术质量评估。

代表论文

Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework

一句话总结:这篇论文把每个器械类的提示参数从“彼此隔离的独立 prompt”改造成“共享知识逐层拆解的树结构”,让新器械可以继承旧知识快速学会,同时让新知识反过来温和修正旧知识,从而在手术器械类增量分割中同时提升新类、常见类和旧类表现。

4. 生存预测与预后

简述:结合病理、组学、多模态数据的癌症生存/风险/预后建模。

意义:从影像/组学预测预后,为个体化治疗决策与临床分层提供量化依据。

代表论文

Factorized Context Aggregation for Robust Cancer Risk Estimation via Soft Re-Ranked Retrieval and Hierarchical Anchors

一句话总结:这篇论文针对"训练时有基因/病理报告等多模态、但推理时只有病理切片(WSI)"的真实临床场景,提出以 WSI 为锚、从记忆库检索相似病人的多模态特征并做软重排,再用因子化交叉注意力把缺失模态的代理表征拆成"模态独有 + 与 WSI 共享 + 与其他模态共享"三路重建,最后用全模态教师做层级 anchor 蒸馏;在 8 种癌症 24 个缺失场景上把生存预测 C-index 推到 0.617,比纯组织学基线相对提升约 8.5%,离全模态上界仅差约 1.4%。

5. 图像配准

简述:刚性/可变形/跨模态图像配准与形变场估计。

意义:配准是多模态融合、随访对比、图谱构建等几乎一切下游分析的前置基础。

代表论文

MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration

一句话总结:MorphSeek 把可变形医学图像配准重新定义为「在编码器隐空间里做策略优化」——在 U-Net 编码器顶层接一个高斯策略头把隐特征当作可采样的动作,先无监督 warm-up 稳定隐空间,再用 GRPO 做多轨迹多步弱监督微调,配合 LDVN 让上万维隐空间里的策略梯度稳定下来,在三个 3D 配准基准上用极少标签把 Dice 提了 2–4%、把折叠率(NJD)降了 30–60%。

6. 图像重建·超分·复原

简述:MRI/CT/CBCT 重建、任意尺度超分、去噪去伪影、图像复原与逆问题求解。

意义:更快更清的重建意味着更短扫描、更低剂量与更早的病变发现。

代表论文

GH-NAF: Grid-Adaptive Hash-Level-Attended Neural Attenuation Fields for Discrepancy-Aware CBCT

一句话总结:GH-NAF 给基于哈希编码的 NeRF 式 CBCT 重建加上一个"按空间位置自适应挑选哈希分辨率层级"的注意力机制,并配合可微的投影差异校正渲染和不确定性加权监督,让模型在均匀组织里压低高频、在结构边界处保留细节,从而在真实 CBCT 上同时改善材料内对比度和边界清晰度。

7. 病理与全切片(WSI)

简述:数字病理方向:全切片分类、细胞核分割、多示例学习、跨染色对齐、病理表征与检索。

意义:数字病理是癌症诊断金标准,AI 让吉像素切片的高通量、可量化分析成为可能。

代表论文

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

一句话总结:针对现有计算病理 MLLM 把整张全切片图像(WSI)压成单个向量、丢掉细粒度空间语义的问题,本文提出 MLLM-HWSI,把 WSI 按「细胞=词、patch=短语、区域=句子、WSI=段落」分解成四个尺度的视觉 token,用层级对比对齐损失 + 跨尺度一致性损失把各尺度与病理报告对齐,再喂给指令微调的 LLM,在 6 类病理任务、13 个 WSI 级基准上刷新 SOTA。

8. 报告生成与纵向影像

简述:根据影像自动生成放射/临床文字报告,含纵向随访对比、异常定位与幻觉抑制。

意义:自动报告把医生从重复书写中解放,纵向对比更贴近真实随访诊疗逻辑。

代表论文

BiOTPrompt: Bidirectional Optimal Transport Guided Prompting for Disease Evolution-aware Radiology Report Generation

一句话总结:针对纵向胸片报告生成中"病灶演化是双向且非对称(有新发也有消退)"这一被忽视的特性,BiOTPrompt 用双向最优传输在当前片与历史片之间建立软对应,靠两个方向传输质量的不对称识别出"新发区域"和"消退区域",把它们的空间位置编码进提示词去引导 LLM 生成报告,并加一条视觉-文本一致性约束抑制幻觉,在 Longitudinal-MIMIC 上 NLG 与临床指标全面取得 SOTA(CE-F1 0.417)。

9. 多模态大模型·VQA·推理诊断

简述:医学多模态大模型(MLLM/VLM)、视觉问答(VQA)、视觉定位与链式推理诊断。

意义:多模态大模型让影像「会看会说会推理」,是通向通用医学 AI 助手的关键路径。

代表论文

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

一句话总结:MedMO 以 Qwen3-VL 为底座、用 26M+ 跨模态医学数据走"通用医学 SFT 高分辨率定位 SFT 指令微调 带边界框奖励的 GRPO 强化学习"四阶段后训练,把医学影像的理解(VQA / QA / 报告生成)和细粒度空间定位(bbox 接地)统一进一个开源 VLM,在多类临床任务上超过现有开源医学 MLLM。

10. 图像/视频生成与合成

简述:基于扩散/自回归/GAN 的医学图像、视频、体数据与跨模态合成及数据增广。

意义:可控合成缓解医学数据稀缺与隐私壁垒,为下游训练提供高质量「燃料」。

代表论文

Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization

一句话总结:这篇论文指出扩散模型用于医学分割数据增强时,真正驱动泛化的不是视觉逼真度而是"合成对抗性"(合成样本诱导的经验损失),且只有落在流形上的原生对抗性有效;据此提出一个轻量插件 Adversariality Miner,仅通过重选初始噪声、不改动也不重训冻结扩散模型,就能放大原生对抗性,在多个医学分割基准上把下游 Dice 增益再提升 4~5 个点。

11. 域适应·持续·联邦·少样本

简述:跨域泛化、无源/无监督域适应、持续/增量学习、联邦学习、少样本与测试时适应。

意义:真实临床跨设备、跨中心、跨人群,泛化与持续学习能力决定模型能否落地。

代表论文

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

一句话总结:发现并解决了 CLIP 在跨域少样本学习(CDFSL)中的局部特征对齐退化问题,提出基于循环一致性的 CC-CDFSL 框架,通过 T-I-T 和 I-T-I 双向循环路径和语义锚点机制改善 patch 级视觉-语言对齐,同时增强模型的可解释性。

12. 表示学习·预训练·基础模型

简述:自监督/对比预训练、视觉-语言预训练、医学基础模型与高效适配。

意义:自监督/基础模型用海量无标注数据学通用表示,是低标注成本的根本解法。

代表论文

SPECTRE:面向体积 CT Transformer 的自监督与跨模态预训练

一句话总结:SPECTRE 是一个纯 Transformer 的体积 CT 基础模型:用各向异性 3D tokenization + 局部/全局两级 ViT + 3D RoPE 解决体积 CT「token 立方爆炸、几何各向异性、临床监督弱噪」三大难题,再用「DINOv3 自监督 SigLIP 视觉-语言对齐」两阶段预训练,只用公开 CT 数据就在生物标志物分类、分割、跨模态检索上超过既有 CT 基础模型。

13. 检测·分类·不确定性·OOD

简述:疾病分类、病灶检测、异常检测、不确定性估计、OOD 检测与可信诊断。

意义:知道「模型何时会错」与「样本是否异常」,是医疗 AI 可信与安全的底线。

代表论文

Adaptive Confidence Regularization for Multimodal Failure Detection

一句话总结:提出 ACR 框架,通过自适应置信度损失(惩罚多模态融合置信度低于单模态的"置信度退化"现象)和多模态特征交换(在特征空间合成失败样本)两个互补模块,首次系统解决多模态场景下的误分类检测问题,在四个数据集上全面超越已有方法。

14. 医学图像分割

简述:各类 2D/3D 医学图像分割方法:网络结构、形状先验、半监督、缺失模态、SAM 适配等。

意义:分割是勾画器官/病灶的核心操作,精度直接影响测量、诊断与治疗规划。

代表论文

SegMoTE: Token-Level Mixture of Experts for Medical Image Segmentation

一句话总结:SegMoTE 冻结整个 SAM、只在掩码解码器里塞进一组可学习"专家 token"和一个 token 级 MoE 路由(MoTE),按成像模态动态选专家,再配一个渐进式提示 tokenization(PPT)实现免交互分割;仅训练 17M 参数、用不到现有数据集 1% 规模的 MedSeg-HQ(约 0.15M mask),就在多模态医学分割上达到 SOTA。

posted @ 2026-08-07 18:35  小周同学的CtrlCV研记  阅读(30)  评论(0)    收藏  举报