Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate
一、研究背景与痛点
面向医疗多模态大模型(Medical VLM)影像诊断,核心解决诊断幻觉(Diagnostic Hallucination) 问题arXiv:
- 模型存在确认偏误:一旦生成初步诊断假设,会主动编造影像里不存在的病灶、特征来佐证自己,出现流畅但完全虚假的诊断结论,存在临床安全风险;
- 传统 CoT / 思维链是单向线性推理,只会寻找支持当前假设的证据,缺少自我证伪机制,早期出错会一路错到底,误差持续扩散;
- 普通多智能体辩论仅做文字对抗,不会结合医学影像视觉区域校验,反驳没有图像实据支撑。
论文思路源自波普尔科学证伪理论:可靠诊断不能只靠 “找证据证明它对”,更要主动寻找证据推翻假设,模拟医院多专家会诊正反辩论流程。
二、核心框架:三类异构专业智能体

Dialectic-Med整体流程图
整套系统由正方 Proponent、反方 Opponent、调解仲裁 Mediator三个智能体循环对抗辩论:
- Proponent 正方智能体(主诊断医师)
输入医学影像 + 临床问诊,输出初始诊断假设、推理逻辑、标注疑似病灶区域。
- Opponent 反方智能体(质疑专家,核心创新)
搭载专属视觉证伪模块 VFM(Visual Falsification Module),区别于纯文本辩论:
- 提取影像中与正方结论矛盾的视觉像素区域;
- 生成反事实质询:假设某病灶不存在 / 特征改变,当前诊断是否成立;
- 用真实图像证据反驳,而非单纯文字抬杠,从视觉根源定位幻觉来源。
- Mediator 中立仲裁智能体
收集双方多轮辩论论据,构建加权共识图,评估每条推理的影像证据可信度;三种输出动作:保留原诊断、修正诊断、直接抛弃无影像支撑的错误假设;控制辩论轮次,收敛后输出完全贴合影像真实特征的最终诊断。
核心机制:反事实对抗辩证循环
正反两方多轮攻防:正方补充佐证视觉证据 → 反方用 VFM 检索矛盾区域 + 反事实提问挑战 → 正方修正假设,反复迭代直到无明显视觉冲突,彻底砍掉无依据的幻觉结论arXiv。
三、三大核心创新点
- 带视觉校验的对抗多智能体医疗辩论架构
以往辩论只做文本博弈,本文把影像像素级证据引入辩论,所有质疑必须匹配图像病灶,从源头杜绝凭空编造病理特征。
- 反事实证伪推理机制
让模型主动模拟 “关键影像特征消失后诊断是否成立”,强制二阶反思,打破大模型天然的确认偏误,大幅降低幻觉率。
- 动态加权共识仲裁模块
按视觉证据置信度分配权重,不简单少数服从多数,优先采信有影像支撑的推理,保证最终诊断完全 grounded 在真实医学图像上。
四、实验效果
测试数据集:MIMIC-CXR-VQA(胸片)、VQA-RAD、PathVQA(病理影像)三大医疗 VQA 标准数据集
- 幻觉错误率 HER 相比单智能体 CoT 基线下降超 50%;
- 诊断准确率、推理可信度 SOTA,超越 GPT-4o、InternVL2 等通用多模态模型;
- 推理过程可完整追溯:每一条诊断结论都能对应到影像具体区域,可解释性大幅提升,更适合临床辅助诊断落地。
五、论文定位 & 对你研究的价值
- 赛道:医疗多模态 VLM、医疗智能体 Multi-Agent、幻觉抑制、可解释医学 AI;
- 创新范式可直接借鉴:
- 异构角色 Agent 对抗辩论;
- 视觉模块绑定推理、用图像证据约束文本输出;
- 反事实推理解决医疗幻觉;
- 和你之前看的 MedEyes 形成互补:
- MedEyes:解决模型视觉怎么看影像(动态聚焦病灶);
- Dialectic-Med:解决看完影像怎么可靠推理、不编造虚假诊断;
二者可以组合成一套完整 “阅片 + 诊断校验” 医疗智能体系统。
补充:论文等级
目前仅公开 arXiv 预印本(2026 年 4 月),暂未标注顶会录用;属于医疗多智能体细分领域高质量工作,思路适合投递 NeurIPS、MICCAI、AAAI 等 CCF A/B 类会议。
https://www.modelscope.cn/papers/2604.11258
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22185839
浙公网安备 33010602011771号