ABRA: Agentic Benchmark for Radiology Assistant
一、论文核心内容
1. 研究背景痛点
现有放射学智能体评测基准存在根本性缺陷:
- 全部提前人工筛选、裁剪好单张影像切片输入模型,无法模拟放射科医生完整操作 DICOM 工作站;
- 缺少交互式工具操作评测维度,不考核调窗宽、滑动切片、多序列切换、病灶标注等真实阅片动作;
- 仅评测最终文字报告,忽略任务规划、工具执行全流程,无法定位智能体性能瓶颈(是视觉识别差还是工具调用逻辑差)。
本文构建首个可操控真实放射工作站的交互式放射智能体评测基准 ABRA,还原完整临床阅片环境。
2. ABRA 基准整体架构
(1)底层仿真环境
对接开源放射阅片工具 OHIF Viewer + Orthanc DICOM 服务器,提供21 类标准化工具调用接口,完全复刻临床操作:
切片上下滑动、窗宽窗位调节、多序列切换、像素级病灶标注、影像元数据查询、纵向新旧影像对比、标准化 BI-RADS 报告生成等。
(2)数据集与任务体系
- 数据源:LIDC-IDRI 肺 CT、杜克乳腺 MRI、NLST 纵向肺 CT 三大公开医学影像库;
- 任务总量:655 条自动生成临床任务,划分简单 / 中等 / 困难三档难度;
- 八大任务类型:工作站基础操控、影像元数据校验、视觉病灶探查、病灶像素标注、跨时间纵向影像对比、BI-RADS 标准化报告、含预检测金标的标注对照任务、BI-RADS 对照任务。
(3)三层自动量化评测指标(核心评测范式)
每条任务从三个维度自动打分,精准定位缺陷:
- Planning(规划分):任务拆解逻辑、工具调用步骤顺序合理性;
- Execution(执行分):工具调用格式、参数、操作序列是否合规;
- Outcome(结果分):病灶检出、标注坐标、诊断报告与放射专家金标准匹配度。
(4)对比实验核心结论
测试 5 款闭源大模型、5 款开源多模态模型:
- 所有模型工具执行 Execution 分数普遍高于 89%,说明 LLM 学会调用工具语法不难;
- 真实病灶任务最终结果 Outcome 仅 0%~25%,性能严重不足;
- 增设仿真病灶检测器(Oracle)预先给出病灶位置后,结果分直接提升至 69%~100%;
证明当前放射智能体核心瓶颈不是工具编排能力,而是视觉病灶感知能力。
3. 论文核心贡献
- 首个可操控完整 DICOM 放射工作站的交互式放射智能体评测基准,打破传统静态单图评测模式;
- 设计规划 - 执行 - 结果三层分层自动打分体系,可精准区分智能体 “工具操作缺陷” 与 “视觉识别缺陷”;
- 配套多难度、多病种标准化放射任务集,直观揭示现有医疗 VLM 病灶感知短板;
- 开源完整仿真环境、任务集与自动打分器,为后续放射 Agent 统一标准化评测平台。
二、论文固有局限性
1. 数据集与临床场景局限
- 病种与模态覆盖窄:仅包含肺 CT、乳腺 MRI,缺少腹部 CT、脑部 MRI、X 光、超声、病理等主流放射影像,无法全面评估通用放射助手;
- 任务为程序自动生成,非真实临床医师原始诊疗需求,任务复杂度、疑难罕见病例不足,缺少多中心真实临床问诊;
- 纵向对比仅包含两次影像比对,无多年多轮随访多序列长时序病例,无法测试长期记忆类智能体。
2. 仿真环境与工具约束
- 仅支持预设 21 类基础阅片工具,未集成三维重建、病灶体积测量、多模态配准、外部 EHR 病历联动等复杂临床工具;
- 纯仿真隔离环境,不对接真实医院 PACS、电子病历系统,缺少隐私脱敏、权限管控、多医师协同会诊真实流程模拟;
- DICOM 数据为公开标准化数据集,未模拟医院低质量、伪影、扫描参数不一致的真实临床噪声影像。
3. 评测指标缺陷
- 完全依赖自动打分器,无放射科专家人工盲审校准,自动指标无法衡量报告临床逻辑、漏诊 / 误诊的真实临床风险;
- 缺少记忆相关专项评测维度,无法评估智能体长期时序记忆、跨会话信息留存、冲突消解等能力,不适用于你研究的记忆类医疗 Agent;
- 未设计幻觉、安全风险专项指标,仅衡量病灶检出准确率,无法量化虚假病灶编造、BI-RADS 分级错误等临床安全隐患。
4. 实验与基线对比短板
- 仅评测通用 LLM/VLM 底座,未对比 MedOpenClaw、MedEyes 等专用放射智能体系统,无法体现专业 Agent 相比通用模型的提升幅度;
- 无多智能体、辩论纠错、自进化记忆等前沿架构测试,基准单智能体任务范式单一;
- 仅短期单会话测试,无超长周期连续随访仿真,无法验证智能体长期运行稳定性、记忆膨胀问题。
5. 落地与工程短板
- 环境部署依赖 OHIF+Orthanc 整套影像服务,工程部署成本高、依赖复杂,轻量化本地部署困难;
- 无多模态文本 - 影像融合记忆评测模块,不能适配双流记忆、海马体渐进准入、A-MEM 等记忆机制类论文验证;
- 未纳入时序 EHR 病历联合推理任务,只能纯影像阅片评测,无法覆盖影像 + 病历联合诊断完整临床流程。
https://arxiv.org/abs/2605.11224
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22255052
浙公网安备 33010602011771号