PAR-首个中东人群前列腺活检全切片数据集:339张玻片×3台扫描仪×3名病理学家,1,017张WSI破解病理AI泛化盲区

在这里插入图片描述

摘要

2026年6月,由伊拉克科亚大学(Koya University)联合瑞典卡罗林斯卡学院(Karolinska Institutet)、豪勒医科大学、PAR 私立医院、苏莱曼尼亚大学、挪威斯塔万格大学医院等机构的研究团队创建了 PAR 数据集(Prostate biopsy whole slide images from an underrepresented Middle Eastern population)——一个包含 1,017 张全切片图像(WSI)的前列腺穿刺活检数据集,源自伊拉克埃尔比勒 PAR 医院 2013-2024 年间 185 名连续就诊患者的 339 张玻片。其意义在于:这是首个来自中东欠代表人群的前列腺病理公开数据集,每张玻片同时用 3 台不同扫描仪数字化、由 3 名病理学家独立分级,一举填补了现有数据集"单一人群、单一扫描仪、单一参考标准"的三大空白,为病理 AI 的跨人群泛化、跨扫描仪鲁棒性和分级一致性研究提供了独一无二的验证平台。


一、研究背景

1、研究背景

前列腺癌诊断依赖对苏木精-伊红(H&E)染色活检玻片的显微镜评估,穿刺活检是最常用的确诊手段。病理医师按 Gleason 评分系统(GS)对病灶分级,2014 年国际泌尿病理学会(ISUP)又引入将 GS 归并为 1-5 级的 ISUP 分级,两者在临床上并行使用。然而 Gleason 分级的可重复性一直有限——大量研究证实病理学家之间存在显著的观察者内和观察者间差异,直接导致患者的过度治疗或治疗不足。

数字病理和 AI 为提升诊断一致性带来希望,不少研究显示 AI 系统诊断和分级前列腺癌的能力已可比肩专家级病理学家。为推动领域发展,已有一批公开数据集发布:PANDA(荷兰+瑞典 1 万余张活检)、SPROB20(瑞典 2,611 张)、SICAPv2(西班牙 155 张)、UKK/WNS(德奥 100 张、10 名医师)、DiagSet(波兰 260 万补丁块+4,675 张 WSI)、TCGA-PRAD(美国 499 例前列腺切除标本)等。

2、目前遇到困难和挑战

(1)现有数据集普遍只有单一参考标准

Gleason 分级主观性强、医师间差异大,研究需要多名医师的独立参考分级才能做一致性分析。但可用数据集几乎都只提供单一医师的标注,这严重限制了结果的可复现性和基准测试的有效性——你连"医师之间本来就有多大分歧"都不知道,怎么评估 AI 的"准"?

(2)AI 模型几乎全在西方人群中开发验证,欠代表地区成盲区

绝大多数研究基于高加索人群数据。病理全流程数字化投入巨大,低资源地区无力承担,形成"先有鸡还是先有蛋"的死锁:没有数字化就攒不出数据、拿不出 AI 有效性的证据,而没有证据又反过来让投资方不愿投入数字化。用低成本便携扫描仪做试点验证是潜在破局路径,但目前没有任何公开数据集包含便携扫描仪数据或来自欠代表人群的数据。

(3)扫描仪差异影响模型泛化,却无从研究

大量研究表明 AI 模型性能会随全切片扫描仪品牌不同而变化,扫描仪引入的差异直接影响模型泛化能力。但现有公开数据集通常只提供单一扫描仪的 WSI,研究者根本无法开展跨扫描仪鲁棒性研究——模型在 Leica 上训得好好的,换个 Hamamatsu 就拉胯,部署时就是灾难。


二、介绍数据集

1、数据集名称

PAR 数据集(The PAR dataset: Prostate biopsy whole slide images from an underrepresented Middle Eastern population,源自伊拉克埃尔比勒 PAR 私立医院)

2、一句话介绍数据集

PAR 是首个来自中东欠代表人群的前列腺穿刺活检全切片图像数据集:185 名患者的 339 张玻片各由 3 台扫描仪数字化(共 1,017 张 WSI),并由 3 名病理学家独立给出 Gleason 评分和 ISUP 分级,CC BY 4.0 完全开放。

3、详细介绍数据

核心规模:

参数 数值
全切片图像(WSI)总数 1,017 张
玻片数 339 张
患者数 185 名(连续病例系列,2013-2024)
扫描仪 3 台(每台覆盖全部 339 张玻片)
分级医师 3 名(独立、互盲)
数据许可 CC BY 4.0(BioImage Archive,S-BIAD2323)

三台扫描仪参数:

扫描仪 分辨率 格式 特点
Hamamatsu NanoZoomer 2.0 HT 0.22 µm/像素(40x) .ndpi 高通量主力机型
Leica Aperio GT 450 DX 0.26 µm/像素(40x) .svs 临床诊断级机型
Grundium Ocus40 0.25 µm/像素(40x) .svs 便携紧凑型(首个含此类数据的公开数据集)

患者年龄分布: ≤49 岁 5 人、50-54 岁 9 人、55-59 岁 14 人、60-64 岁 26 人、65-69 岁 49 人、≥70 岁 79 人(高龄为主,符合前列腺癌流行病学特征)。

ISUP 分级分布(按首位病理学家):

ISUP 分级 玻片数 占比
良性(Benign) 164 48.4%
ISUP 1(3+3) 7 2.1%
ISUP 2(3+4) 38 11.2%
ISUP 3(4+3) 59 17.4%
ISUP 4(4+4, 3+5, 5+3) 30 8.8%
ISUP 5(4+5, 5+4, 5+5) 41 12.1%

三名医师的覆盖情况: 医师一(22 年经验,伊拉克)分级全部 339 张(100%);医师二(15 年经验,伊拉克)分级 337 张(99.4%);医师三(6 年经验泌尿病理专科医师,挪威)分级按 ISUP 分层的 59 张子集(17.4%)。Gleason 评分采用 10 类(0+0 至 5+5),ISUP 为 6 个有序等级。

4、数据集构建

(1)病例筛选漏斗: 从 PAR 医院病理档案库 30,056 例(2013-2024)出发 → 关键词"pros"初筛出 614 份报告 → 清理后得 502 例前列腺相关病例 → 锁定 251 例穿刺活检 → 合并 12 对补充报告(addenda)去重剩 239 例 → 核查 FFPE 蜡块存档可用性(54 个蜡块遗失,多为早年病例)→ 最终 185 例入选。

(2)玻片重新制备: 原始存档玻片因长期存放出现染色褪色和降解,研究团队弃用原片,从 FFPE 蜡块重新切片(3-4 µm、多层面),必要时重新包埋,确保染色质量一致。154 名患者左右两侧分装产生 2 张玻片,31 名患者合装产生 1 张玻片。

(3)三机扫描: 所有玻片送至卡罗林斯卡学院,由受训人员用自动化流程在 3 台扫描仪上各扫一遍(40x),自动聚焦失败的手动重扫。图像以扫描仪原生格式保存(.ndpi/.svs),不做转换。

(4)独立分级: 三名病理学家通过 Cytomine 平台数字阅片,各自独立给出玻片级 Gleason 评分(良性记 0+0),全程互不见面、不讨论、不调和,也完全不知道 AI 的任何判断——保证参考标准的独立性。无像素级ROI标注(纯玻片级标签)。

(5)伦理与脱敏: 伊拉克 PAR 医院伦理委员会(permit 1002/07072024)和瑞典伦理审查局(permit 2019-05220)双重批准;样本脱敏后才运往瑞典,回顾性研究豁免知情同意。

5、数据集特点

首个欠代表人群数据集

数据来自伊拉克库尔德斯坦地区的连续临床病例,打破了前列腺病理公开数据"欧美垄断"的格局。对验证 AI 模型在中东乃至其他低资源地区人群中的泛化能力,这是目前唯一的选择。

一玻片三扫:跨扫描仪研究的天然实验场

同一张玻片在三台不同品牌扫描仪上各扫一次,图像内容完全一致、仅成像特性不同——这是研究颜色归一化、扫描仪域偏移、跨设备鲁棒性的完美对照设计,省去了"不同切片内容差异"的干扰变量。

多医师独立分级:一致性研究的金矿

三名背景各异的医师(两名通科病理医师 + 一名泌尿专科医师;经验从 6 年到 22 年;横跨伊拉克和挪威两国)独立分级,且无共识调和——研究者可以如实测量医师间差异,还能自选共识规则(多数投票/取最高级)生成不同严格度的标签。

便携扫描仪数据首开先河

Grundium Ocus40 是单张玻片的紧凑型设备,成本远低于大型扫描仪。包含它的数据让"低资源地区用便携设备+AI 做病理筛查"的设想第一次有了公开验证数据,直击数字病理的"鸡生蛋"困局。

原生格式 + 最宽松许可

WSI 以扫描仪原生格式(.svs/.ndpi)发布不做转换,保留完整金字塔层级;CC BY 4.0 许可允许包括商业用途在内的自由使用,只需署名。

6、数据集使用方法

  • 获取方式: BioImage Archive 公开下载,登录号 S-BIAD2323(identifiers.org/biostudies:S-BIAD2323),CC BY 4.0 许可
  • 目录结构: 根目录 iraq_prostate_wsi 下分 6 个子文件夹——3 个扫描仪组件文件夹(各 339 张 WSI)、annotations(三名医师的 GS/ISUP 标注表)、file_lists(跨扫描仪配对关系)、docs(许可与 README)
  • 查看工具: 普通看图软件打不开 WSI,需用 Cytomine、OpenSlide、ASAP、QuPath 等专业工具
  • 标签使用注意: 标注表不含三人共识标签,使用者需自行定义共识规则(如多数票或取最高分级)
  • 典型预处理: 前景掩码、按尺寸切块(tiling)、染色/光照归一化

7、基准测试总结

数据集中每张玻片均被 3 台扫描仪 100% 重复数字化(1,017 张 WSI = 339 张 × 3),且全部玻片获得两名病理学家独立分级(覆盖率分别为 100%(339/339)和 99.4%(337/339)),另有 17.4%(59/339)经第三名泌尿专科医师分层分级——多设备、多医师的双重冗余设计在公开病理数据集中尚属首例。


三、数据集有哪些场景的应用

1、跨人群泛化验证——你的模型在中东患者身上还灵吗?

这是 PAR 最核心的使命。假设你在 PANDA(荷兰+瑞典数据)上训练了一个 Gleason 分级模型,AUC 漂亮得很——但伊拉克患者的组织制片习惯、染色风格、人群遗传背景都和欧美不同,模型直接拿去用会不会翻车?以前没法回答,因为根本没有中东的公开数据。现在有了 PAR:把模型原封不动在 PAR 上跑一遍外部验证,性能掉不掉、掉多少,一目了然。想发"AI 公平性"方向的论文,这是现成的实验设计。

2、跨扫描仪鲁棒性研究——同一玻片的完美对照

同一块组织、同一张玻片,在 Leica、Hamamatsu、Grundium 三台机器上各扫一遍——内容零差异,只有成像差异。这种设计太珍贵了:你可以精确测量"扫描仪换了"这一个变量对模型性能的影响,而不用担心"切片不同"的混淆因素。做域适应(domain adaptation)、颜色归一化、扫描仪不变性表征学习的研究者,PAR 就是为你们准备的基准。

3、颜色归一化算法的试金石

数字病理的染色差异是老大难:不同实验室、不同染色机、不同扫描仪出来的颜色千差万别。PAR 的三机数据是验证染色归一化算法(如 Macenko、Vahadane 等方法)的理想素材——把 Leica 的图归一化到 Hamamatsu 的色彩空间,肉眼和定量指标都能直接对比,因为底层组织图像完全一样。

4、Gleason 分级一致性研究——医师差异到底有多大?

Gleason 分级的主观性是临床痛点,但量化这种差异需要多医师独立标注的数据。PAR 给了两名医师的全量分级(339/337 张)加一名专科医师的分层子集(59 张),你可以计算 kappa 系数、分析哪些 ISUP 等级最容易分歧(通常中间等级 ISUP 2/3 是重灾区)、比较通科医师和泌尿专科医师的差异模式。这类研究对制定 AI 辅助诊断的"人机一致性"标准直接有用。

5、共识规则的对比实验——多数票还是取最高?

PAR 故意不提供共识标签,把选择权交给使用者。这反而创造了研究空间:用"多数投票"生成的标签训练模型,和用"最严格(取最高分级)"或"最宽松"规则训练的模型,性能差多少?对下游临床决策(穿刺→是否手术)的影响如何?论文还提醒了一个细节:各国对"通科/专科病理医师"的定义和培训要求不同,解读医师一致性时得考虑这个背景——这本身就是卫生政策研究的素材。

6、便携扫描仪 + AI 的低成本病理方案验证

Grundium Ocus40 这种单张玻片便携扫描仪,价格只有大型设备的零头,特别适合基层和资源匮乏地区。但便携机的成像质量能不能撑起 AI 分析?PAR 第一次提供了公开数据来回答这个问题:对比便携机和大型机上 AI 性能的差距,如果差距可控,"便携扫描 + 云端 AI"的基层病理服务模式就有了循证依据——这可能撬动那些至今没做数字化的地区的投资决策。

7、切片级弱监督学习——没有像素标注怎么训练?

PAR 只有玻片级标签(这张片子是 ISUP 几级),没有像素级 ROI 勾画。这正是弱监督学习(MIL 多示例学习等)的标准设定:把整张 WSI 切成上千个补丁块,只有整片的标签,让模型自己学哪些区域是癌。PAR 的三机版本还能进一步验证:在一台扫描仪上训练的 MIL 模型,换台机器还认不认得出来?

8、良性 vs 恶性初筛模型

按首位医师的分级,PAR 里约 48.4% 是良性玻片——这个良性/恶性比例接近真实门诊分布(连续病例系列,不做人为平衡)。训练一个"这张活检要不要紧"的初筛模型,用 PAR 可以评估模型在真实病例构成下的表现,而不是人工平衡数据集里的虚假高分。对做"分诊型 AI"(把明显良性的筛掉、疑难的留给医师)的团队特别合适。

9、与 PANDA 等数据集联合训练与域偏移分析

PAR 可以和 PANDA、SICAPv2、DiagSet 等已有数据集组队:多数据集混合训练提升泛化,或者反过来——把 PAR 当域外测试集,专门量化"训练集里没有中东数据"造成的域偏移损失。论文里那张现有数据集对比表(PANDA、SPROB20、SICAPv2、UKK/WNS、DiagSet、TCGA-PRAD 等)本身就是做数据集谱系研究的现成索引。

10、病理教学与数字阅片培训

三名医师从 6 年到 22 年经验、横跨伊拉克和挪威两种医疗体系,他们的分级差异本身就是教学案例。医学生可以在 Cytomine 上自己看片打分,再和三位医师的独立判断对比,直观理解"为什么 Gleason 分级要培训"——PAR 实际上是一个带多元参考答案的数字病理教学库,对病理医师资源稀缺地区的远程教育尤有价值。


相关资源

对于做医疗 AI 的朋友,数据集选型往往是个痛点——不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中,查阅成本很高。

我们把及全球主流医疗 AI 数据集(涵盖 CT、MRI、病理、超声、多模态等)整理成了 AI-Ready Dataset 条目库,以统一的 Wikipedia 式结构呈现,方便研究者快速比对和选型:

Qianfanghub AI-Ready Dataset:https://www.qianfanghub.com/ai-ready-dataset/

在这里插入图片描述

posted @ 2026-08-11 18:12  医疗AI数据目录  阅读(18)  评论(0)    收藏  举报