EEG AI 的“95%+ 准确率”,可能只是一场数据泄漏制造的幻觉
EEG AI 的“95%+ 准确率”,可能只是一场数据样本泄漏制造的幻觉
近年来,用人工智能分析脑电图(EEG)来识别精神分裂症、抑郁症、癫痫和其他神经精神疾病,成了医学 AI 的热门方向。
相关论文中,一个数字尤其吸引眼球:分类准确率超过 95%,有些甚至达到 99%。
如果这些结果能够在真实临床中复现,那意味着只需要采集一段脑电信号,AI 就比传统临床诊断更快、更客观地识别神经性的疾病。
最近,发表于《Translational Psychiatry》上的研究提出了一个尖锐的问题:
这些模型究竟学会了识别疾病,还是只学会了识别受试者本人?
样本数据划分
EEG 研究经常面对一个现实问题:受试者数量很少。
一个数据集可能只有几十名患者和几十名健康者的对照。对于深度学习来说,这点数据远远不够。研究人员因此会把每个人几分钟的连续脑电,切成许多较短的片段,叫做 epoch。
例如,一名受试者的 10 分钟 EEG,如果按照 5 秒切分,就可以得到 120 个片段。原本几十名受试者的数据,很快便能“扩增”为几千个训练样本。
切分本身没有问题,问题出现在划分训练集和测试集。
如果研究人员将所有 EEG 片段随机打乱,再把其中一部分用于训练、另一部分用于测试,那么同一个人的脑电片段就可能同时出现在训练集和测试集:
表面上看,测试集没有包含训练集中的同一段数据。但从受试者层面看,模型其实已经“见过”这个受试者了。
所以,正确的样本划分方法是,数据必须按受试者划分,而不是按 EEG 片段划分
样本特征选择
EEG 可以提取数百甚至数千个特征,包括频段功率、复杂度、非线性指标和脑区连接性等等。研究人员通常需要从中挑选最能区分患者和正常人的特征。
问题在于,很多研究,直接拿全量样本进行特征提取,然后再划分训练集和测试集。虽然测试集没有参与模型的拟合,但却参与了特征选择。
这类似于大学考试,老师出了题目,再根据这些题目告诉学生复习范围,然后声称考题你们见都没见过(真是好老师)。
准确性夸大了多少
研究者筛查了 95 篇 EEG AI 精神分裂症检测论文,发现:
- 41 篇存在数据划分相关的泄漏;
- 34 篇存在特征选择相关的泄漏;
- 其中 14 篇同时存在两种问题;
- 另有一部分论文由于方法描述不完整,无法判断;
- 综合来看,约 65% 的相关研究存在至少一种高风险做法。
一种常见误解是:数据泄漏只是传统机器学习或早期深度学习的问题,使用 Transformer、预训练模型或 EEG 基础模型就能解决这些问题。
论文测试了基于 Transformer 的 EEG 基础模型 REVE。结果显示,当同一受试者的片段同时进入训练集和测试集时,准确率平均被高估了 22.53 个百分点。
原因很简单:泄漏是实验设计问题,而不是模型能力问题。
如何正确对待模型的准确率
这篇研究告诉我们,当我们再看到“AI 通过脑电诊断疾病,准确率超过 95%”的新闻,不妨先检查以下几点:
- 训练集和测试集是如何划分的?
- 特征选择是否只使用训练数据?
- 报告的是片段级准确率,还是受试者级准确率?
- 有没有在独立医院、独立设备或独立数据集上验证?
- 代码、数据划分和完整评估流程有没有公开?
这里,我们绝不是批判这些研究,否定EEG AI的价值。很多研究受限于数据量小、数据维度又高、评估流程复杂等现实因素的影响。指出这些问题,是为了让“95% 准确率”经得起检验,让这些研究真正能落实到现实场景。
真实的场景里不需要漂亮的数字。一个诚实、可靠、可复现的 70%,远比一个建立在数据泄漏之上的 95% 更接近临床,也更接近真相。
浙公网安备 33010602011771号