Paper Reading: GAT—Enhanced TabNet model with heterogeneous tabular and dependency graph information feature fusion for multi-disease coexistence risk prediction
Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。
论文概况
| 论文概况 | 详细 |
|---|---|
| 标题 | 《GAT—Enhanced TabNet model with heterogeneous tabular and dependency graph information feature fusion for multi-disease coexistence risk prediction》 |
| 作者 | Chengjie Li, Yanglin Wang, Mingxiu Li, Yi Zheng, Yijie Luo, Wen Zhong |
| 发表期刊 | Computer Methods and Programs in Biomedicine |
| 发表年份 | 2026 |
| 期刊等级 | 新锐期刊分区表(2026 年 3 月)2 区 TOP |
| 论文代码 | 文中未公开 |
作者单位:
- The Key Laboratory for Computer Systems of State Ethnic Affairs Commission, Southwest Minzu University, Chengdu 610041, China
- University of Electronic Science and Technology of China, Chengdu 611731, China
- Department of General Medicine, Chengdu Third People’s Hospital, Chengdu 610014, China
研究动机
多病共存现象日益普遍,尤其在老年人和弱势群体中。患者同时患有多种慢性病,导致病情复杂、治疗困难,并显著增加发展为重症的风险,严重影响生活质量和寿命。因此,准确预测多病共存患者的重症风险具有重大的临床价值,有助于早期干预和个性化治疗。电子健康记录(EHR)中包含了大量可用于预测建模的结构化表格数据,如患者基本信息、病史、检查结果等,然而这些医疗数据具有高度复杂性和异质性。现有预测模型面临两大瓶颈:
| 局限性 | 说明 |
|---|---|
| 模型局限性 | 传统机器学习方法容易过拟合,对缺失值和参数敏感;现有的深度学习模型(如 TabNet、各类 Transformer 变体)通常假设特征独立或具有简单线性关系,难以有效捕捉医疗数据中复杂的非线性特征依赖关系。 |
| 问题定义局限 | 大多数研究专注于单一疾病的预测,未能充分考虑多病共存情况下疾病间复杂的相互影响和样本(患者)之间可能存在的潜在关联。例如,具有相似共病模式的群体。 |
图表示学习(如 GAT)在处理非欧几里得数据和复杂关系建模方面展现出强大能力。同时,深度表格学习模型(如 TabNet)在保持可解释性的同时,提供了强大的特征学习能力。如何将两者的优势结合,成为一个有前景的研究方向。基于上述背景,论文旨在解决一个未被充分探索的临床预测任务:如何利用结构化的电子健康记录(EHR)表格数据,更准确地预测多病共存患者发展为重症的风险?
文章贡献
针对多病共存患者的重症风险预测难题,本文提出了一种名为 GATET 的混合神经网络模型。该模型的核心在于将 GAT 与 TabNet 融合,主要包含三个模块:依赖特征提取模块依据医学先验知识(如年龄)将患者样本构建并划分为依赖子图;注意力聚合构图模块在子图内使用图注意力机制聚合节点信息,以捕获复杂的样本间关系;特征加权模块则利用简化的 TabNet 计算特征重要性权重。三个模块协同有效应对了医疗表格数据中特征依赖关系复杂、样本关联缺失这两大挑战,在提升预测精度的同时保持了模型的可解释性。利用来自一家三甲医院的真实临床电子健康记录数据构建了数据集,实验表明 GATET 在多个指标上优于多种传统机器学习与前沿深度学习基线模型,并通过消融实验证实了各模块的必要性。
本文方法
现有模型存在多个缺陷,包括:无法捕捉特征间复杂的非线性依赖;忽略了样本间可能存在的重要关联;处理高维数据时易过拟合。本文提出新型混合模型 GAT-Enhanced TabNet(GATET),思想是将 GAT 与 TabNet 融合,以解决医疗表格数据的非欧几里得特性和复杂的样本间关系。GATET 通过学习样本间的依赖图结构和特征重要性权重,来提升预测性能。

依赖特征提取模块
依赖特征提取模块 DFE 用于将非欧几里得的表格数据转换为适合下游任务的图结构,将每个患者视为一个节点,基于所有样本的原始特征构建一个全连接图。接着引入医学先验知识作为划分依据,本文选择年龄作为决定因素 \(Q\),用于将全图划分成多个子图。可根据不同疾病调整 \(Q\) 的阈值。根据划分得到的子图结构,生成一个掩码矩阵 \(M\),用于在后续模块中屏蔽不同子图节点间的连接。

注意力聚合构图模块
注意力聚合构图模块通过图注意力网络动态聚合邻居节点信息,以捕获复杂的样本间关系。将经过 DFE 模块处理(即应用了掩码 \(M\))的图数据输入 GAT。GAT 的核心是计算节点间的注意力系数,对于节点 \(i\) 和其邻居节点 \(j\),其未归一化的注意力分数 \(e_{ij}\) 计算为:
其中,相关的符号及其含义如下所示:
| 符号 | 含义 |
|---|---|
| \(\vec{h}\) | 节点特征向量 |
| \(\mathbf{W}\) | 可学习的权重矩阵 |
| \(a\) | 共享的注意力函数,如单层前馈神经网络 |
使用 softmax 对邻居节点的注意力分数进行归一化,得到注意力系数 \(\alpha_{ij}\):
其中 \(\mathcal{N}(i)\) 是在掩码 \(M\) 定义的子图内,节点 \(i\) 的邻居集合。节点 \(i\) 更新后的特征 \(\vec{h}_i'\) 是其邻居特征的加权和:
其中 \(\sigma\) 是非线性激活函数,本文使用 LeakyReLU。采用多头注意力机制来稳定学习过程并捕获不同类型的关系,将各头的输出拼接或平均后得到最终的节点表示。
基于 TabNet 的特征加权模块
特征加权模块是为了保持模型的可解释性并利用 TabNet 强大的特征选择能力,同时避免原始 TabNet 在小型临床数据上参数量大、易过拟合的问题。本文没有使用完整的、端到端的 TabNet,而是仅采用了其 Attentive Transformer 部分作为一个轻量级的特征权重生成器。该模块为每个样本计算出一组特征重要性权重,将这些权重与原始输入数据相乘,实现对关键特征的强调。加权后的特征与从 CGsA 模块得到的图聚合特征表示进行拼接,共同输入最后的分类器(如多层感知机)。
实验结果
数据集
数据来源于中国成都第三人民医院全科医学科,初始收集了 2843 名患者记录。移除了缺失值过多的特征,修正或剔除了不一致或错误的条目,经过清洗后得到 2070 份完整的患者记录用于分析。最终数据集包含了 41 个特征变量,涵盖以下 5 类临床信息:
| 特征类别 | 内容描述 | 示例 |
|---|---|---|
| 临床诊断 | 多种慢性病的存在与否(二元变量)。 | 冠心病、糖尿病、高血压、慢性阻塞性肺病、抑郁症、恶性肿瘤等。 |
| 生理体征 | 连续测量的体检指标。 | 体温、体重、呼吸频率、心率、收缩压/舒张压、血氧饱和度。 |
| 人口统计学 | 患者的基本社会人口信息。 | 性别、年龄、身高、教育水平、婚姻状况、吸烟/饮酒史。 |
| 疾病特征 | 与住院和治疗过程相关的指标。 | 首次住院时长、医疗费用、首次出院结局、一年内住院次数。 |
数据集中正例(重症病例)与负例的比例约为 1:3.45 (465:1605),类不平衡在临床预测数据中常见,因此未专门采用重采样等技术处理。为评估人口统计学变量与重症风险的关联,对以下四个变量进行了卡方检验。结果均具有统计学显著性(p<0.05),表明它们是需要控制的潜在混杂因素:

由于预测重症风险属于分类问题,且临床中高召回率(减少漏诊)至关重要,论文采用以下 6 种指标进行评估:ROC 曲线、AUC、准确率、精确率、召回率、F1 分数。
对比实验
和 XGBoost、LightGBM、AdaBoost、CatBoost、SVM、KNN、随机森林比较,为减少单次实验偏差,为每种树模型定义了三种参数子类型,每种重复实验 20 次取平均。结果可见 GATET 在所有评估指标上均显著优于传统机器学习模型,在准确率上 GATET 相比表现最好的传统模型(RF,83.53%)提升了约 7 个百分点。在召回率和 F1 分数上优势更为明显,表明 GATET 在识别正例(重症患者)方面能力更强,这对于临床减少漏诊很重要。

和 TabNet、SAINT、TabTransformer、TabTranSELU、VIME、ReconTab、LF-Transformer、FT-Transformer 这些表格深度学习模型对比,采用五折交叉验证重复 20 次实验,计算均值、标准差、95% 置信区间,并进行假设检验。GATET 在准确率、精确率、召回率、F1 分数上均取得最佳成绩,且与所有基线模型的性能差异具有统计学显著性。相比最佳基线(TabNet,准确率 81.56%),GATET 准确率提升8.94个百分点;相比 SAINT(F1 分数78.22%),F1 分数提升 7.63 个百分点。

消融实验
为验证 GATET 三个核心模块(DFE, CGsA, FWT)的必要性,作者进行了消融研究。结果可见,完整 GATET 模型(DFE+CGsA+FWT)取得了最佳性能。CGsA(GAT)模块是核心,移除 FWT 模块(即仅用 DFE+CGsA)模型仍保持较高性能(准确率 89.85%),证明了图注意力聚合在捕获样本间关系上的作用。FWT(TabNet)模块提升鲁棒性与召回,在全连接图 + FWT(无子图划分)的配置中,FWT 模块提升了模型的召回率和 F1 分数。表明其在缺乏完美先验知识时,仍能通过特征加权提供价值。DFE(子图划分)非常重要,使用全连接图而不进行基于年龄的子图划分(即 Fully GAT),模型性能大幅下降,甚至不如传统 MLP。这证明了基于医学先验知识(年龄)进行子图划分的有效性和必要性。

将 GAT 与 GCN、GraphSAGE、FastGCN、VR-GCN、LGCL、ChebyConv 等其他图神经网络模型进行比较,GAT 显著优于所有其他图神经网络变体,这归因于其注意力机制能自适应地为不同邻居分配不同权重,从而更有效地建模多病患者之间复杂的相互关系。

接着测试了 GATET 中 FWT 模块在不同步长参数下的性能,并与完整的端到端 TabNet 模型进行对比。GATET 中的 FWT 模块在步长为 8 时达到最优,完整的 TabNet 模型性能远低于 GATET,且其最佳步长更小。这表明将 TabNet 简化为特征加权器并与 GAT 融合的策略,优于直接使用原始 TabNet。

对于划分标准,比较了使用不同特征(年龄、BMI-中国标准、BMI-WHO 标准、教育水平、婚姻状况)作为子图划分依据 \(Q\) 的效果。基于年龄的划分效果最好,验证了将年龄作为关键临床先验知识的合理性。更精细的划分标准带来更好性能,采用 WHO 的 BMI 标准(分类更细)优于中国的 BMI 标准。实验从实证角度证明了将领域知识融入图结构构建能极大提升模型性能。

计算复杂度分析
在低维(10 维)和高维(41 维,本研究)设置下,比较了 GATET 与基线深度学习模型的参数量和浮点运算数。虽然 GATET 参数量高于部分 Transformer 变体,但其增长相对温和。与完整的 TabNet 相比,GATET 通过移除冗余计算降低了开销。树模型在计算效率上仍有优势,但 GATET 在性能大幅提升的同时,其复杂度在可接受范围内,具备临床应用潜力。

跨领域迁移实验
该实验用于验证 GATET 在其他表格数据预测任务上的泛化能力,数据集使用公开的 CHARLS(肌少症预测)和 Kaggle Stroke(中风预测)数据集。GATET 在两个外部数据集上均保持了优异的性能,证明了其泛化能力,不仅限于本研究的特定多病共存预测任务。

优点和创新点
个人认为,本文有如下一些优点和创新点可供参考学习:
- 提出了一种图表混合深度学习架构,将 GAT 与 TabNet 融合,解决了医疗表格数据中复杂的非欧几里得特征依赖和样本间关系建模难题,显著提升了预测性能。
- 设计了一套基于医学先验知识引导的图结构构建与划分机制,通过引入年龄等关键临床因素对患者全图进行子图划分,将领域知识显式、可调节地嵌入模型,增强了模型的合理性与泛化能力。
- 实现了一种兼顾性能、可解释性与计算效率的模块化设计,模型保留了 TabNet 的特征重要性权重解释能力,并通过简化其计算模块降低了冗余开销,在提升召回率的同时,确保了模型的实际应用潜力。

浙公网安备 33010602011771号