Paper Reading: Analysis of tabular data based on graph neural network using supervised contrastive loss


Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。

论文概况 详细
标题 《Analysis of tabular data based on graph neural network using supervised contrastive loss》
作者 Seungyeon Lee, Minyoung Park, Younggeun Ahn, Gyeong Bok Jung, Dohyun Kim
发表期刊 Neurocomputing
发表年份 2024
期刊等级 新锐期刊分区表(2026 年 3 月)2 区 TOP,CCF-C
论文代码 文中未公开

作者单位:

  1. Department of Computer Science and Engineering, The Ohio State University, 43210, USA
  2. Department of Industrial and Management Engineering, Myongji University, 17058, Republic of Korea
  3. Department of Physics Education, Chosun University, 61452, Republic of Korea

研究动机

在许多工业应用中,表格数据是最常用的数据类型,其以行(观测样本)和列(特征)的结构化形式呈现,易于理解和解释。处理表格数据的传统机器学习方法主要分为两类:

传统机器学习方法 说明
基于特征的方法 通过探索特征之间的关系来建模,如决策树、回归、支持向量机的原始问题。其优点是模型直观、易于部署,但通常无法利用观测样本之间的关系。
基于相似性的方法 通过利用观测样本之间的相似性来建模,如支持向量机的对偶问题和 k 近邻算法。其优点是能轻易捕获观测样本间的关系,但难以考虑特征间的关系。

image
与表格数据不同,图结构能够通过节点(代表观测)和边(代表关系)来同时高效地处理观测样本和它们之间的相似性,因此图神经网络等图学习方法为此提供了可能。传统的分类任务常使用交叉熵损失,但其在存在噪声标签时鲁棒性不足,可能影响模型的泛化能力。基于上述背景,论文旨在解决的核心问题是:如何设计一种方法,能够同时利用表格数据中基于特征和基于相似性这两种视角的优势,克服它们各自的局限性,从而提升模型在分类任务上的准确性和泛化能力,并增强对噪声的鲁棒性。

文章贡献

针对传统方法在处理表格数据时特征视角与相似性视角分离的局限性,本文提出了一种名为基于图神经网络并使用监督对比损失的表格数据分析方法。模型的核心创新在于将传统的表格数据转化为图结构,从而融合了基于特征的方法和基于相似性的方法两种经典视角。首先,通过径向基函数(RBF)核计算所有观测样本之间的相似性,构建一个全连接相似性图,并使用稀疏化技术(如 ε-邻域图)保留关键连接;然后,以节点为原始特征、边为稀疏化后的相似性构建图,输入 GCN 进行训练。为了进一步提升性能,模型在标准交叉熵损失之外,引入了监督对比损失,其目标是拉近同类样本在嵌入空间的表示,并推远不同类样本的表示,从而学习到更具判别性和泛化能力的特征。最终,该模型通过 GCN 的邻居聚合机制,同时利用了节点自身特征和其相似邻居的信息,实现了对表格数据更全面、更鲁棒的分析。实验结果表明,所提方法在分类准确率、F1 分数上表现最优,尤其在小样本场景下优势显著。

本文方法

作者提出了一种基于 GNN 的分类算法,旨在同时利用表格数据的特征信息和观测样本间的相似性信息。该方法通过将表格数据转换为图结构,并结合监督对比学习,以增强模型的表示学习能力和泛化性能。该方法分为三个步骤,分别是:获取相似性图、使图稀疏化、使用监督对比损失训练分类器。
image

获取相似性图

获取相似性图的目标为将表格数据转换为相似性图。操作方法是计算观测样本间的相似性矩阵,以此作为加权邻接矩阵 \(A\)。使用径向基函数(RBF)核计算节点 \(x_i\)\(x_j\) 之间的相似性:

\[A_{ij} = k(x_i, x_j) = \exp\left\{-\gamma \|x_i - x_j\|^2\right\} \]

相似性值在 0 到 1 之间,值越接近 1 表示两个观测样本越相似。图结构中每个观测样本成为一个节点,其原始特征作为节点特征。邻接矩阵 \(A\) 的元素 \(A_{ij}\) 表示节点 \(i\)\(j\) 之间边的连接强度(权重)。

使图稀疏化

第一步得到的相似性图是一个全连接图,计算量大且可能包含大量弱相似性的噪声边。稀疏化能保留关键连接,并有助于捕捉数据的流形结构。论文介绍了三种常用的图稀疏化方法:

稀疏化方法 说明
\(\varepsilon\)-邻域图 设定一个阈值 \(\varepsilon\),将相似性小于 \(\varepsilon\) 的边权重设为 0。可生成无权图(非零元设为 1)或加权图。
k-最近邻图 为每个节点只保留与其最相似的 k 个邻居的边。此方法生成的邻接矩阵通常是非对称的(有向图)。
互 k-最近邻图 仅当两个节点互为对方的 k-最近邻时,才保留它们之间的边。此方法生成的是无向图。

监督对比损失训练分类器

使用图卷积网络(GCN)作为主干网络,该模块的输入是稀疏化后的邻接矩阵 \(\hat{A}\)(经过标准化处理)和节点特征矩阵 \(X\)
image
总损失由交叉熵损失和监督对比损失加权和构成:

\[L_{\text{all}} = L_{\text{cls}} + L_{\text{cont}} \]

交叉熵损失 \(L_{\text{cls}}\) 用于标准的分类任务:

\[L_{cls} = \sum_{k=1}^{K} y_k \log \hat{y}_k \]

监督对比损失 \(L_{\text{cont}}\) 是本文创新之一,用于学习更具判别性的节点嵌入表示。其目标是拉近同一类别样本的嵌入,推远不同类别样本的嵌入

\[L_{\text{cont}} = \sum_{i \in I} \frac{-1}{|P(i)|} \sum_{p \in P(i)} \log \frac{1_{[p \neq i]} \exp(h_i \cdot h_p / \tau)}{\sum_{j \in I} 1_{[j \neq i]} \exp(h_i \cdot h_j / \tau)} \]

其中,相关符号及其含义如下所示:

符号 含义
\(h_i\) 节点 \(i\) 在最后一层隐藏层的嵌入向量
\(P(i) \equiv \{p \in I: y_p = y_i\}\) 与节点 \(i\) 属于同一类别的节点索引集合(正样本)
\(\tau\) 温度参数

该损失函数简化了正负样本对的构建:同一类别的节点自动构成正样本对,不同类别的节点自动构成负样本对。算法的伪代码如下图所示:
image

方法优势与解释

GCN 通过其邻居聚合机制,在更新节点特征时,既考虑了节点自身的特征(特征视角),也聚合了其相似邻居的特征(相似性视角)。通过考虑相似观测的特征,该方法能“平滑”每个类别内部的特征分布,减少类内方差,从而形成更清晰的决策边界。同时该方法继承了特征基方法对特征噪声的鲁棒性,以及相似性基方法对观测噪声的鲁棒性,因此能更稳健地处理包含两种噪声的数据。将表格数据转换为稀疏图的过程,本质上是通过连接相似样本来探索数据的潜在流形,GCN 的深层聚合可以探索更广泛的邻域结构。由于 GCN 可以一次性输入所有节点(包括未标记节点),并通过聚合有标签邻居的信息来影响无标签节点的表示,因此该方法适用于半监督学习场景。
与 GAT 等通过注意力机制强调重要邻居的方法不同,本文方法通过监督对比损失直接驱使同类节点的嵌入表示相似,从而更直接、更简单地实现关注同类邻居的效果,无需增加复杂的注意力层。与采用无监督对比学习的 GNN 方法(需通过复杂的图增广构造正负对)不同,本文的监督对比学习利用已知的类别标签来定义正负对,更加直接和有效。

实验结果

数据集和实验设置

为了全面评估,论文与以下几类模型进行了对比:

对比模型 说明
特征基方法 仅使用特征作为输入的 DNN
相似性基方法 仅使用观测样本间相似性作为输入的 DNN
朴素方法 简单地将特征和相似性两个向量拼接后输入DNN
XGBoost 强大的梯度提升树模型
TabNet 使用注意力机制的表格数据深度学习模型
NODE 神经 oblivious 决策集成模型
GAT 图注意力网络,作为一种先进的 GNN 基线

实验使用了四个具有不同特性的表格数据集:
image

评估指标使用准确率 Accuracy 和 F1 Score,报告其均值±标准差。使用网格搜索确定最佳超参数,如网络层数、隐藏层节点数、RBF核的 \(\gamma\)、温度参数 \(\tau\)\(\varepsilon\) 阈值等,采用 3 折交叉验证在验证集上选择。使用 Adam 优化器,学习率为 0.001,激活函数为 ReLU,特征标准化,权重从高斯分布初始化。确定最优超参数后,在测试集上运行 100 次以计算平均性能。

对比实验

实验结果可见所提方法(特别是结合了监督对比损失的版本 Proposed method w/ L_cont)在所有数据集上均取得了最高的准确率和 F1 分数。在 Brain 和 BV这类观测样本极少但特征维度极高的数据集上,传统前沿模型(XGBoost, TabNet, NODE)的性能出现显著下降。而所提方法表现出了稳定的性能,甚至在 Brain 数据集上达到了 100% 的准确率。证明了该方法在数据稀缺场景下学习泛化表示的能力。
image
在 BV、Yeast和Covertype 数据集上,加入监督对比损失 (w/ L_cont) 后,模型性能相比仅使用交叉熵损失的基础版本有明显提升。这验证了监督对比损失在帮助模型学习更紧凑的类别表示方面的作用。单独的特征基方法或相似性基方法在所有数据集上的表现普遍不如所提的融合方法,尤其是在 Yeast 数据集上 F1 分数较低,印证了结合双重视角的必要性。

图稀疏化方法对比

比较了不同图稀疏化方法对性能的影响,结果可见加权 \(\varepsilon\)-邻域图在大多数数据集上表现最好。加权方法性能优于无权方法,这表明在 GCN 的聚合过程中,考虑边权(即相似性强度)至关重要,简单地二值化(连接/不连接)会损失重要信息。k-最近邻图和互 k-最近邻图性能稍逊,但表现相近。
image

表示学习与噪声鲁棒性分析

在 Brain 数据集上的可视化分析表明,随着 GCN 层数的增加,每个类别内部各特征的方差(标准偏差)显著减小。说明模型通过聚合相似节点的信息,有效“平滑”了类内特征分布,使得决策边界更加清晰。
image
在 Brain 数据集上添加了不同比例的随机噪声(特征噪声、观测噪声、或两者同时)后,比较了各方法的性能变化。所提方法在所有噪声设置下性能下降幅度最小,展现出最强的稳定性。这得益于其结合了双重视角的优势,即特征基部分对观测噪声相对鲁棒,相似性基部分对特征噪声相对鲁棒。因此,所提方法能同时抵御两种类型的噪声干扰,验证了其增强的泛化能力。
image

优点和创新点

个人认为,本文有如下一些优点和创新点可供参考学习:

  1. 将表格数据构建为图,使图卷积网络能同时利用样本特征和样本间相似性这两种互补的信息源,克服了传统单一视角方法的局限性。
  2. 在损失函数中引入监督对比损失,直接基于类别标签构建正负样本对,迫使同类样本的嵌入表示更紧密,从而有效提升了模型的判别能力和对噪声标签的鲁棒性。
  3. 该方法继承了特征基方法对特征噪声的鲁棒性和相似性基方法对观测噪声的鲁棒性;同时,通过构建稀疏相似性图,自然地实现了对数据潜在流形结构的探索。
posted @ 2026-04-22 14:39  乌漆WhiteMoon  阅读(26)  评论(0)    收藏  举报