Paper Reading: Heterogeneous Feature-Aware Graph Neural Network for Tabular Data


Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。

论文概况 详细
标题 《Heterogeneous Feature-Aware Graph Neural Network for Tabular Data》
作者 Hongxiao Fei, Jinqi Hu, Liu Yang, Tingxuan Chen, Huayou Su, Zanqun Liu
发表会议 Database Systems for Advanced Applications - 30th International Conference(DASFAA 2025)
发表年份 2025
会议等级 CCF-B
论文代码 文中未公开

作者单位:

  1. School of Computer Science and Engineering, Central South University, Changsha, China
  2. School of Computer Science and Technology, National University of Defense Technology, Changsha, China
  3. School of Civil Engineering, Central South University, Changsha, China

研究动机

表格数据是最常见的数据格式之一,以结构化形式直接反映现实世界现象,在智能医疗、推荐系统和材料基因组学等数据驱动领域的决策过程中至关重要。尽管深度学习在图像、音频和文本等领域取得了成功,并被尝试应用于表格数据,但表格数据的异质性带来了显著挑战。与同质数据集不同,表格数据包含数值型、类别型和二值型等多种特征类型,每种类型具有不同的语义、范围和分布。现有的深度学习方法(如基于 Transformer 的模型)通常无法有效区分不同特征类型间的交互,将所有特征交互简化为单一类型的信息,忽略了交互中丰富的语义和关系模式,导致特征信息的不可逆损失。GNNs 虽能通过节点和边直观地表示特征或样本及其交互,但当前方法在建模表格数据时,同样未能充分考虑特征交互的异质性。此外,GNNs 在回归任务上的探索有限,且表格数据本身缺乏显式的图结构,使得有效提取特征交互的语义关系和拓扑结构变得困难。基于上述背景,该论文旨在解决的是问题:如何有效建模表格数据中不同特征类型(数值、类别、二值)间的异质交互,为缺乏显式结构的表格数据构建有效的图表示?

文章贡献

针对深度学习方法处理表格数据时忽视特征异质性的问题,本文提出了一种名为异质特征交互网络的图神经网络模型 HFIN。模型首先对数值、类别、二值特征进行分离嵌入,并优化了数值特征的嵌入方法。然后将异质列特征视为图中不同类型的节点,通过互信息与对称矩阵分解学习特征交互的图结构。并设计了包含关系内注意力和关系间注意力的双层消息传递机制,以动态捕捉和区分不同类型特征间的交互模式,从而有效利用表格数据中的异质信息。通过在六个公共数据集上的实验,验证了该模型在分类和回归任务上优于多数深度表格学习模型,并通过消融实验证明了各模块的有效性。

本文方法

问题定义

表格数据是一种结构化数据,包含 \(N\) 行(样本)和 \(M\) 列(特征),本文关注回归和分类任务。每一列表示一个特征,特征被分为三类,用集合表示。本文研究问题相关的符号和含义如下表所示:

符号 含义
\(\mathcal{D}=\{(x_i^1, ..., x_i^j, ..., x_i^M, y_i)\}_{i \in \{1, ..., N\}}\) 一个表格数据集
\(\mathcal{F}_n\) 数值特征
\(\mathcal{F}_c\) 类别特征
\(\mathcal{F}_b\) 二值特征
\(x_i^j\) \(i\) 个样本的第 \(j\) 个列特征。
\(y_i\) \(i\) 个样本的标签

论文采用关系图来建模特征间的交互。表格的每个列特征被表示为图中的一个节点,列特征之间的交互强度表示为边的权重。节点分为三类:数值节点、类别节点、二值节点,与特征类型一一对应。关系图表示为 \(\mathcal{G} = (\mathcal{V}, \mathcal{E}, \mathcal{W}, \mathcal{R})\),相关符号和含义如下表所示:

符号 含义
\(\mathcal{V}\) 节点集合,包含数值、类别和二值节点
\(\mathcal{E}\) 边的集合,大小为 \(|\mathcal{E}|\)
\(\mathcal{W}\) 边权重矩阵
\(\mathcal{R}\) 关系类型集合

其中 \(\mathcal{R}\) 定义了不同特征类别之间的交互类型,这是本论文建模异质性的关键。具体包括六种关系:

符号 关系类型
\(r_{nn}\) 数值节点之间的交互
\(r_{bb}\) 二值节点之间的交互
\(r_{cc}\) 类别节点之间的交互
\(r_{nc}\) 数值节点与类别节点之间的交互
\(r_{nb}\) 数值节点与二值节点之间的交互
\(r_{cb}\) 类别节点与二值节点之间的交互

例如,对于连接一个数值节点 \(v_i \in \mathcal{F}_n\) 和一个二值节点 \(v_j \in \mathcal{F}_b\) 的边 \(e_{ij} \in \mathcal{E}\),其边类型为 \(r_{ij} = r_{nb}\),其边权重为 \(\mathcal{W}_{ij}\)。在构建图结构时,边的权重是无向的(对称的),方向性将在关系消息传递过程中进行处理。

为了捕获不同交互类型中的异质信息和关系模式,论文提出了异质特征交互网络。模型整体架构如下图所示,包含以下嵌入增强、图结构学习、关系消息传递 3 个模块。
搜狗高速浏览器截图20260422154641

嵌入增强

嵌入增强模块用于避免将异质特征统一嵌入到稠密空间时造成关键信息丢失,对不同特征类型进行分别处理以保留其异质信息,主要包括数值特征嵌入类别与二值特征嵌入两类。
数值特征信息丰富且具有顺序关系,但嵌入困难。先前方法如 PLR 使用周期激活函数提高了回归精度,但未能有效保留顺序关系。本文提出基于顺序与周期学习嵌入的 OPLE 方法,通过整合顺序和周期信息来增强嵌入的内部分化和特征间分化。数值特征 \(x^j\) 的映射函数为:

\[f_n(x^j) = \text{concat}[\cos(v)v, \tanh(v)]$,其中 $v = [2\pi c_1 x^j, ..., 2\pi c_k x^j] \]

公式相关符号和含义如下表所示:

符号 含义
\(c_i\) 服从 \(N(0, \delta)\) 分布的可训练参数
\(k\) 采样点数
\(\delta\) 可学习参数
\(k\) 可学习参数

类别与二值特征嵌入主要通过查找表嵌入实现,目的是保留离散语义信息,同时提高计算效率。对于类别特征的操作为:

\[f_c(x^j) = E_c(x_j), E_c \in \mathbb{R}^{C \times d} \]

二值特征的操作如下,需要对二值特征嵌入施加对称约束 \(E_b[1] = -E_b[0]\),以保持两个二值分类间的距离。

\[f_b(x^j) = E_b(x_j), E_b \in \mathbb{R}^{2 \times d} \]

图结构学习

表格数据缺乏显式图结构,本模块将列特征视为节点,以特征间的交互强度为边权重,挖掘隐式图结构。将节点分为数值、类别和二值三类。边的关系类型定义为六种:\(r_{nn}, r_{cc}, r_{bb}\)(同类型节点间交互)以及 \(r_{nb}, r_{nc}, r_{cb}\)(不同类型节点间交互)。在构建图结构时,边是无向的。利用互信息来衡量原始特征数据间的全局异质信息交互强度,构建初始边权重矩阵 \(W\)

\[W[i, j] = I(x^i, x^j) = \int_{u\in x^i}\int_{v\in x^j} P(u, v)\log\frac{P(u, v)}{P(u) P(v)} du dv \]

为避免全连接图带来的计算冗余和过拟合,通过带可学习参数的对称矩阵分解来优化拓扑,得到稀疏的邻接矩阵 \(A\)

\[A = \sigma(UU^T + b > \tau) \]

公式相关符号和含义如下表所示:

符号 含义
\(U \in \mathbb{R}^{M \times k} (k << M)\) 可学习参数
\(b\) 可学习偏置
\(\sigma\) 激活函数

为防止冗余计算并强调邻居节点信息,设置权重矩阵的自环权重为零,即 \(A[i, i] = 0, i \in \{1, ..., M\}\)。融合了互信息度量的语义关系和通过参数学习优化的拓扑结构,得到初始的异质权重矩阵 \(\mathcal{W} = A \odot W\)\(\odot\) 表示哈达玛积)。

异质消息传递

异质消息传递的目标是在加权图结构上引入关系注意力机制,增强模型捕获异质特征交互的能力,并通过边权重提高可解释性。为更好提取用于预测的全局信息,会根据任务标签类型(数值、类别、二值)初始化一个 CLS 全局节点,其与各节点之间的边权重设置为平均值。每个节点 \(v_j\) 的初始状态为其特征嵌入 \(c^j\),每条边 \(e_{ij}\) 的初始权重为异质图的边权重 \(\mathcal{W}_{ij}\)

\[v_j^0 = c^j, \quad a_{ij}^0 = \mathcal{W}_{ij} \]

为更精确地捕获不同类型特征交互中的异质信息,引入关系内注意力,动态增强同一关系类型内关键信息的权重。假设目标节点 \(v_j \in \mathcal{F}_c\)(类别节点),第 \(l\) 层中从节点 \(v_i^l\) 到目标节点 \(v_j^l\) 的交互信息(边信息)\(\hat{e}_{ij}^{l+1}\) 计算如下:

\[\hat{e}_{ij}^{l+1} = \alpha_{ij}^{l+1} MLP_r(\text{Concat}(v_i^l, v_j^l, e_{ij}^l)) \]

\[\alpha_{ij}^{l+1} = \frac{\exp(\sigma(a_r [\hat{e}_{ij}^l \| W_r v_i^l \| W_r v_j^l] + \alpha_{ij}^l))}{\sum_{k \in \mathcal{N}_r^j} \exp(\sigma(a_r [\hat{e}_{kj}^{l+1} \| W_r v_k^l \| W_r v_j^l] + \alpha_{kj}^l))} \]

公式相关符号和含义如下表所示:

符号 含义
\(MLP_r\) 提取特征交互信息的学习器
\(\sigma\) Leaky ReLU 激活函数
\(a_r\)\(W_r\) 对应边类型 \(r\) 的可学习参数
\(\mathcal{N}_r^j\) 目标节点 \(v_j\) 在关系 \(r\) 下的邻居集合

对于目标节点,将所有相同类型的边信息进行聚合,得到交互聚合信息 \(z_r^l\)

\[z_r^l = MLP_c(\sum_{i \in \mathcal{N}_r^j} \hat{e}_{ij}^l, v_j^l) \]

接着利用计算出的边信息(消息)更新边特征:

\[e_{ij}^{l+1} = e_{ij}^l + \hat{e}_{ij}^{l+1} \]

为增强不同交互类型的表示能力,进一步引入关系间注意力机制,自适应地学习各类型交互聚合信息对更新目标节点的权重。

\[v_j^{l+1} = v_j^l + \beta_{r_{cc}} z_{r_{cc}}^l + \beta_{r_{nc}} z_{r_{nc}}^l + \beta_{r_{cb}} z_{r_{cb}}^l \]

\[\beta_r = \frac{\exp(\sigma(b_r[W_r z_r^l \| W_r v_j^l]))}{\sum_{\hat{r} \in \mathcal{R}} \exp(\sigma(b_{\hat{r}}[W_{\hat{r}} z_{\hat{r}}^l \| W_{\hat{r}} v_j^l]))} \]

公式相关符号和含义如下表所示:

符号 含义
\(\beta_r\) 关系类型 \(r\) 的注意力权重
\(W_r\) 采用共享权重参数
\(b_r\) 针对关系类型 \(r\) 的可学习注意力参数
\(\mathcal{R}\) 关系类型集合。

CLS 节点根据预测的标签特征类别被视作一种节点类型(如类别变量 \(CLS \in \mathcal{F}_c\)),参与异质图上的消息传递,最后被提取出来用于预测。预测层通常由两到三层 MLP 组成。

实验结果

数据集和实验设置

实验选取了 6 个开源数据集,包括 3 个纯数值数据集和 3 个混合类型数据集,覆盖了分类和回归任务。具体如下表所示:
image
HFIN 与多种模型进行了比较,包括:XGBoost, MLP, NODE, AutoInt, TabNet, FT-Transformer, DANets, T2G-Former, INCE。实验设置如下:

实验设置 说明
数据划分 训练集:验证集:测试集 = 8:1:1
超参数 学习率=0.001,批次大小=256,训练轮数=100
训练策略 采用早停法,耐心步数=10
结果计算 所有结果均为 15 次运行的平均值以减小随机性

对比实验

如下表所示,HFIN 在六个数据集上取得了有竞争力的结果,在两个数据集上取得了最佳性能,在其余四个数据集上均取得了第二的性能。在三个混合特征类型(包含数值、类别、二值)的数据集上,HFIN 超越了所有深度表格学习方法,仅在一个数据集上略逊于传统的 XGBoost。验证了 HFIN 处理特征异质性的有效性。在纯数值回归任务上,HFIN 相比同为图神经网络的 INCE 模型有显著提升,这表明所提出的 OPLE 数值嵌入方法对回归任务有积极贡献。
image

消融实验

消融实验评估了 HFIN 中各核心模块(嵌入增强、图结构学习、关系注意力)的有效性,实验在三个有代表性的数据集(CA, CM, AD)上进行。结果可见:

  1. 在回归数据集 CA 上,OPLE 显著优于线性嵌入和 PLR 方法,验证了其整合顺序和周期信息的优势。
  2. 比较 FC+CS、FC+MIM、TO+CS 可知,使用互信息(MIM)比余弦相似性(CS)略有提升,使用拓扑优化(TO)比全连接图(FC)提升显著,说明稀疏化能有效防止过拟合,结合了拓扑优化和互信息的方法效果最好。
  3. 移除关系注意力机制(RelAtt-)后,模型在分类任务(CM, AD)上的性能明显下降,证明了该机制对于捕捉关键异质交互的重要性。
    image

优点和创新点

个人认为,本文有如下一些优点和创新点可供参考学习:

  1. 提出了一种整合顺序与周期信息的新数值特征嵌入方法,显著提升了模型在回归任务上的性能。
  2. 设计了一种结合互信息度量与可学习拓扑优化的图结构学习方法,能够有效捕获特征交互的语义与结构,并避免过拟合。
  3. 引入了关系注意力机制,通过区分同类型和不同类型交互的重要性,动态调整信息聚合权重,从而更精细地建模了异质特征交互。
posted @ 2026-04-24 14:41  乌漆WhiteMoon  阅读(41)  评论(0)    收藏  举报