Paper Reading:GNN Explanations That Do Not Explain and How to Find Them


Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。

论文概况 详细
标题 《GNN Explanations That Do Not Explain and How to Find Them》
作者 Steve Azzolin, Stefano Teso, Bruno Lepri, Andrea Passerini, Sagar Malhotra
发表会议/期刊 ICLR (International Conference on Learning Representations)
发表年份 2026
会议/期刊等级 CCF-A
论文代码 https://github.com/steveazzolin/gnn_deg_expl

作者单位:

  1. University of Trento, Italy(特伦托大学)
  2. Fondazione Bruno Kessler, Italy(布鲁诺·凯斯勒基金会)
  3. TU Wien, Austria(维也纳工业大学)

研究动机

自解释图神经网络(SE-GNN)将 GNN 的预测能力与前置可解释性相结合,通过解释提取器识别解释性子图,再由分类器基于这些子图生成预测。这种设计使 SE-GNNs 具有内在可解释性,适用于电网分析、健康预测、药物发现等高风险场景。已有的研究指出 SE-GNNs 的解释存在冗余、模糊、无法完全反映各子组件重要性、受虚假相关影响等问题,但鲜有研究关注是否存在 SE-GNNs 无法提供有意义解释的失败情况。

本文识别出 SE-GNNs 的一个失败案例:解释可以与模型的内部工作机制完全无关。具体来说,解释提取器可以输出一个与标签编码相关的子图,分类器通过该子图解码标签进行预测,但这个子图对任务本身没有任何判别力。这种解释是明确不忠实的,因为它只传递了标签的编码,没有给出模型如何做出决策的任何洞察。图给出了一个直观例子,在由红蓝节点组成的二分类图数据集中,每张图还包含一个绿色节点和一个紫色节点,这两个节点在所有图中都存在,对分类任务完全无关。然而解释提取器可以选择绿色或紫色节点作为解释来编码预测标签,同时分类器实际上依赖于红蓝节点的数量来做决策,用户却被误导认为绿色和紫色节点是相关的。
image

这种失败带来的风险是多方面的:

  1. 解释可能掩盖模型对受保护属性的使用,攻击者可以隐藏模型真正依赖的特征;
  2. 不忠实的解释会损害模型调试和科学发现;
  3. 现有的大多数忠实性度量指标无法检测到这类退化的解释,使得问题更加隐蔽。

综上所述,本文针对 SE-GNNs 解释可能完全偏离模型实际推理过程的问题,从理论分析、恶意攻击、自然出现和检测方法四个方面展开了研究。

这篇论文的理论论证较多,我会用引用框写上该部分的直观描述用于辅助理解。

文章贡献

本文针对自解释图神经网络中解释可能与模型内部工作机制完全无关的失败场景,开展了理论分析和实证研究。在理论层面,本文证明了在温和假设下,多种代表性 SE-GNN(包括 GSAT、LRI、CAL、GMT-lin 和 SMGNN)可以在产生退化解释的同时达到最优真实风险,这些退化解释突出显示了在所有样本中反复出现的无类别判别力的模式(称为锚集)。基于理论结果,本文依次回答了三个研究问题:RQ1 证明恶意攻击者可以操纵 SE-GNN 输出与任务完全无关的伪造解释,同时保持甚至提升预测精度,攻击者可以利用这一机制隐藏模型对敏感属性的使用。RQ2 证明大多数现有忠实性度量指标无法检测到这些已知不忠实的解释,在多个数据集和模型上拒绝率接近零。RQ3 证明退化解释也可以在正常训练中自然出现,无需恶意操纵。为解决检测问题,本文提出了扩展充分性测试(EST)度量指标,通过整体考虑解释子图的所有超图来评估忠实性,在所有测试配置中始终取得最高或接近最高的拒绝率,能够可靠地将退化解释标记为不忠实。

预备知识

理解本文需要了解以下概念:

自解释图神经网络(SE-GNN)。 SE-GNN 由两个组件组成:解释提取器 \(e\) 将输入图 \(G\) 映射到子图 \(e(G) = R \subseteq G\),分类器 \(g\)\(R\) 为输入生成预测 \(f(G) = g(e(G))\)。解释提取器可以输出每条边或每个节点的相关性分数 \(p_u \in [0, 1]\),通过阈值化或 top-k 选择形成解释子图。当相关性分数取值为 \({r, 1}\)\(r\) 为 0 或模型特定超参数)时,称解释提取器为硬提取器。

也就是说 SE-GNN 由一个解释提取器 \(e\) 和一个分类器 \(g\) 组成,模型预测为 \(f(G)=g(e(G))\)。即模型先挑出一张子图 \(R=e(G)\) 作为解释,然后只拿 \(R\) 去预测标签。该模型遵循的假设是:既然分类器只看 \(R\),那 \(R\) 一定反映了模型做决策的依据。本文针对的正是这个假设,它证明 SE-GNN 可以在实现较高准确率的同时,让 \(R\) 变成和真实逻辑毫无关系的内容,从而彻底失去解释意义。

忠实性度量指标。 忠实性指标通过扰动输入来评估解释是否真实反映模型的预测依据。充分性指标扰动解释的补集(保留解释不变),如果扰动后预测变化不大则解释是充分的。必要性指标扰动解释本身(保留补集不变),如果扰动后预测发生大幅变化则解释是必要的。不同指标还根据扰动类型区分:补集移除、解释移除、边移除、补集交换等。表给出了现有指标的分类体系。
image

本文方法

退化解释的理论分析

本文的定理 1 揭示了 SE-GNNs 可以在产生完全退化的解释的同时达到最优真实风险。将图中反复出现的无判别力模式形式化为锚集:一组单节点子图 \(Z = {z_i}_{i=1}^m\),其中每个节点出现在每个样本中,因此对分类任务没有判别力。

定理 1。\(D_{G \times Y}\) 为具有确定性真实标注函数 \(\phi: G \to Y\) 的数据分布,\(e\) 为硬解释提取器,\(Z = {z_y}_{y \in Y}\) 为锚集。则存在解释提取器 \(e(G) := z_{\phi(G)}\) 和分类器 \(g(z_y) := y\),使得 GSAT、LRI、CAL、GMT-lin 或 SMGNN 实现的 SE-GNN \(g \circ e\) 达到最优真实风险。

定理1的含义是,解释提取器可以使用任何反复出现的节点集作为标签编码的解释传递给分类器。这些解释是明确不忠实的:如果模型仅依赖锚集中的节点,它无法预测标签,因为这些节点在所有图中是常量。模型要达到高精度必须关注输入图的其他部分,但这些部分并未被解释揭示。

示例 1。 考虑二分类图数据集 \(R_{BGV}\),图由随机连接的红色和蓝色节点组成,正样本为蓝色节点数超过红色节点数的图。每张图还包含两个孤立节点,一个绿色一个紫色。绿色和紫色节点构成有效锚集,与任务完全无关。然而,解释提取器可以在红色节点数大于等于蓝色节点数时选择绿色节点、否则选择紫色节点作为解释,分类器将绿色映射为类别 0、紫色映射为类别 1,从而在提供完全无关解释的同时达到完美精度。定理 1 还可以扩展到更一般的场景。如果互斥的节点集在不同图中出现,解释提取器可以将它们划分为类别特定的块。如果不存在节点级锚集,解释提取器可以将预测编码在子图中。

一致性缺失。 定理 1 的一个推论是,同一解释可以出现在不同最优 SE-GNN 的相反类别中。给定一个最优 SE-GNN 和类别索引的排列 \(\pi\),可以构造另一个 SE-GNN\(_\pi\),使用 \(e_\pi(G) := z_{\pi(\phi(G))}\)\(g_\pi(z_y) := \pi^{-1}(y)\),同样达到最优真实风险。这意味着解释缺乏一致性,不同模型对相同模式可能给出相反的解释。

锚集是每类标签对应一个的单节点子图,比如数据集中每张图都出现、但和任务完全无关的绿色节点或紫色节点。这些节点本身没有任何判别力,模型不可能靠它们独立猜对标签。但 Theorem 1 证明,对于 GSAT、LRI、CAL、GMT-lin、SMGNN 这些主流 SE-GNN,只要允许解释提取器输出“硬”相关分(0 或 1),就存在一种最优解:提取器直接把锚节点当作解释,例如正类给紫点、负类给绿点,分类器则简单地把看到紫点映射为正类、看到绿点映射为负类。这样整个模型能达到零损失,但解释本身根本没有参与真正的推理,它只是个传递标签的编码。就像学生偷看完题目算出答案,然后在答题卡上画个颜色记号,老师(分类器)只看记号给分,记号充分到能拿满分,却没解释任何思考过程。

恶意攻击方法(RQ1)

本文设计了一种攻击方法,通过两个步骤操纵 SE-GNN 输出任意指定的不忠实解释:

  1. 攻击者为每个类别定义指定的恶意解释;
  2. 鼓励 SE-GNN 输出指定解释的同时优化下游性能。

具体实现上,攻击使用正则分类损失 \(\mathcal{L}_{\text{clf}}\) 配合二元交叉熵损失 \(\mathcal{L}_{\text{expl}}\) 来训练模型。\(\mathcal{L}_{\text{expl}}\) 将属于指定解释的节点相关性分数推向 1,其余推向 0:

\[\min_{g, e} \sum_{G, y} \mathcal{L}_{\text{clf}}(g, e, G, y) + \mathcal{L}_{\text{expl}}(e, G, y) \]

\[\mathcal{L}_{\text{expl}}(e, G, y) := \frac{1}{|V|} \sum_{u \in V} \text{BCE}(e(G)_u, p_u^y) \]

为确保 \(\mathcal{L}_{\text{expl}}\) 不与其他正则化项冲突,最好停用这些正则化项。攻击在合成数据集 \(R_{BGV}\) 和三个真实世界数据集(MNISTsp、MUTAG、SST2P)上评估。指定的解释特意选择属于锚集的节点,即与任务完全无关的节点,如 \(R_{BGV}\) 中的绿色/紫色节点、MNISTsp 中的背景像素、SST2P 中的标点符号。

实验结果如表所示,攻击始终成功,所有被攻击模型输出的解释与指定解释高度相似(F1 \(\geq\) 92%)。唯一例外是 SMGNN 在 SST2P 上(F1 \(\approx\) 59%),原因是 SST2P 测试集包含分布外图。在分布内验证集上计算 F1 得到 96.5%,验证了这一观察。被攻击模型的预测精度与未操纵版本相当,MNISTsp 上 DIR 和 SMGNN 甚至分别提升了 50% 和 5%,说明将标签编码到解释中有时反而帮助模型提升预测精度。
image

在理论基础上,论文设计了一种训练时的攻击,用来验证这种退化解释能否被故意植入。攻击者在原本的分类损失 \(\mathcal{L}_{clf}\) 之外,加了一项二元交叉熵损失 \(\mathcal{L}_{expl}\),强迫解释提取器对指定节点(比如绿点、背景像素、标点符号)输出相关分 1,对其他节点输出 0。分类器照常训练,最终学会利用这些指定节点来编码预测。实验表明,在 RBGV、MNISTsp、MUTAG、SST2P 等数据集上,攻击后的模型解释和指定锚集的 F1 分数超过 92%,而任务准确率几乎不降,甚至在 MNISTsp 上 DIR 模型的准确率从 41% 飙到 94%。这说明攻击者可以轻易用无关节点当解释依据,把模型真正依赖的敏感属性隐藏起来,而用户看到的解释完全是误导。

忠实性度量基准测试(RQ2)

本文利用恶意攻击产生的已知不忠实解释构建了受控基准,评估忠实性度量指标能否检测这些退化解释。采用审计者视角,给定输入图和关联解释的集合 \(D = {(G\_i, R\_i)}\),定义拒绝率

\[\text{RejRatio}_I(D) = \frac{1}{|D|} \sum_{(G, R) \in D} \max_{G' \in I} \mathbb{1}{g(e(G)) \neq g(e(G'))} \]

拒绝率计算被指标判定为不忠实的实例比例,\(I\) 是指标允许的扰动集合。对必要性指标,内部条件替换为 \(\mathbb{1}{g(e(G)) = g(e(G'))}\)。为使计算可行,每个样本的扰动预算固定为 50。结果如表所示,部分指标灾难性地未能拒绝退化解释。在 RBGV 上,Suf、RFid- 和 CF 的拒绝率接近零。在 SST2P 上 Fid- 的拒绝率很低,在 MUTAG 上 Fid+ 的拒绝率也很低。这表明现有忠实性度量指标可以严重地无法检测已知不忠实的解释。
image

这个章节作者想要回答的问题是:既然退化解释这么危险,那么现有的忠实度指标能不能检测出来?这里搭建了一个基准,用被攻击模型产出的“已知不忠解释”去测试各种主流指标。这些指标大致分评估必要性的(如 Fid+、PN)和评估充分性的(如 Fid-、PS、Suf)两类,它们各自只允许一种扰动,要么删解释、要么删补图、要么随机删边、要么换补图。结果显示很多指标拒绝率极低,Suf、RFid-、CF 在 RBGV 上接近 0%,Fid- 在 SST2P 上只有 8%,Fid+ 在 MUTAG 上只有 5%。根本原因在于,每种指标只测一种有限的扰动方式,而锚点解释恰好能在这些特定扰动下保持预测不变,从而全部蒙混过关。

EST 度量指标(RQ2 解决方案)

本文观察到现有指标失败的根源在于每个指标只关注有限的扰动集合,例如仅扰动边的充分性指标无法探测主要依赖节点做决策的模型。在示例中,绿色和紫色节点的解释会逃避任何仅扰动边的指标,绿色节点还会逃避任何仅测试补集移除的指标。基于这一观察,本文提出扩展充分性测试(EST):

\[\text{EST}(R, G) = \max_{R \subseteq G' \subseteq G} d\left(g(e(G)), g(e(G'))\right) \]

EST 整体考虑 \(R\)\(G\) 中的所有超图 \(G'\),无论从 \(R\) 构造 \(G'\) 需要什么类型的扰动。EST 估计的是解释的充分性:如果解释是充分的(忠实的),则将解释扩展为更大的子图不应改变预测;如果解释是不充分的(不忠实的),则存在某个超图会使预测发生变化。EST 是保守性指标,可能将忠实解释误判为不忠实,但能可靠地将不忠实解释标记为如此,最大限度降低用户被欺骗的风险。实践中为避免枚举所有超图的高计算成本,固定超图测试预算。

EST 的结果如上一张表最后一列所示,EST 是唯一在所有配置中始终取得最高或接近最高拒绝率的指标。在现有指标拒绝率为零的情况下,EST 至少拒绝约 50% 的退化解释。通过增加扰动预算,EST 的拒绝率单调递增,可达约 65%。其他指标要么不受益于更大的预算,要么在约 17% 处趋于平坦。

为了弥补上述缺陷,论文提出 EST。EST 会在解释 \(R\) 的基础上,逐步把原图中其他节点/边加回来,然后取这些超图带来的预测变化最大值。换句话说,EST 不再局限于删边或删补图这类单一操作,而是把解释到原图之间的所有可能扩展都试一遍。只要存在某个 \(G'\) 让预测变了,就说明 \(R\) 本身并不充分,模型一定还在依赖 \(R\) 之外的内容。实践中,EST 在预算内采样超图,虽然计算量稍大,但实验显示它在所有数据集上拒绝率最高或接近最高,且随预算增加还能继续上升,远比旧指标稳健。

自然出现的退化解释(RQ3)

本文进一步研究了退化解释是否可以在正常训练中自然出现,而非仅通过恶意操纵产生。实验设置上,按照各 SE-GNN 的原始协议和自然损失训练模型,调优超参数以鼓励解释稀疏性。对于 DIR,使用比原始实现小得多的 top-K 值,以展示即使在小子图中 DIR 仍能编码标签信息。

结果如表所示,自然训练的 SE-GNNs 确实可以输出退化解释。在 RBGV 上,SMGNN 高亮绿色和紫色节点,EST 拒绝率达 86.8%。在 MNISTsp 上,SMGNN 高亮背景像素,EST 拒绝率达 99.5%。在 SST2P 上,DIR 的解释高亮标点和停用词,EST 拒绝率为 49.5%。在 MUTAG 上,GSAT 和 SMGNN 的解释强调单个弱判别力原子而非有意义的官能团,EST 拒绝率分别为 64.5% 和 75.2%。
image

SE-GNNs 也会输出非退化解释,在某些情况下,模型确实高亮了具有类别判别力的子图,EST 拒绝率接近零。这说明退化解释的出现取决于训练随机性和优化路径,超出了从业者能控制的范围。现有度量指标在自然场景中同样会失败,Fid- 和 RFid- 在 RBGV 上拒绝率较高但种子间方差很大,可靠性不足。在 MNISTsp 和 SST2P 上,Fid- 和 RFid- 未能拒绝高亮背景像素和标点的解释。EST 则取得了更一致的结果。

在这里论文提出如果不恶意攻击,正常训练会不会也出问题。按原始超参数训练 GSAT、DIR、SMGNN,只是把 DIR 的 top-K 调得很小,也就是强迫解释尽量精简,结果发现退化解释确实会自然出现。当然也有正常情况,这说明退化只是优化空间里的一个陷阱,而非必然,但无法控制模型会掉进哪个解。这也反向印证了 EST 的必要性,它能在自然场景下审计出那些看似合理实则欺骗的解释。

优点和讨论

个人认为,本文有如下一些优点和创新点可供参考学习:

  1. 识别出 SE-GNNs 解释的一个失败模式,退化解释问题不同于之前发现的冗余、模糊等缺陷,它意味着解释可以与模型推理过程完全无关,动摇了 SE-GNNs 作为可解释模型的基础。锚集的概念将这一失败模式形式化为清晰的理论框架,使问题可以被严格分析。
  2. 定理 1 的构造性证明简洁有力,覆盖了五种代表性 SE-GNN 架构。解释提取器选择锚集中的节点编码标签,分类器解码标签输出预测,两者配合即可达到最优真实风险。这一结果揭示了 SE-GNNs 的解释提取器和分类器之间存在信息编码-解码的捷径,模型可以利用这一捷径绕过真正的解释义务。
  3. 攻击方法的实验设计全面且有说服力,利用恶意攻击产生的已知不忠实解释作为受控测试集,将指标能否检测已知不忠实解释转化为可量化的拒绝率,为忠实性指标评估提供了标准化框架。
  4. 现有指标失败的根源在于每种指标只覆盖有限的扰动类型,EST 通过整体考虑解释的所有超图回避了这一局限,,拒绝率随预算单调递增的特性也提供了灵活的精度-效率权衡空间。

这篇论文对现有的图可解释的研究进行了仔细的实证研究,找到了一种共性的缺陷,并通过理论论证进行说明。为了应对这种不足,本文提出了一种新的指标 EST,可以作为后续研究的基准。如果需要研究新的图可解释模型或方法,可以考虑用本文的方案进行评估。

posted @ 2026-09-05 00:55  乌漆WhiteMoon  阅读(12)  评论(0)    收藏  举报