RumorSAGE
RumorSAGE: Semantic Augmentation Graph for Early Rumor Detection
一、论文基础信息
- 标题:RumorSAGE: Semantic Augmentation Graph for Early Rumor Detection(谣言感知图:面向早期谣言检测的语义增强图模型)
- 作者:Chang Yang、Xia Yu*、Jiayi Wu、Dan Xue、Yong Duan(其中 Xia Yu 为通讯作者,第一单位均为沈阳工业大学,Jiayi Wu 任职于中国汽车技术研究中心有限公司)
- 来源:2024 3rd International Conference on Cyber Security, Artificial Intelligence and Digital Economy(CSAIDE 2024,2024 年第三届网络安全、人工智能与数字经济国际会议)
- 发布时间:2024 年 3 月 1 日(会议举办时间为 2024 年 3 月 1-3 日,南京;论文正式出版标注时间为 2024 年 3 月)
二、研究背景与问题
(一)研究动机(现有方法不足)
- 社交媒体的普及使得谣言快速传播,对社会稳定、公共事件(如 2024 年美国大选)造成严重威胁,早期谣言检测成为关键需求,但社交网络信息的复杂性给谣言检测带来巨大挑战。
- 传统谣言检测方法存在实体偏差问题,对实体信息的学习不充分;同时语义结构信息挖掘不足,导致模型在未见过的数据集上泛化能力较差。
- 基于图神经网络的现有方法,在谣言传播初期可利用的传播结构数据有限,难以充分发挥其结构特征捕捉优势;社交媒体文本的字符限制也导致上下文信息不足,影响语义理解。
- 部分研究仅关注概念对实体的影响,未深入探索概念与句子间的相互作用,且关键信息在文本中呈分散分布,现有方法难以有效整合这类信息。
(二)研究问题
针对上述不足,本文核心研究问题为:如何构建一种能解决实体偏差、充分挖掘语义结构信息、整合分散的关键文本信息的模型,实现社交媒体环境下的高效早期谣言检测,具体需解决:
- 如何对文本进行语义增强,提升实体信息学习的充分性,缓解实体偏差;
- 如何构建合理的图结构,捕捉推文与实体间的异构语义关系,整合分散的关键信息;
- 如何设计有效的注意力机制,在异构图框架下增强模型对复杂语义关系的建模和表示能力,提升早期谣言检测的准确性和鲁棒性。
三、Methods
本文方法核心为RumorSAGE 模型,整体分为问题描述、语义增强模块、异构信息关系构建模块、语义增强的异构建模模块四个小节,模型通过三大核心模块协同工作,将谣言检测定义为分类任务并完成异构语义建模。
3.1 Problem Description 问题描述
- 任务定义:将谣言检测视为四分类任务,标签集合\(Y=\{T, F, N, U\}\),分别对应真实谣言、虚假谣言、非谣言、未验证谣言。
- 目标函数:学习函数\(p(Y | G ; \theta)\),其中\(\theta\)为模型可学习参数,输入为每个事件的上下文感知语义增强图\(G_{i}=(V_{i}, E_{i})\)。
- 图结构构成:
- 节点集\(V_{i}\):包含增强推文节点集\(t'\)(源推文 + 关联评论)和增强实体节点集\(e'\);
- 边集\(E_{i}\):由推文节点与实体节点的关联关系构成,即\(E_{i}=\{(t'_{i}, e'_{j}) | t' \in t', e'_{j} \in e'\}\),用于封装事件中实体与句子的复杂关系。

3.2 Semantic Enhancement Module 语义增强模块
核心目标:解决实体偏差问题,充分挖掘文本中的实体和语义信息,由 ** 文本数据增强单元(TDAU)、实体提取与链接单元(EELU)、上下文实体丰富单元(CEEU)** 三部分组成。
- 文本数据增强单元(TDAU)
- 不足:传统文本数据增强技术难以保证生成数据标签的准确性和多样性;
- 方法:采用 ChatGPT 处理原始文本,通过定制化 prompt 消除文本中的非规则元素(如话题标签),在保留原始含义、关键对象 / 概念及相互关系的前提下提炼文本,构建增强推文集\(t'\),提升数据表示的质量和准确性。

- 实体提取与链接单元(EELU)
- 方法:通过 ChatGPT 对增强文本进行实体链接和概念化(定制 prompt 分步骤提取实体、链接知识库、概念化),挖掘文本语义信息,提取关键实体及相关概念;
- 表示:源推文\(t_{0} \in R^{n ×d}\),对应实体\(e_{t} \in R^{m ×d}\),概念\(C_{t} \in R^{m ×k ×d}\)(\(m\)为最大实体数,\(k\)为每个实体的最大概念数),实现实体和概念的结构化提取。

- 上下文实体丰富单元(CEEU)
- 不足:现有研究仅关注概念对实体的影响,未探索概念与句子的相互作用,且概念在不同上下文中的重要性不同;
- 方法:通过计算概念与对应句子中其他词的相似度评估概念重要性,将概念向量的加权和融合到原始实体向量中,得到增强实体表示;
- 公式:\(e_{t}'=e_{t}+\sum_{j=1}^{k} softmax\left(sim\left(e_{t}, C_{t}^{j}\right)\right) \cdot C_{t}^{j}\)(\(sim\)为点积相似度,\(softmax\)实现权重归一化)。
3.3 Construction of Heterogeneous Information Relationships Module 异构信息关系构建模块

核心目标:解决关键信息在文本中分散分布的问题,构建上下文感知语义增强图,整合推文与实体的异构关系。
- 图结构构建:融合增强推文节点\(t'\)和增强实体节点\(e'_{t}\),构建异构图;
- 核心元路径:设计两种异构关系元路径,捕捉不同维度的语义关联:
- TET(Tweet-Entity-Tweet):推文 - 实体 - 推文,强调跨推文的实体交互,将每个推文节点链接到其包含的实体;
- ETE(Entity-Tweet-Entity):实体 - 推文 - 实体,关注实体特征与推文的关系,将每个实体节点链接到包含它的推文。
3.4 Semantic-Enhanced Heterogeneous Modeling 语义增强的异构建模

核心目标:增强异构图框架下模型的可解释性和表示能力,设计语义增强的异构注意力机制,包含 ** 局部语义增强、元路径语义整合(MPSI)** 两部分。
- 前置处理:将增强推文节点\(t'\)和增强实体节点\(e'_{t}\)投影到统一特征空间,消除特征空间差异,公式:\(t_{t}'=W_{t}^{\prime T} \cdot t'\),\(e_{i}'=W_{e}^{\prime T} \cdot e_{i}'\)(\(W_{t}'、W_{e}'\)为可学习投影矩阵)。
- 局部语义增强:包含实体语义增强和推文语义增强,通过注意力机制计算节点间的注意力分数,捕捉同类型节点的语义关联;
- ESE 元路径(实体节点间注意力)
\(\beta _{ji}^{\prime }=\frac {exp \left( \alpha \left( a_{e}^{T}\cdot \left[ e_{j}^{\prime };e_{i}\right] \right) \right) }{\sum _{k\in N_{e_{j}}}exp \left( \alpha \left( a_{e}^{T}\cdot \left[ e_{j};e_{k}\right] \right) \right) }\)
\(\beta _{ji}^{\prime }\) : 实体节点$e_j$对其邻居实体节点$e_i$的注意力权重(核心输出)
\(\beta _{ji}^{\prime }\) : 实体节点$e_j$对其邻居实体节点$e_i$的注意力权重(核心输出)
[e_j';e_i] :实体节点$e_j$与$e_i$的特征拼接操作,融合两个节点的特征信息
N_{e_j} :实体节点$e_j$的邻居节点集合(基于ETE元路径关联的其他实体节点)
-
SES 元路径(句子节点间注意力)
\(\alpha _{ji}^{\prime }=\frac {exp \left( \alpha \left( a_{t}^{T}\cdot \left[ t_{j}' ; t_{i}'\right] \right) \right) }{\sum _{k\in N_{t_{j}}}exp \left( \alpha \left( a_{t}^{T}\left[ t'_{j};t_{k}\right] \right) \right) }\)
\(\alpha _{ji}^{\prime }\): 实体节点$t_j'$对其邻居实体节点$t_i'$的注意力权重(核心输出)
[t_j';t_i'] :实体节点$t_j'$与$t_i'$的特征拼接操作,融合两个节点的特征信息
N_{t_j} :实体节点$t_j'$的邻居节点集合(基于TET元路径关联的其他实体节点)
- 说明:\(a_{e}、a_{t}\)为可学习参数,\(\alpha\)为 LeakyReLU 非线性激活函数。
- 元路径语义整合(MPSI)
- 不足:异构图中不同元路径的特征复杂且多样,需考虑元路径的独特性和协同效应;
- 方法:采用 协同注意力(co-attention)策略,自适应学习不同元路径的重要性并整合异构信息,步骤如下:
① 计算增强实体节点与推文节点的亲和矩阵:\(C_{e t}=tan h (e_{j}^{\prime \prime} T_{W_{e t}} t_{i}^{\prime \prime})\)(\(W_{et}\)为可学习参数);
② 以亲和矩阵为特征,学习实体和推文特征的注意力图,公式:
\(H_{t}=tanh\left( W_{t} t_{i}^{\prime \prime }+\left( W_{e}e_{j}^{\prime \prime }\right) C_{et}^{T}\right) , \alpha _{t}=softmax\left( W_{T}^{T}H_{t}\right)\)
\(H_{e}=tanh\left( W_{e} e_{j}^{''}+\left( W_{t} t_{i}^{''}\right) C_{et}\right) , \alpha_{e}=softmax\left( W_{E}^{T} H_{e}\right)\)
③ 融合元路径特征:\(z_{i}=\alpha_{t} t_{i}^{\prime \prime}+\alpha_{e} e_{j}^{\prime \prime}\)(\(\alpha_{t}、\alpha_{e}\)为注意力权重),最终通过 MLP 输出分类预测结果。
四、Experiment 实验部分详细笔记
4.1 Datasets 数据集
采用谣言检测领域两个经典公开数据集Twitter15、Twitter16,均将谣言分为 ** 真实谣言(T)、虚假谣言(F)、非谣言(N)、未验证谣言(U)** 四类,是该领域的主流基准数据集。
4.2 Experimental Setup 实验设置(补充,为实验结果提供支撑)
- 实验框架:基于 PyTorch 实现,硬件为 NVIDIA Tesla V100 GPU;
- 训练参数:批次大小 64,训练轮数 100,初始学习率 5e-5,L2 正则化系数 0.001,优化器为 Adam,损失函数为交叉熵损失;
- 数据集划分:70% 训练集、20% 验证集、10% 测试集,引入 ** 早停(early stopping)** 机制缓解过拟合;
- 评估指标:准确率(Acc)、F1 值(按 N/F/T/U 四类分别计算)。
4.3 Baselines 对比基线模型
选取谣言检测领域不同研究阶段的 6 类主流 SOTA 模型,覆盖传统深度学习、图神经网络等方法,对比性强:
- GRU-RNN:基于循环神经网络的经典文本模型,捕捉谣言传播的动态特征;
- dEFEND:引入注意力机制的模型,学习原始推文与用户评论间的语义相关性;
- RvNN:基于递归神经网络的模型,通过信息传播树捕捉传播遍历模式;
- BiGCN:基于图卷积网络的模型,构建双向图捕捉谣言传播的结构特征;
- STS-NN:时空结构神经网络,融合空间树模型、GRU 时间特征和自注意力特征聚合;
- Ours(RumorSAGE):本文提出的模型。
4.4 实验内容及对应结果
本文设计三类核心实验:基准模型对比实验、消融实验、早期谣言检测专项实验,分别验证模型的整体性能、各模块的有效性、早期检测的核心能力。
(1)基准模型对比实验
实验目的:验证 RumorSAGE 相较于现有 SOTA 模型的整体性能优势;
实验结果(核心指标:整体 Acc、各分类 F1):

- 仅关注文本内容的模型(GRU-RNN、dEFEND)性能最差,难以提取深层语义特征,无法有效区分谣言类型;
- 融合结构信息的模型(RvNN、BiGCN、STS-NN、RumorSAGE)性能显著更优,证明结构特征对谣言检测的重要性;
- 本文 RumorSAGE 在 **Twitter15(Acc=0.817)、Twitter16(Acc=0.813)** 上均取得最高准确率,且各分类 F1 值整体最优,尤其是 Twitter16 的未验证谣言 F1 值达 0.895,体现了模型对不同类型谣言的有效识别能力。
(2)消融实验
实验目的:验证 RumorSAGE 各核心模块的必要性和贡献度,设计 5 种模型配置;
实验配置:
- RumorSAGE:完整模型(所有模块);
- w/o Semantic Enhancement Module:移除文本数据增强单元(TDAU);
- w/o Heterogeneous Information Relationships:取消异构图构建,直接连接句子与概念;
- w/o Semantic-Enhanced Heterogeneous Modeling:用全连接层替换语义增强的异构注意力机制;
- w/o CEEU:移除语义增强模块中的上下文实体丰富单元。
实验结果(核心指标:Acc):

结果分析:
- 异构信息关系模块是核心:移除后 Twitter15/16 准确率分别下降 5.2%/2.9%,降幅最大,证明异构图能有效捕捉复杂的结构和语义关系,是模型性能的关键;
- 语义增强的异构建模模块贡献显著:移除后准确率分别下降 3.0%/2.1%,证明注意力机制能有效整合异构元路径信息,提升特征表示能力;
- 语义增强模块(TDAU)和 CEEU 均有正向贡献:移除后准确率均出现不同程度下降,虽 CEEU 降幅较小,但对优化实体特征、提升语义理解的作用不可忽视;
- 所有模块的协同作用是模型性能最优的关键,单一模块的缺失均会导致性能下降。
(3)早期谣言检测专项实验
实验目的:验证 RumorSAGE 在数据稀缺场景下的早期谣言检测能力(谣言传播初期训练数据有限);
实验设计:设置不同训练集比例(0.1、0.3、0.5、0.7),验证集比例固定为 0.1,剩余为测试集,评估各模型在不同训练规模下的性能;
实验结果:

- RumorSAGE 在所有训练比例、两个数据集上的性能均显著优于所有基线模型;
- 当训练集比例降至 0.1(数据极度稀缺)时,BiGCN、RvNN 等基线模型性能出现明显不稳定性,而 RumorSAGE 仍保持较高且稳定的准确率;
- 模型的早期检测优势源于上下文感知语义增强图和语义增强的异构注意力机制,能封装长距离语义结构,融合语义内容与结构特征,提升低资源场景下的特征表示能力。
4.5 实验结论
- RumorSAGE 通过语义增强和异构图建模,有效解决了传统方法的实体偏差、语义结构挖掘不足、关键信息分散等问题,在谣言检测的整体准确率和各分类 F1 值上均显著优于现有 SOTA 模型;
- 模型的各核心模块均具有不可替代性,其中异构信息关系构建模块是性能的核心支撑,各模块的协同工作实现了最优性能;
- RumorSAGE 在低资源 / 数据稀缺场景下具有优异的鲁棒性和准确性,能有效实现早期谣言检测,解决了谣言传播初期数据有限的核心痛点;
- 结构特征与语义特征的融合是提升谣言检测性能的关键,而基于 ChatGPT 的语义增强和异构注意力机制能有效强化这种融合效果。
五、论文核心观点 / 贡献
(一)核心观点
- 谣言检测的核心难点在于实体偏差和语义结构信息的有效挖掘,且谣言传播初期的数据稀缺性要求模型具备强鲁棒性;
- 基于 ChatGPT 的语义增强能有效提升文本和实体信息的质量,缓解实体偏差,为后续建模奠定基础;
- 构建推文 - 实体异构图并设计 TET/ETE 元路径,能有效整合文本中分散的关键信息,捕捉事件中实体与句子的复杂语义关系;
- 语义增强的异构注意力机制能在异构图框架下实现局部语义增强和元路径语义的自适应整合,提升模型对复杂语义关系的表示和建模能力,是低资源场景下早期谣言检测的关键。
(二)三大核心贡献
- 提出全新的 RumorSAGE 框架:首次将语义增强与上下文感知语义增强图结合,针对性解决传统谣言检测方法的实体偏差和复杂语义结构挖掘难题,为社交媒體早期谣言检测提供了新的有效框架;
- 设计创新的语义增强和异构建模方法:
- 利用 ChatGPT 实现文本和实体的语义增强,保证了数据表示的准确性和多样性,为谣言检测提供高质量的语义特征;
- 设计语义增强的异构注意力机制,融合局部语义增强和元路径语义整合,实现了异构图中推文与实体特征的有效融合,提升了模型的可解释性和表示能力;
- 充分的实验验证:在 Twitter15、Twitter16 两个基准数据集上完成了基准对比、消融、早期检测三类实验,充分验证了模型在整体性能、模块有效性、低资源鲁棒性上的优势,为早期谣言检测的研究提供了可靠的实验依据和参考。

浙公网安备 33010602011771号