T5-ParEvo Analyzing Robustness of Automatic Scientific Claim Verification Tools against Adversarial Rephrasing Attacks
论文基础信息
- 标题:Analyzing Robustness of Automatic Scientific Claim Verification Tools against Adversarial Rephrasing Attacks(分析自动科学声明验证工具对抗对抗性重述攻击的鲁棒性)
- 作者:Janet Layne、Qudrat E. Alahy Ratul、Edoardo Serra(博伊西州立大学);Sushil Jajodia(乔治梅森大学,通讯作者)
- 来源:ACM Transactions on Intelligent Systems and Technology(ACM 智能系统与技术汇刊),Volume 15, Issue 5
- 发布时间:在线预印 2024 年 5 月 2 日;修订 2024 年 1 月 6 日;录用 2024 年 4 月 1 日;正式出版 2024 年 11 月(标注 2025 年 2 月 12 日发布)
- 代码:https://github.com/ratulalahy/T5ParEvo
研究背景与问题
研究动机(现有不足)
- 新冠疫情背景下科学虚假信息泛滥,自动科学声明验证(SCV)工具是识别虚假信息的关键,但现有 SCV 工具存在鲁棒性缺陷,易受对抗性攻击,可能反而助推虚假信息传播。
- 通用 NLP 对抗性攻击生成器应用于 SCV 任务时存在两大问题:一是生成的修改声明与原声明语义完全不同;二是即使保留语义,修改仅为单字替换,过于简单,无法发现 SCV 工具的深层弱点。
- SCV 工具的工作机制复杂(包含摘要检索、理据选择、立场预测等步骤),非可微模型,白盒攻击和混合攻击方法不适用,仅能采用黑盒攻击,但现有黑盒攻击模型对 SCV 工具的攻击效果差。
- 现有顶级 SCV 工具(VERISCI、MultiVerS、ARSJoint)存在核心缺陷:语义等价但表述不同的科学声明,可能被工具分类为不同结果(SUPPORT/REFUTE)。
研究问题
- 如何设计针对 SCV 工具的黑盒对抗性攻击生成模型,在严格保留原科学声明语义的前提下,生成复杂、多样化的对抗性重述,有效触发 SCV 工具的分类错误,暴露其弱点?
- 如何构建一套针对 SCV 工具对抗性攻击的定量 + 定性评估框架,全面衡量攻击生成模型的效果(语义保留、句法多样性、语法正确性等)?
- 验证新设计的攻击模型对主流 SCV 工具(VERISCI、MultiVerS、ARSJoint)及零样本学习的 ChatGPT 的攻击效果,同时分析 SCV 工具和 ChatGPT 在对抗性重述下的鲁棒性缺陷。
Methods
本文方法核心为提出T5-ParEvo,一种基于迭代进化算法的 SCV 工具黑盒对抗性攻击生成模型,整体分为相关工作分析、T5-ParEvo 模型设计两大模块,具体细分如下:
2 Related Works 相关工作
2.1 SCV Tools 科学声明验证工具
选取 3 个开源、高性能的 SCV 工具作为攻击目标,均采用 “摘要检索→理据选择→立场预测” 三步架构,核心差异如下:
- VERISCI:经典 SCV 工具,构建 SCIFACT 数据集;分模块训练(TF-IDF 做摘要检索,BERT 做理据选择,RoBERTa 做立场预测),仅基于理据句子做分类,未结合完整摘要上下文。
- MultiVerS:VERISCI 升级版,SCIFACT 排行榜当前榜首;采用 Longformer 处理长文档,结合完整摘要上下文分类;多任务损失联合训练理据选择和立场预测,融合域外 / 域内弱监督数据微调。
- ARSJoint:三步任务联合训练,基于 BioBERT(512 令牌限制),通过正则化实现摘要检索和理据选择的信息交互,保留完整摘要的词表示。
2.2 NLP Adversarial Attack Tools NLP 对抗性攻击工具
按攻击类型分类分析,明确现有工具对 SCV 任务的不适用性:
- 分类:先验模型(不考虑分类器)、分类器驱动模型(白盒 / 黑盒 / 混合);SCV 工具仅适用于黑盒攻击(非可微、含检索模块,白盒 / 混合攻击无法适配)。
- 主流黑盒攻击模型及缺陷:
- TextFooler:基于词重要性排序做同义词替换,仅生成单个攻击样本,易替换科学术语导致语义丢失,语法错误多。
- CheckList:生成测试用例做攻击,词替换易出现反义词 / 无关词,对 SCV 工具攻击成功率极低。
- BERT-Attack:基于上下文做词替换,但无法理解科学术语,易替换为反义词导致语义反转。
- BAE:支持词插入 / 替换,仍缺乏科学术语理解能力,修改仅为简单迭代,句法结构与原声明一致。
- 共性缺陷:语义保留差、修改方式简单(单字替换)、对科学术语处理能力不足,无法有效暴露 SCV 工具的深层弱点。
3 T5-ParEvo 模型设计

T5-ParEvo 是基于 T5 语言模型的迭代进化黑盒攻击生成器,核心目标:生成语义等价且能触发 SCV 工具分类错误的对抗性重述,整体分为初始化和迭代进化过程两大步骤,包含语义检查器核心组件,
3.1 Generating Paraphrased Claims and T5-ParEvo Initialization 重述生成与模型初始化
- 基础模型选择:采用基于 Google PAWS 预训练的 T5 模型(经对比,T5 在生成数量、语义保留、句法多样性上优于 BART、Alpaca、Primera 等其他重述模型)。
- 无监督微调初始化:利用 SCIFACT 数据集的声明和摘要语料(拆分为 45952 个原子句子),采用去噪训练法微调 T5;使用 scispaCy 的 NER 模型做令牌化,避免科学术语被部分掩码,共 3 轮掩码训练(掩码 15% 令牌)。
- 初始化目的:让 T5 模型适配科学语言表达,为后续迭代进化奠定基础。
3.2 Semantic Checker 语义检查器
核心功能:严格筛选出与原声明语义等价的对抗性重述,是 T5-ParEvo 的关键组件,需满足两个必要条件(二者同时成立才判定为语义等价):
- 技术术语完全保留:利用 scispaCy 的 4 个领域 NER 模型(biolnp13cg、jnlpba、craft、bc5cdr)识别原声明和重述声明中的技术术语(单字 / 多字),仅允许术语的后缀 - ed/-s 变化,要求技术术语集合完全一致。
- 双向蕴含关系成立:采用基于 MultiNLI 预训练、SciTail 数据集微调的 RoBERTa 模型,验证原声明与重述声明的双向蕴含(\(C_{orig} \vDash C_{par} \land C_{par} \vDash C_{orig}\)),确保逻辑语义完全等价。
- 作用:排除语义改变 / 丢失的重述,仅保留 “真正因 SCV 工具弱点导致分类错误” 的有效对抗样本,区别于现有攻击模型的无效样本。
3.3 Iterative Evolutionary Procedure 迭代进化过程
基于黑盒假设(仅能查询 SCV 工具的分类结果,无其他内部信息),迭代优化 T5 模型的攻击生成能力,每轮迭代包含 5 个步骤(共 50 轮,无新攻击样本时手动停止):
- 生成重述样本:当前 T5 模型为每个原声明生成 h 个重述声明,构成初始集合 IS。
- 筛选分类错误样本:查询 SCV 工具,筛选出与原声明分类结果不同的重述,构成成功集合 SS。
- 语义等价筛选:用语义检查器过滤 SS,得到语义等价的有效对抗样本集合 SCS。
- 更新数据集:将 SCS 中的(原声明 - 重述声明)对加入数据库 DB。
- 微调 T5 模型:用 DB 中的所有样本对 T5 模型做微调,提升下一轮的攻击生成能力。
- 进化核心特性:从所有声明中学习 SCV 工具的弱点,而非单一声明,实现攻击策略的泛化;通过多轮迭代,生成的对抗样本复杂度和多样性持续提升。
- 算法本质:将 T5 模型视为 “重述生成函数”,通过 SCV 工具的反馈和语义检查器的筛选,迭代优化该函数,使其能生成满足要求的对抗性重述。
Experiment
实验核心目标:全面评估 T5-ParEvo 的攻击效果,并与现有黑盒攻击模型对比;同时分析 SCV 工具和 ChatGPT 的鲁棒性缺陷,实验分为实验设置、定量分析、定性分析、附加实验、消融实验五部分。
4.1 Experiment Setting 实验设置
4.1.1 实验对象
- SCV 工具:VERISCI(F1=0.47)、MultiVerS(F1=0.7248)、ARSJoint(F1=0.7123);补充测试零样本 ChatGPT(SCV 任务 F1=0.63)。
- 对比模型:4 个主流黑盒攻击模型 ——TextFooler、BAE、BERT-Attack、CheckList。
- 攻击生成模型参数:T5-ParEvo 迭代 50 轮;对比模型使用官方默认参数;定义唯一攻击:单个原声明对应至少 1 个有效对抗样本(统一对比标准,因 T5-ParEvo 生成多个样本,对比模型仅生成 1 个)。
4.1.2 数据集
采用SCIFACT 数据集,做如下筛选:
- 剔除 SCV 工具无法给出分类结果(非 SUPPORT/REFUTE)的声明;
- 剔除 SCV 工具初始分类错误的声明,确保攻击样本暴露的是工具的真实弱点,而非初始分类误差。
4.1.3 评估维度
构建定量 + 定性双评估框架,定量从客观指标衡量攻击效果,定性由分子生物学领域专家人工评估,确保评估的科学性和全面性。
4.2 Quantitative Analysis 定量分析
设计 6 个核心定量指标,从语义保留、句法多样性、语法正确性、可读性四个维度评估,核心结果见 Table 2(VERISCI)、Table 3(MultiVerS/ARSJoint)、Table 4(可读性),
核心结论:T5-ParEvo 在所有维度均显著优于对比模型。


4.2.1 核心指标及结果
- 唯一攻击数(通过语义检查器):T5-ParEvo 的有效攻击数远高于对比模型(如 VERISCI:155 vs TextFooler88/BAE29/CheckList4),对比模型的大部分攻击样本因语义丢失未通过语义检查。
- 科学术语保留率:T5-ParEvo 为 100%,对比模型仅 61%-76%,无法有效保留科学术语。
- 双向蕴含保留率:T5-ParEvo 为 100%,对比模型中 CheckList90.77%、TextFooler78.83%,BAE 仅 38%,语义保留能力极差。
- N-gram 曼哈顿距离:T5-ParEvo 的单 / 双 / 三词距均为对比模型的 2 倍左右,说明生成的重述与原声明句法结构差异更大,修改更复杂。
- 平均语法错误数:T5-ParEvo 仅 0.35-0.39,对比模型 0.50-0.89,语法正确性更高。
- 可读性:采用 FRE、FKGL、Gunning-Fog、CLI 四个指标,T5-ParEvo 生成的样本可读性优于原 SCIFACT 声明,且与对比模型相当,未因句法复杂导致可读性下降。
4.2.2 定量分析核心结论
T5-ParEvo 能在严格保留语义和科学术语、保证语法正确和可读性的前提下,生成句法更复杂、多样化的对抗性重述,有效暴露 SCV 工具的弱点。
4.3 Qualitative Analysis 定性分析
由分子生物学领域专家对 VERISCI 的攻击样本做人工评估,分为成功攻击的接受度和失败攻击的拒绝原因两大维度,核心结果见 Table 5(成功指标)、Table 6(拒绝指标)、Table 7(示例)、Table 8(T5-ParEvo 攻击策略示例)。

4.3.1 成功攻击评估
- 有效接受率:T5-ParEvo 的成功攻击中,50% 以上被专家接受为有效(73/155),对比模型均低于 15%(TextFooler15/229、BAE9/242),大部分成功攻击为语义丢失的无效样本。
- 质量等级:T5-ParEvo 的高质量有效样本占 64.4%,BAE77.8%(但数量极少),其他模型均低于 53.3%。
- 攻击策略多样性:T5-ParEvo 是唯一采用多样化攻击策略的模型,包括:非科学词同义词替换(41.1%)、整句结构重组(11%)、整短语修改(46.6%)、增删词(各 8.2%)、数值转文字(4.1%)等;对比模型仅能做单字同义词替换,无其他策略。
- 低质量样本问题:T5-ParEvo 的低质量样本仅存在轻微语法错误(12.3%)或不当术语(1.4%),对比模型则普遍存在严重的科学术语错误和语法错误。

4.3.2 失败攻击评估
- 拒绝原因:对比模型的失败攻击主要因科学语义错误(84%-92.9%)和语法错误(48% for BERT-Attack);T5-ParEvo 的失败攻击主要因语义轻微改变(47.2%),科学 / 语法错误占比显著更低。
- 攻击策略缺陷:对比模型的失败攻击多为科学术语替换错误、反义词替换,导致语义反转;T5-ParEvo 的失败攻击为复杂句法修改导致的语义轻微偏差,无根本性错误。
4.3.3 定性分析核心结论
T5-ParEvo 生成的对抗性重述科学有效性高、攻击策略多样化,能真正暴露 SCV 工具的深层弱点;对比模型的攻击仅为简单词替换,易导致语义丢失 / 反转,为无效攻击。
4.4 附加实验:区分机器生成与人类生成声明
实验目的
验证 T5-ParEvo 生成的对抗样本是否自然、接近人类表达,避免因 “过度复杂 / 不自然” 导致攻击效果提升。
实验方法
构建 “人类生成声明(SCIFACT)+ 机器生成对抗样本” 的数据集,采用 MPNet 模型做 10 折交叉验证的二分类(区分机器 / 人类),评估分类准确率。
实验结果(Table 9)

所有模型的分类准确率均接近 50%(抛硬币概率),T5-ParEvo 为 52%,说明机器生成的对抗样本无法被预训练模型区分于人类生成声明,生成样本的自然度高。
结论
T5-ParEvo 的攻击效果提升并非因生成 “不自然” 样本,而是真正利用了 SCV 工具的语义理解弱点。
4.5 消融实验:模型组件的有效性
4.5.1 语义检查器 + T5 微调的有效性
对比有 / 无领域微调的 T5-ParEvo 效果:
- 无微调:仅生成 14 个唯一攻击、522 个候选样本;
- 有微调(SciTail 微调 NLI+SCIFACT 微调 T5):生成 155 个唯一攻击、3600 + 个候选样本。
结论:针对科学领域的微调是 T5-ParEvo 有效的核心,能大幅提升攻击生成能力和语义保留能力。
4.5.2 迭代进化过程的有效性(Figure 3/4)

随迭代轮次增加,T5-ParEvo 的唯一攻击数和候选样本数持续上升,说明迭代过程能让模型泛化攻击策略,从更多声明中学习 SCV 工具的弱点,持续提升攻击效果;若直接用预训练 T5 生成大量样本,效果仅等价于迭代 0 轮,无明显提升。
结论:迭代进化是 T5-ParEvo 生成多样化、高效攻击样本的关键。
4.6 补充实验:ChatGPT 的鲁棒性测试
实验方法
因 ChatGPT 无黑盒查询接口,采用混合攻击策略:将 T5-ParEvo 对 VERISCI 生成的有效攻击样本,用于测试 ChatGPT 的 SCV 任务表现。
实验结果
43.87% 的 VERISCI 有效攻击样本(68 个)能成功触发 ChatGPT 的分类错误,且所有样本均通过定量 + 定性的语义验证。
结论
ChatGPT 在 SCV 任务中存在与传统 SCV 工具相同的鲁棒性缺陷:无法有效识别语义等价但表述不同的科学声明,其零样本 SCV 能力的鲁棒性亟待提升。
实验结论与论文核心观点 / 贡献
实验整体结论
- T5-ParEvo 是针对 SCV 工具的高效黑盒对抗性攻击生成模型,相比现有主流攻击模型,能在严格保留原声明语义、科学术语和可读性的前提下,生成句法更复杂、策略更多样的对抗性重述,有效暴露 SCV 工具的深层弱点。
- 现有顶级 SCV 工具(VERISCI、MultiVerS、ARSJoint)和零样本 ChatGPT 均存在核心鲁棒性缺陷:对语义等价但表述不同的科学声明,易出现分类错误,该缺陷无法被现有简单攻击模型发现。
- 针对科学领域的模型微调和迭代进化策略是提升对抗性攻击生成效果的关键,语义检查器能有效筛选出真正的有效攻击样本,排除语义丢失的无效样本。
论文核心观点
自动科学声明验证(SCV)工具是对抗科学虚假信息的关键,但现有工具的鲁棒性被严重低估;通用 NLP 对抗性攻击模型因无法适配科学语言的特性,无法有效评估 SCV 工具的鲁棒性;需针对 SCV 任务设计专用的对抗性攻击生成模型,通过生成语义等价的复杂对抗样本,发现并修复 SCV 工具的弱点,提升其实际应用中的可靠性。
论文四大核心贡献
- 提出 T5-ParEvo 模型:首个针对 SCV 工具的迭代进化式黑盒对抗性攻击生成模型,能生成语义保留、复杂多样的对抗性重述,显著优于现有通用 NLP 攻击模型。
- 构建 SCV 攻击评估框架:提出一套定量 + 定性的全面评估框架(含 6 个定量指标、领域专家人工定性评估),为后续 SCV 工具对抗性攻击的研究提供统一、科学的评估标准。
- 全面评估主流 SCV 工具的鲁棒性:系统测试了 VERISCI、MultiVerS、ARSJoint 三大 SCV 工具的鲁棒性,发现其核心缺陷;同时首次验证了 ChatGPT 在 SCV 任务中的鲁棒性问题,为 SCV 工具的优化提供方向。
- 消融实验验证模型组件有效性:明确了 T5-ParEvo 中领域微调、迭代进化、语义检查器三大核心组件的必要性和有效性,为后续相关模型的设计提供了理论和实验依据。
未来研究方向
- 将 T5-ParEvo 生成的对抗性重述加入 SCV 工具的训练集,通过对抗训练提升 SCV 工具的鲁棒性;
- 优化 T5-ParEvo 的攻击策略,针对更专业的科学领域(如生物、物理、医学)做精细化适配;
- 研究 ChatGPT 等大语言模型在 SCV 任务中的鲁棒性提升方法,如思维链提示、领域微调等。

浙公网安备 33010602011771号