Generative Montage Framework (生成蒙太奇框架) Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

 

一、论文基础信息

  1. 标题:Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage(借真行谎:基于生成蒙太奇的开放通道多智能体合谋信念操纵)
  1. 作者:Jinwei Hu、Xinmiao Huang、Youcheng Sun、Yi Dong、Xiaowei Huang
  1. 作者单位:英国利物浦大学(1)、阿联酋穆罕默德・本・扎耶德人工智能大学(2)
  1. 来源:arXiv 预印本(arXiv:2601.01685v1 [cs.CL])
  1. 发布时间:2026 年 1 月 4 日

二、研究背景与问题

(一)研究动机(现有研究不足)

  1. 大语言模型(LLMs)向自主智能体演进,具备复杂推理和信息合成能力,但继承了追求叙事连贯性的认知脆弱性,会对碎片化输入过度解读,在独立事实间构建虚假因果关系,且推理能力越强,该脆弱性越显著。
  1. 现有多智能体系统(MAS)的合谋研究聚焦通道中心型合谋,依赖隐蔽通道、后门或隐写术传递恶意载荷,却忽视了 LLMs 的认知漏洞带来的认知中心型合谋威胁 —— 攻击者可通过公共通道发布真实但碎片化的证据,利用 LLMs 的过度思考诱导其形成虚假信念,且这种 “借真行谎” 的方式能规避传统内容过滤类安全护栏。
  1. 动态信息环境(如社交平台自主机器人)中,智能体对即时、连贯分析的需求进一步放大了上述认知脆弱性,易导致虚假信念的内化与传播,且这类由真实碎片错误合成的谣言传播速度快于虚假信息本身。

(二)研究问题

如何通过公共通道的真实证据碎片,实现多智能体协同的认知合谋攻击,让目标 LLM 智能体在不接触任何虚假信息的前提下,内化虚假假设并将其传播至下游决策环节,即解决 “局部真实的证据如何诱导全局虚假的结论” 这一核心问题。

(三)Problem Formulation 

该小节从理论层面形式化定义了认知合谋攻击的核心概念、概率模型和问题目标,分为 3 个子部分:

3.1 Preliminaries(预备知识)

  1. 证据与信念空间
    • 信息环境建模为有限原子证据碎片集合\(E=\{e_1,e_2,...,e_n\}\),每个碎片\(e_i\)真实且带有发布时间戳\(t_i\in\mathbb{R}^+\);
    • 世界解释集合为\(H\),智能体\(a_i\)的信念空间\(H^{a_i}\in H\)是通过连贯叙事关联证据的候选解释子集,可划分为真实因果假设\(H_r\)和虚假因果假设\(H_f\),二者不相交且并集为\(H^{a_i}\)。
  1. 因果图表示
    • 每个假设对应有向因果图\(G=(V,E)\),\(V\)为事件节点,\(E\)为有向因果边;
    • 真实状态为\(G^*=(V,E_{real})\)(仅含真实因果依赖),虚假状态为\(\hat{G}=(V,\hat{E})\),其中\(\hat{E}=E_{real}\cup E_{false}\),\(E_{false}\)为虚假因果边,\(E_{false}\neq\emptyset\)时即形成虚假叙事。

3.2 Probabilistic Vulnerability Modeling(概率脆弱性建模)

  1. 将 LLM 智能体的信念更新抽象为近似贝叶斯推理,给定证据集\(\mathcal{E}\),虚假假设\(H_f\)的后验信念为:\(P(H|\mathcal{E}) \propto P(\mathcal{E}|H) \cdot P(H)\),其中\(P(H)\)为智能体对假设的先验信念,\(P(\mathcal{E}|H)\)为证据支持假设的感知似然。
  1. 认知合谋攻击的核心目标:重塑感知似然函数,使虚假假设\(H_f\)的后验概率高于对应的真实假设\(H_r\),且不引入任何虚假证据

3.3 The Cognitive Collusion Problem(认知合谋问题)

通过分离局部事实有效性全局认知欺骗,形式化定义核心概念与研究问题:
  1. 定义 1(局部真实约束 Local Truth, LT):证据碎片\(e_i\)满足 LT 当且仅当与真实状态\(G^*\)完全一致,即\(LT(e_i)=1 \Leftrightarrow P(e_i|G^*)=1\),确保攻击所用证据均单独可验证、真实无误
  1. 定义 2(全局谎言条件 Global Lie, GL):证据集\(\mathcal{E}\)满足 GL 当且仅当能诱导智能体对虚假假设\(H_f\)的信念强于真实假设\(H_r\),即\(GL(\mathcal{E},H_f)=1 \Leftrightarrow P(H_f|\mathcal{E})>P(H_r|\mathcal{E})\),实现 “局部真→全局假” 的欺骗。
  1. 问题 1(认知合谋攻击):给定目标虚假假设\(H_f\)和真实证据池\(\mathcal{E}\),构造最优证据流(有序序列)\(\vec{S}^*\),在满足局部真实约束的前提下,最大化目标智能体对\(H_f\)的后验信念,且满足全局谎言条件,数学表达式为:
\(\vec{S}^*=\underset{\vec{S} \subseteq \mathcal{E}}{arg max } P\left(H_{f} | \vec{S}\right) \quad s.t. \quad \forall e \in \vec{S}, LT(e)=1; GL\left(\vec{S}, H_{f}\right)=1\)
  1. 定义 3(合谋者 Colluder):最大化智能体对虚假假设\(H_f\)信念的智能体\(a_i\),即\(max _{\mathcal{E}_{a_i} \in \mathcal{E}} P\left(H_{f} | \mathcal{E}_{a_i}\right)\);分为显式合谋者故意优化欺骗目标)和隐式合谋者无意传播受污染的信念,成为欺骗放大器)。

三、Methods

image

该小节提出生成蒙太奇(Generative Montage) 多智能体框架,是解决认知合谋问题的核心方法,通过显式合谋的多智能体协同构建对抗性叙事,再利用隐式合谋实现虚假信念的传播与级联,分为 2 个子部分:

4.1 Explicit Collusion(显式合谋)

显式合谋者由Writer(作者)、Editor(编辑)、Director(导演) 三个攻击智能体和Publisher(发布者) 组成,核心是通过对抗性辩论构建满足 LT 约束且实现 GL 条件的最优证据序列,并通过去中心化方式发布,分为 2 个子模块:

4.1.1 Adversarial Narrative Production(对抗性叙事生成)

三个核心智能体协同完成叙事合成、序列优化和有效性验证,目标是解决问题 1,将虚假因果结构\(\hat{G}\)转化为真实证据的时间有序序列,核心依托 LLM 对抗性辩论(优势:捕捉叙事连贯性、解耦任务降低推理负担、模拟目标智能体解读过程)。
  1. Writer(\(A_W\),作者):叙事合成
    • 核心作用:将欺骗锚定在真实证据上,从证据池\(E_{pool}\)中合成连贯的叙事草稿\(\mathcal{N}\),无显式伪造,仅通过语境模糊化(语言歧义、泛化)填补真实与虚假假设的逻辑间隙。
    • 形式化目标:带约束的生成任务,在满足\(P(\mathcal{N}|G^*)=1\)(局部真实)的前提下,最大化目标谎言的语义后验概率比,即\(\mathcal{N}^*=\underset{\mathcal{N} \sim \mathcal{E}_{pool },P(\mathcal{N} | G^*)=1}{argmax}\left(\frac{P\left(H_{f} | \mathcal{N}\right)}{P\left(H_{r} | \mathcal{N}\right)}\right)\),实现 “事实正确但语义偏向虚假结论”。
  1. Editor(\(A_E\),编辑):蒙太奇序列排序
    • 核心作用:将连贯叙事\(\mathcal{N}\)解耦为离散语义片段,重新组装为有序序列\(\vec{S}=\{(p_i,t_i)\}\),通过策略性并置引入隐含的因果暗示,触发目标智能体的叙事过拟合
    • 形式化目标:寻找最优排列,最大化虚假因果边\(E_{false}\)的累积概率,即\(\vec{S}^*=\underset{\vec{S} \in \Pi(\mathcal{N})}{argmax} \sum_{\left(p_i, p_j\right) \in E_{fake }} P\left(p_i \to p_j | \vec{S}\right)\)(\(\Pi(\mathcal{N})\)为叙事的有效逻辑排列空间),类比电影蒙太奇通过画面并置创造意义,让目标智能体从碎片中推断出不存在的因果关系。
  1. Director(\(A_D\),导演):对抗性辩论
    • 核心作用:作为目标智能体的代理,主导双循环优化(Writer-Director 循环、Editor-Director 循环),验证中间输出(叙事\(\mathcal{N}\)、序列\(\vec{S}\))的事实完整性和欺骗有效性。
    • 实现方式:三状态门控函数\(\delta(\mathcal{O})\)(\(\mathcal{O}\in\{\mathcal{N},\vec{S}\}\)为中间输出),决策规则为:
\(\delta(\mathcal{O})=\left\{\begin{array}{ll} ACCEPT & if \hat{P}\left(H_{f} | \mathcal{O}\right) >\tau \ and \ \forall e \in \mathcal{O}, LT(e)=1 \\ REJECT & if \exists e \in \mathcal{O}, LT(e) \neq 1 \\ REVISE & otherwise, generating critique \mathcal{C}\end{array} \right.\)
其中\(\hat{P}(H_f|O)\)为导演对输出诱导虚假假设的信念评分,\(\tau\)为接受阈值;REVISE 状态会生成自然语言批评意见\(\mathcal{C}\),指导 Writer/Editor 迭代优化,直至输出满足 GL 条件。

4.1.2 Decentralized Injection via Publisher(通过发布者的去中心化注入

  1. 核心作用:将导演批准的最优证据序列\(\vec{S}\)发布到公共信息环境,触发目标智能体的信念更新。
  1. 实现方式:采用分布式注入协议,通过多个 Sybil 机器人账号(发布者网络\(B=\{b_1,...,b_m\}\))去中心化发布,定义映射函数\(\Phi\)将每个碎片\(p_i\)分配给不同机器人\(b_k\),即\(\mathcal{P}_{pub }=\Phi(\vec{S}, \mathcal{B})=\left\{\left(p_i, t_i, b_{\pi(i)}\right)\right\}_{i=1}^{|\vec{S}|}\)(\(\pi(i)\)为分配策略,如随机轮询),确保证据按设计的时间序列出现在目标智能体的可观测信息流中。

4.2 Implicit Collusion(隐式合谋)

隐式合谋者为原本良性的目标智能体(受害者)下游决策智能体 / 人类,核心是利用目标智能体的过度思考诱导其内化虚假信念,并通过信念传递实现虚假信息的级联传播,分为 2 个子模块:

4.2.1 Cognitive Steering via "Overthinking"(通过 “过度思考” 的认知引导)

  1. 核心机制:去中心化的攻击证据流\(\mathcal{P}_{pub}\)与正常信息\(\mathcal{F}_{normal}\)融合为统一语义环境\(\mathcal{F}=\mathcal{P}_{pub} \cup \mathcal{F}_{normal}\),触发目标智能体的叙事过拟合—— 智能体并非被动处理证据,而是主动解决信息张力,构建连贯解释。
  1. 结果:对抗性序列操纵了似然函数分布,使虚假假设\(H_f\)成为最合理的解释,即\(H_f \approx \underset{H}{argmax} P_{\mathcal{M}}(H | \mathcal{F})\)(\(\mathcal{M}\)为目标智能体),让目标智能体将被迫的推理误认为 “自主推导的真相”,实现信念内化。

4.2.2 Cascade Effect via Implicit Collusion(通过隐式合谋的级联效应)

  1. 信念传递:目标智能体内化虚假信念后,会将错误结论\(\hat{H}_{vic}\)发布到公共通道,被下游决策智能体\(A_{down}\)接收,下游智能体基于多个受害者的 “可信输出” 更新信念,而非原始证据。
  1. 信任放大效应:下游智能体对\(H_f\)的信念远高于直接基于原始证据的信念,即\(P_{\mathcal{A}_{down }}\left(H_{f} |\left\{\hat{H}_{vic }^{(i)}\right\}_{i=1}^{K}\right) \gg P_{\mathcal{A}_{down }}\left(H_{f} | \vec{S}\right)\)(\(K\)为受害者数量)。
  1. 全局信念收敛:随着更多受害者成为隐式合谋者,全球信息环境\(\mathcal{I}_{global}=\mathcal{P}_{pub} \cup \cup _{i=1}^{K}{\hat{H}_{vic }^{(i)}} \cup \mathcal{F}_{normal}\)会向\(H_f\)收敛,即\(lim _{t \to \infty} P\left(H_{f} | \mathcal{I}_{global }\right) \to 1\),虚假信息通过 “独立分析验证” 完成洗白,形成级联传播。

四、Experiment 

实验核心目标:验证生成蒙太奇框架的认知合谋攻击有效性,分析 LLM 智能体的脆弱性规律、下游决策环节的级联效应,并通过消融实验验证框架各组件的必要性,分为数据集、实验设置、实验内容与结果、实验结论四部分,同时明确论文核心贡献。

(一)数据集:CoPHEME

  1. 基础来源:基于 PHEME 数据集(Zubiaga et al., 2016)扩展,PHEME 包含真实世界谣言事件的社交平台对话线程。
  1. 数据集构建原则:解耦真实证据虚假假设,适配 “借真行谎” 的攻击范式,剔除数据量不足的 3 个事件(gurlitt、prince-toronto、ebola-essien),最终保留 6 个谣言事件。
  1. 数据集划分
    • 证据池\(E_{pool}\):标注为 “真实” 或 “非谣言” 的推文,满足 LT 约束,作为合谋者的真实素材,共 4950 条;
    • 目标虚假假设\(H_f\):来自 “虚假” 和 “未验证” 的谣言,按历史传播规模筛选并语义去重,聚焦高影响、非冗余的叙事,共 1090 个。
  1. 数据集统计:6 个事件涵盖突发新闻、人质事件、社会动荡、恐怖袭击、灾难、政治事件,平均传播规模 12.9,具体统计如下:

(二)Baselines 与实验设置

  1. 实验模拟框架:构建贴近真实的社交媒体生态,包含三个核心角色:
    • 合谋组:模拟机器人农场,通过多账号发布对抗性证据序列,制造虚假共识;
    • 受害者(LLM 分析师)中性 AI 助手,合成碎片化公共信息回答用户问题,选用14 个 LLM 家族作为受害者,分为专有模型(OpenAI GPT、Anthropic Claude)和开源模型(Alibaba Qwen、DeepSeek-R1);
    • 下游决策层:模拟事实核查机制,包含两种验证策略:
      • 多数投票(Majority Vote)5 个 LLM 分析师的共识,类比 Twitter 社区笔记;
      • AI 裁判(AI Judge)高能力 LLM(DeepSeek-R1-Distill-Qwen-14B),可访问原始证据和多个分析师输出,进行审计。
  1. 评估指标:共 5 个核心指标,量化认知合谋的严重程度,分为个体脆弱性指标全局级联指标
    • 攻击成功率(ASR):受害者内化虚假假设的比例,核心指标;
    • 高置信度攻击成功率(HC-ASR):置信度≥0.8 的 ASR,衡量 “错误且自信” 的程度;
    • 平均置信度(Conf):受害者对判决的平均确定性评分(0-1);
    • 下游欺骗率(DDR):下游决策层接受虚假假设的比例,衡量级联效应;
    • 指标均基于贝叶斯推理的指示函数和求和公式计算,具体见论文 B.3 节。
  1. Baselines 相关:无传统基线模型,以不同 LLM 家族的基础版本 / 小模型无 CoT 提示的 LLM框架消融后的单智能体版本作为对比,验证攻击的有效性和框架组件的必要性。

(三)实验内容及其对应的实验结果

实验分为4 个核心部分,覆盖攻击有效性、推理能力的影响、下游级联效应、框架组件必要性,所有实验在 6 个谣言事件上完成,每个虚假假设实例化 5 个独立受害者以衡量信念形成的方差:

实验 1:攻击有效性与跨模型迁移性分析

  • 实验内容:测试生成蒙太奇框架在 14 个 LLM 家族上的 ASR、Conf、HC-ASR,对比专有模型与开源模型的脆弱性差异;

image

  • 实验结果
    1. 所有 LLM 均表现出普遍脆弱性,整体 ASR 超 70%,其中专有模型平均 ASR74.4%,开源模型 70.6%,说明攻击是模型无关的,无需白盒访问,利用了 LLM 的基础推理机制;
    1. 受害者普遍以高置信度内化虚假信念(多数模型 Conf≥0.8),存在 “认知过度自信且无操纵检测能力” 的失败模式;
    1. 专有模型中 Claude-3-Haiku 表现出最高脆弱性(ASR91.5%),开源模型中 DeepSeek-R1-Distill-Qwen-7B 最高(ASR79.2%)。

实验 2:推理能力对脆弱性的影响分析

  • 实验内容:对比推理增强型模型(如 DeepSeek-R1 系列)与基础 / 小模型的 ASR,以及Chain-of-Thought(CoT)提示对 ASR 的影响(以 Charlie Hebdo 事件为测试集);

image

  • 实验结果
    1. 反直觉规律:推理增强型模型的脆弱性显著高于基础 / 小模型,开源模型因侧重因果链构建且缺乏安全护栏,推理能力成为脆弱性放大器
    1. CoT 提示进一步提升 ASR:Qwen2.5-7B 加 CoT 后 ASR 从 67.8% 升至 70.9%(+3.1%),DS-R1-Distill-Qwen-7B 从 77.0% 升至 81.7%(+4.7%),证明高级推理能力在对抗性认知操纵下成为攻击面

实验 3:下游决策环节的级联效应分析

  • 实验内容:测试多数投票和 AI 裁判两种下游验证策略的 DDR,分析不同事件、不同 LLM 家族的 DDR 规律;

image

  • 实验结果
    1. 两种验证策略均高度脆弱,DDR 在所有模型家族和事件中均显著高于 50%,说明下游校正无法解决源端的对抗性证据污染;
    1. 事件规律:需要快速因果合成的事件(如突发新闻、人质事件)DDR 更高,复杂因果叙事的政治事件 DDR 较低但仍可观;
    1. AI 裁判相比多数投票仅有小幅改进,因受害者会为错误结论提供合理的理性论证,下游决策层会被这些 “可信的错误推理” 误导,受害者成为隐式合谋者。

实验 4:消融实验与证据序列长度分析

(1)框架组件消融实验(Charlie Hebdo 事件)
  • 实验内容:移除框架中 Director 的对抗性辩论Editor 的序列优化,或将多智能体协同简化为单智能体,测试 ASR 和 HC-ASR 的变化;
  • 实验结果(如下表):
image
    1. 对抗性辩论是最大化欺骗性的核心(ASR 下降 13.5%),序列优化显著放大操纵效果(ASR 下降 7.3%);
    1. 多智能体协同是攻击有效的关键,单智能体版本 ASR 暴跌 50.2%,证明对抗性专业化和协同优化是实现 “借真行谎” 的必要条件。
(2)证据序列长度影响分析(GPT-4.1-mini,Charlie Hebdo 事件)
  • 实验内容:将发布的证据碎片数量从 1 调整至 20,测试 ASR 和平均置信度的变化;

image

  • 实验结果
    1. ASR 与序列长度呈倒 U 型关系,在 11-15 个碎片时达到峰值(ASR79.0%);
    1. 稀疏序列(1-5 个):无法触发叙事过拟合,受害者因证据不足无法构建连贯虚假叙事;
    1. 过度序列(16-20 个):引发认知过载、语义稀释、矛盾出现,受害者退回到保守判断,ASR 下降。

(四)实验结论

  1. 生成蒙太奇框架实现了高效的认知合谋攻击,所有主流 LLM 均存在普遍的认知脆弱性,且攻击具有模型无关的迁移性;
  1. LLM 的推理能力与认知脆弱性正相关,推理增强型模型和 CoT 提示会放大操纵效果,成为对抗性攻击的薄弱环节;
  1. 下游事实核查机制无法有效缓解该威胁,虚假信念会通过隐式合谋的级联效应持续传播,受害者的 “高置信度错误推理” 会实现虚假信息的洗白;
  1. 生成蒙太奇的多智能体协同、对抗性辩论、序列优化是攻击有效的核心,单智能体无法实现高效欺骗,证据序列存在最优操纵区间(11-15 个碎片);
  1. “借真行谎” 的认知合谋攻击能规避传统内容过滤类安全护栏,是 LLM 智能体在动态信息环境中的核心社会技术脆弱性。

(五)论文核心观点 / 贡献

论文是首次系统研究 LLM 多智能体认知合谋攻击的工作,核心观点为:LLM 对叙事连贯性的追求使其推理能力成为认知操纵的攻击面,攻击者可通过公共通道的真实证据碎片,经多智能体协同的生成蒙太奇构建对抗性叙事,诱导 LLM 内化虚假信念并实现级联传播,且推理能力越强,脆弱性越显著
论文的四大核心贡献
  1. 识别并形式化定义了认知合谋攻击:首次刻画了 “独立无害的证据如何集体最大化对虚假假设的信念” 这一新型攻击,区分了局部真实约束和全局谎言条件,填补了现有合谋研究聚焦通道中心型的空白;
  1. 提出生成蒙太奇框架:首个用于自动化认知合谋的多智能体框架,通过 Writer-Editor-Director 的对抗性协同,在真实证据基础上构建对抗性叙事,实现开放通道的信念操纵;
  1. 构建 CoPHEME 数据集:适配 “借真行谎” 范式的谣言数据集,解耦真实证据与虚假假设,为认知合谋攻击的研究提供了标准化测试床;
  1. 开展大规模实验验证:在 14 个 LLM 家族、6 个真实谣言事件上完成实验,揭示了 LLM 推理能力与脆弱性的反直觉关系,证明了下游级联效应的严重性,为 AI 安全研究提供了关键实证证据。
posted @ 2026-03-03 20:58  卓然666  阅读(74)  评论(0)    收藏  举报
Live2D