2026年7月5日 · 深度技术分析
导语
2023 年,Meta AI 联合 Inria 和索邦大学提出了 Stable Signature——一种将不可见水印根植于扩散模型解码器中的技术。其设计目标很明确:让 AI 生成的每一张图片都携带一个可检测但不可见的"签名",从而追踪图片的来源,打击深度伪造。
然而,2024 年杜克大学的一篇论文 "Stable Signature is Unstable: Removing Image Watermark from Diffusion Models" 系统性地证明了该技术的脆弱性——攻击者仅需少量非水印图像,就能通过微调有效移除水印,同时保持图像质量。这场攻防博弈揭示了 AI 内容溯源领域的一个核心矛盾:技术方案在单张图像层面可能坚不可摧,但在模型层面却可能不堪一击。
一、Stable Signature 的技术原理
1.1 核心机制:微调解码器
Stable Signature 的创新在于不改变扩散模型的整体架构,也不修改扩散过程本身,而是仅对潜在扩散模型(LDM)的解码器(Decoder)进行快速微调。
具体流程:
- 预训练水印提取器:使用 HiDDeN 水印提取网络
- 解码器微调:将水印提取器与解码器结合训练,使解码器在从潜在向量(latent vector)重建图像时,自然地将二进制签名嵌入到像素分布中
- 零额外开销:水印是生成过程的固有属性,不需要后处理添加,对生成速度无影响
- 广泛兼容:由于只修改解码器,可与大多数基于 LDM 的生成方法(如 Stable Diffusion)兼容
1.2 检测流程
- 水印提取:使用预训练的水印提取器(CNN)从可疑图像中恢复隐藏的签名
- 统计测试:将提取出的签名与已知的 ground-truth 签名进行比对,通过统计测试判断图像是否来自特定的生成模型
1.3 准确率数据
- 图像被裁剪至仅保留 10% 内容时,误报率低于 10⁻⁶ 的情况下,检测准确率仍高达 90% 以上
- 对常见的图像变换(滤波、裁剪、压缩等)表现出较强的鲁棒性
二、"Unstable"的真相:模型级攻击
2.1 杜克大学的攻击方法
杜克大学的研究团队提出了一种无需访问编码器的攻击方法:
- 估计去噪后的潜在向量:从目标图像反推其在潜在空间中的表示
- 微调解码器:使用少量非水印图像作为攻击数据集,微调扩散模型的解码器
- 移除水印:微调后的解码器输出接近非水印图像,水印被成功移除
关键发现:即使攻击者没有访问编码器(encoder-agnostic),攻击依然有效。
2.2 与 Meta 原论文中的 MP 攻击对比
Meta 原论文提出了一种"模型净化"(Model Purification, MP)攻击来测试鲁棒性:
| 攻击方法 | 需要编码器 | 对图像质量的影响 |
|---|---|---|
| Meta MP 攻击 | 是 | 显著降低(模糊、细节丢失) |
| 杜克大学攻击 | 否 | 基本保持图像质量 |
杜克大学的攻击不仅更加实用(无需编码器),而且在移除水印的同时保持了更高的图像质量。
2.3 脆弱性的根因
Stable Signature 的安全性严重依赖提取器模型的保密性。一旦提取器泄露,攻击者可以利用白盒攻击精确移除水印。
但对于开源扩散模型,问题更加根本:
- 攻击者可以完全控制模型参数
- 任何根植于模型参数的水印机制都面临被"逆向微调"的风险
- Stable Signature 的设计虽然比后处理水印更适合开源场景,但并非不可破解
三、与现有 Deepfake 检测技术的对比
| 维度 | Stable Signature(生成时水印) | 传统 Deepfake 检测 |
|---|---|---|
| 检测时机 | 生成时嵌入(主动策略) | 生成后分析(被动策略) |
| 技术本质 | 修改生成模型参数 | 训练分类器检测伪影 |
| 对开源模型适用性 | 特别适合(水印根植于参数) | 对开源/闭源都适用 |
| 鲁棒性(单张图像处理) | 强(压缩、裁剪) | 弱(易受对抗样本攻击) |
| 鲁棒性(模型级攻击) | 弱(可被微调移除) | N/A |
| 瓶颈 | 提取器私密性依赖 | 数据漂移、生成技术迭代 |
核心矛盾:Stable Signature 在"单张图像处理"层面强,在"模型级攻击"层面弱;传统 deepfake 检测在"模型无关"层面强,在"对抗样本"层面弱。两者互为补充,而非替代关系。
四、隐私与伦理争议
4.1 未经同意的追踪
AI 生成图像中的隐形水印可在用户不知情的情况下嵌入,涉及"未经同意的数字标记"。批评者认为,如果没有明确披露嵌入的信息及其用途,就违反了知情同意原则。
4.2 匿名性威胁
水印可能包含或关联到生成者的身份信息,对使用 AI 工具的记者、举报人、活动家和艺术家构成风险。监管机构若强制要求水印,可能将"所有用户视为潜在违法者"。
4.3 监控滥用
隐形水印可被用于大规模内容追踪,存在被政府或企业用于监控言论的风险。研究机构和民间组织指出,水印、哈希或元数据追踪可能危及个人隐私和在线匿名性。
4.4 版权与创作者权利
水印技术也被视为平台保护知识产权和追踪内容来源的工具,但这也引发了关于 AI 训练数据中原作者权利归属的争议。
五、我的观点:水印不是银弹,但是有用的层
5.1 攻击与防御的不对称性
杜克大学的攻击揭示了一个基本事实:在开源模型场景下,任何根植于模型参数的水印都可以被移除。这不是 Stable Signature 的独有缺陷,而是所有类似方案的共性限制。
攻击与防御的不对称性在于:
- 防御者需要保护整个模型和提取器的机密性
- 攻击者只需要获取模型参数,就可以通过微调移除水印
5.2 多层防御的必要性
单一技术方案无法解决 AI 内容溯源问题。可行的路径是多层防御:
- 生成时水印(Stable Signature 类):快速、大规模检测
- 内容指纹( perceptual hashing 类):检测是否经过修改
- 元数据标准(C2PA 类):记录内容来源和编辑历史
- 传统 deepfake 检测:检测视觉伪影
- 人类审核:对高价值内容进行人工验证
5.3 开源 vs 闭源的水印策略差异
| 场景 | 水印策略 |
|---|---|
| 闭源 API(如 DALL-E、Midjourney) | 可在服务端嵌入强水印,用户无法移除 |
| 开源模型(如 Stable Diffusion) | 水印可被移除,需依赖社区自律和平台政策 |
| 企业部署 | 可定制水印方案,结合访问控制 |
Stable Signature 的真正价值可能不在于"防止水印被移除",而在于"提高移除成本"——即使攻击者可以移除水印,也需要额外的时间和计算资源。
5.4 给平台开发者的建议
- 不要依赖单一水印方案:将水印作为多层防御中的一层,而非唯一防线
- 保护提取器机密性:提取器模型的泄露是水印系统崩溃的关键风险点
- 透明化水印政策:向用户明确披露水印的存在、用途和检测方式
- 结合元数据标准:采用 C2PA 等开放标准,记录内容的完整来源链
- 持续评估攻击面: watermark 技术需要与攻击技术同步演进
免责声明
本文仅供技术研究和教育目的,内容基于 Meta AI 的 Stable Signature 论文、杜克大学的研究论文及公开技术报道。本文所有技术分析均以 AI 安全、内容溯源和行业分析为导向。本文不涉及任何用于非法移除水印的方法细节,也不鼓励未经授权修改他人模型的行为。读者应遵守所在国家/地区的法律法规,仅将本文内容用于合法合规的研究和学习用途。
参考资料
- Meta AI 等:(2023). Stable Signature: Rooting Watermarks in Latent Diffusion Models
- 杜克大学:(2024). Stable Signature is Unstable: Removing Image Watermark from Diffusion Models. arXiv:2405.07145
- 智源社区:Meta AI 稳定的签名技术介绍
浙公网安备 33010602011771号