FaceForensics++ 数据集介绍与下载
国内网盘下载链接:
链接:
1. 数据集概览
FaceForensics++ 是目前学术界和工业界最广泛使用的面部伪造检测(Deepfake Detection)基准数据集之一。它由德国慕尼黑工业大学、意大利那不勒斯腓特烈二世大学等机构的研究者共同构建,相关论文发表于 ICCV 2019(国际计算机视觉顶级会议)。
该数据集的核心价值在于,它提供了一个标准化、大规模的测评平台,用以衡量不同伪造检测算法的性能。在此之前,相关研究常因数据集规模小、伪造方法单一而难以公平比较,FaceForensics++ 的出现改变了这一局面。
2. 数据规模与构成
FaceForensics++ 包含了从 977 个 YouTube 视频中精选出的 1000 段原始(真实)视频序列,总计超过 150 万帧图像,原始数据量超过 1.5 TB。这些视频均以正面、无遮挡的人脸为主,以确保自动化篡改方法能够生成逼真的伪造效果。
在这 1000 段原始视频的基础上,研究者利用 四种不同的自动化人脸篡改方法生成了对应的伪造视频,构成了完整的 FaceForensics++ 数据集:
| 篡改方法 | 类型 | 简要描述 |
|---|---|---|
| Deepfakes | 深度学习(换脸) | 基于自编码器,将源人脸替换到目标人脸上。 |
| Face2Face | 计算机图形学(表情重演) | 将一个人的面部表情实时迁移到另一个人的脸上。 |
| FaceSwap | 计算机图形学(换脸) | 基于3D模型和面部特征点进行面部交换。 |
| NeuralTextures | 深度学习(属性编辑) | 利用神经纹理渲染技术修改面部属性或表情。 |
注:后续版本和部分衍生工作中也包含了 FaceShifter 等其他方法的伪造视频。
为了模拟真实世界中的视频压缩情况,数据集中的视频被处理为 三种质量等级:
-
Raw(原始):未经压缩的输出视频。
-
HQ(高质量,c23):使用 H.264 编码,压缩参数为 23。
-
LQ(低质量,c40):使用 H.264 编码,压缩参数为 40。
3. 数据格式与目录结构
FaceForensics++ 数据集的典型目录结构如下(参考自 DeepfakeBench 等工具库的规范):
text
FaceForensics++
├── original_sequences # 原始真实视频
│ └── youtube # 来源:YouTube
│ ├── c23 # 高质量 (HQ)
│ │ └── videos # 存放 .mp4 视频文件
│ └── c40 # 低质量 (LQ)
│ └── videos
└── manipulated_sequences # 伪造视频
├── Deepfakes
│ ├── c23
│ │ └── videos
│ └── c40
│ └── videos
├── Face2Face
│ └── ... (同上)
├── FaceSwap
│ └── ... (同上)
└── NeuralTextures
└── ... (同上)
此外,部分经过预处理的版本还会提供 帧图片(frames)、人脸掩码(masks) 和 面部关键点(landmarks) 数据,方便进行图像分类或分割任务。
4. 学术价值与应用场景
FaceForensics++ 之所以成为领域标杆,主要归功于以下几点:
-
规模空前:其包含的伪造视频数量远超同期其他数据集,为训练深度神经网络提供了充足的数据。
-
方法多样:涵盖了当时最主流的几类人脸篡改技术,使得在该数据集上训练的检测器具有更好的泛化能力。
-
贴近现实:视频来源于真实的 YouTube 内容,并考虑了压缩率的影响,使得测评结果更具实际参考意义。
基于该数据集,研究者发现,在原始视频上训练得到的 XceptionNet 模型,其检测准确率可达 99% 以上;即使在低质量视频上,准确率也能保持在 86% 左右,显著超越了人类肉眼的识别能力。
5. 获取方式与引用
官方获取方式通常需要填写并发送数据使用协议至指定邮箱(faceforensics@googlegroups.com),审核通过后会提供下载链接。为方便国内研究者,本文开头已附上国内网盘下载链接(数据来源:
如果你在研究中使用了 FaceForensics++ 数据集,请引用以下论文:
text
@InProceedings{Rossler_2019_ICCV,
author = {Rossler, Andreas and Cozzolino, Davide and Verdoliva, Luisa and Riess, Christian and Thies, Justus and Niessner, Matthias},
title = {FaceForensics++: Learning to Detect Manipulated Facial Images},
booktitle = {Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)},
month = {October},
year = {2019}
}
浙公网安备 33010602011771号