数据脱敏技术-知识点整理

数据脱敏技术 - 全面知识点讲解

原文作者:iconic(公众号"数据安全")

文章共分五大板块:概念、类别、识别策略、脱敏方法、脱敏产品。下面逐一从"通俗理解"和"专业解析"两个角度进行讲解。


一、数据脱敏的概念

通俗理解

想象你的身份证号、手机号、银行卡号这些"机密信息"要交给别人用(比如做测试、做分析),但你又不想让人知道真实内容。数据脱敏就是给这些敏感信息"化妆"或"戴面具",让它看起来还像那么回事(格式对、长度对),但内容已经不是真的了。比如手机号 138****5678,你知道它是个手机号,但猜不出真实号码。

专业解析

数据脱敏(Data Masking) 是指通过屏蔽、仿真、变形等技术手段,对数据中的敏感信息进行处理,使其在保留数据可用性的同时,消除或降低隐私泄露风险。

核心遵循 五项原则

原则 通俗说法 专业含义
有效性 脱完之后确实看不出原来的信息 脱敏后数据中不能直接提取敏感信息,或还原成本远高于数据本身价值
真实性 脱完之后数据"看起来还像真的" 保持原始数据的格式、类型、依存关系、统计分布特征、唯一性
高效性 脱敏过程能自动化批量跑 在效率与时间成本、经济成本之间取得平衡,支持程序化、可重复操作
一致性 同一个数据每次脱出来结果一样 同一脱敏系统对相同输入的脱敏输出具有幂等性(deterministic)
合规性 整个过程合法合规 符合国家法律法规和标准规范,脱敏系统具备相关资质

脱敏流程三步走

  1. 识别敏感信息 - 找出哪些字段是敏感的
  2. 处理敏感信息 - 用特定方法改写
  3. 检查脱敏效果 - 验证是否满足五项原则

脱敏 vs 匿名化 vs 去标识化

这三个概念经常被混淆,文章做了清晰区分:

维度 数据脱敏 数据匿名化 数据去标识化
通俗说法 给数据化妆 彻底整容,不可逆 摘掉名牌,但DNA还在
是否可逆 视方法而定 不可逆 有条件可识别
适用对象 各种数据(数据库、音视频等) 个人敏感数据 个人敏感数据
适用领域 技术领域 技术+法律+公众 技术+法律+公众

二、数据脱敏的类别

通俗理解

数据有两种"体型":整齐的(像Excel表格,一行一行、一列一列的)和乱的(像一张照片、一段视频、一篇病历文档)。脱敏方式要因"体型"而异。

2.1 结构化数据脱敏

结构化数据 就是以二维表(行+列)组织的数据,如关系数据库中的表。每行=一个实体,每列=一个属性。

脱敏对象涵盖:Oracle、SQL Server、MySQL、PostgreSQL、MongoDB,以及国产的达梦、人大金仓、GBase、巨杉等。

按脱敏模式分为 两大类

(1) 静态数据脱敏(Static Data Masking)

维度 内容
通俗说法 把数据"复印一份",在复印件上涂改,原件不动
技术路线 ETL流程:从源库抽取(Extract) -> 变形(Transform) -> 加载(Load)到目标库
应用场景 开发测试、培训、数据分析、数据交易
核心特征 "搬移并仿真替换",脱敏数据与生产环境物理隔离

(2) 动态数据脱敏(Dynamic Data Masking)

维度 内容
通俗说法 不搬数据,在你查看的那一刻"实时打码"
技术路线 通过SQL解析,拦截包含敏感字段的查询语句,用函数运算实时替换返回结果
应用场景 数据库使用人员、运维人员的日常操作
核心特征 "边脱敏,边使用";基于角色和身份实施不同级别的脱敏策略;运维人员只能维护表结构,无权查看真实数据

(3) 结构化文本脱敏

针对 txt、csv、xls、xml、dbf、dmp 等文件,设置脱敏规则后输入文件,用加密、替换、偏移等技术处理后输出结果。本质上类似静态脱敏。

2.2 非结构化数据脱敏

非结构化数据就是没有固定表格格式的数据。分三种:

类型 通俗说法 技术手段 典型场景
图像脱敏 给照片"打马赛克"或把上面的文字抹掉 AI深度学习、差分隐私;去标识、遮罩、添加噪声 医疗影像中患者姓名等个人信息
视频脱敏 视频是连续的图片,逐帧"打码" 同图像脱敏,对每一帧处理 智能安防中人脸隐私保护
文本脱敏 从文档中把敏感名字、号码抹掉 AI(NER命名实体识别)、差分隐私 电子病历中患者个人信息

三、敏感数据识别策略

通俗理解

脱敏之前,得先知道"什么东西需要脱"。这就像打扫卫生之前先找到脏东西在哪里。

专业解析

敏感数据识别 是用脱敏软件自动发现数据中的敏感信息。有两个作用:

  1. 让你知道有哪些敏感信息以及它们在哪里
  2. 为后续脱敏提供操作指引

敏感数据源的四种类型

  • 数据库 - 各类关系型/非关系型数据库
  • 文件 - 结构化或非结构化文档
  • 大数据平台 - Hive、HBase、Teradata等
  • 动态数据流 - API接口、消息队列、网络流量等

三种识别策略

策略 通俗说法 专业含义
全量识别 地毯式搜索,一个不漏 扫描所有数据库表、文件、数据流
抽样识别 抽查一部分 选取部分表或文件夹进行检查
增量识别 只查新来的 仅扫描新建的表、新接收的数据流

识别方法通常包括:按字段名识别(如字段名包含"身份证"、"phone")、按字段内容正则匹配识别(如符合18位身份证号格式)。


四、数据脱敏方法

这是文章的核心部分,分为 经典方法新型方法

4.1 经典脱敏方法

(1) 泛化类方法 - "让数据变模糊"

方法 通俗说法 举例
截断 砍掉一部分,只留关键信息 手机号只保留前3位:138
取整 四舍五入,不要那么精确 时间精确到10分钟;工资取整到十元
归类 不说具体数字,说"档次" 工资分为高/中/低,而非具体金额

(2) 抑制方法 - "用星号挡住"

保持数据长度不变,把部分或全部内容替换为 *?

例:手机号 134****5678

(3) 扰乱类方法 - "把数据搅乱"

方法 通俗说法 专业特征
加密 用密码锁把数据锁起来 使用加密算法(如AES)将明文转为密文,可逆(有密钥可解密),安全性依赖算法强度
散列/哈希 把数据放进"绞肉机",出来后变了样且不能还原 使用哈希函数(如SHA-256)生成固定长度摘要,不可逆,相同输入总是产生相同输出
混淆/洗牌 把一组数据像扑克牌一样打乱顺序 打乱记录间某字段值的顺序(Shuffling),数据值不变但归属关系被破坏

(4) 仿真方法 - "造一套假但像真的数据"

生成一套格式、结构、统计特征都与真实数据高度相似的 全新数据集

例:姓名脱敏后还是像人名,身份证号脱敏后还是18位且格式正确。实现方式是从姓氏库和名字库中随机组合。

4.2 新型脱敏方法(进阶)

这部分涉及隐私保护的前沿理论:

(1) K-匿名化(K-Anonymity)

维度 内容
通俗理解 确保每条记录"至少有K-1个替身",让人分不清是谁
专业定义 对准标识符(Quasi-Identifier,如邮编、年龄)进行泛化/抑制,使数据集中每条记录至少与其他K-1条在准标识符上不可区分
局限 如果等价类中敏感属性值相同,攻击者仍可推断(即同质性攻击)

(2) L-多样化(L-Diversity)

维度 内容
通俗理解 在K-匿名的基础上,每组"替身"里的秘密信息要 至少有L种不同的
专业定义 每个等价类中敏感属性至少有L个"良好表示"的值,攻击者推断某条记录敏感值的概率不超过1/L
解决的问题 弥补K-匿名的同质性攻击漏洞

(3) T-接近性(T-Closeness)

维度 内容
通俗理解 每个小组的敏感信息分布和整体分布"不能差太远",差距不超过阈值T
专业定义 等价类中敏感属性的分布与全局分布之间的距离(通常用EMD,Earth Mover's Distance)不超过阈值T
解决的问题 弥补L-多样化中"知道分布即可推断"的偏度攻击

举例(学校食堂场景):全校60%爱甜食、40%爱咸食。子集C(55%/45%)差距5% < 20%,满足。子集D(80%/20%)差距20% = T,刚好满足。

(4) ε-差分隐私(ε-Differential Privacy)

维度 内容
通俗理解 数据库多一条或少一条记录,查询结果几乎没变化,所以"你在不在里面都看不出来"
专业定义 对于仅相差一条记录的两个数据集D和D',随机化算法A在两者上产出相同结果的概率之比不超过e^ε。ε越小,隐私保护越强
核心机制 通过向查询结果中注入校准过的随机噪声(如Laplace机制)实现
优势 提供了严格的数学隐私保证,是目前隐私保护的"金标准"理论框架

五、数据脱敏产品与部署

通俗理解

脱敏不是纯理论,最终要落地到产品和架构上。文章介绍了脱敏产品的整体架构和两种部署模式。

专业解析

脱敏架构四要素

  • 脱敏数据源:数据库、文件、大数据平台、动态数据流
  • 脱敏过程:识别 -> 规则配置 -> 执行脱敏
  • 脱敏目标:数据文件或大数据集
  • 应用场景:开发、测试、培训、数据交易、分析

两种部署模式

模式 静态脱敏部署 动态脱敏部署
通俗比喻 旁路部署的"侧门" 反向代理的"中间人"
工作流 从源库复制 -> 脱敏处理 -> 写入新库 拦截查询请求 -> 实时脱敏 -> 返回脱敏结果
与生产库关系 物理隔离 在线,不离开生产环境
关键步骤 ETL三步(抽取、变形、加载) 身份识别 -> 规则制定 -> SQL解析 -> 结果改写

实战案例:证券公司

文章提到了一个证券公司的实际脱敏需求:

  • 脱敏对象:个人投资者、机构投资者
  • 脱敏源库:个人基础信息库、资产信息库、交易流水库等
  • 脱敏要求:保持字段间关联关系、格式类型一致、统计聚合特征相同、数据唯一性和可读性

知识点速查表

编号 知识点 一句话记忆
1 数据脱敏定义 给敏感数据"化妆",看得见但认不出
2 五项原则 有效、真实、高效、一致、合规
3 三步流程 识别 -> 处理 -> 检查
4 静态脱敏 "复印件涂改",ETL流程,离线物理隔离
5 动态脱敏 "实时打码",SQL拦截,在线不离生产
6 泛化(截断/取整/归类) 让数据变模糊
7 抑制 *** 遮住
8 加密 上锁,有钥匙能解
9 哈希 绞肉机,不可逆
10 混淆/洗牌 打乱顺序
11 仿真 造假数据但格式逼真
12 K-匿名化 至少K个替身
13 L-多样化 替身组内秘密至少L种
14 T-接近性 小组分布和整体分布差距 < T
15 ε-差分隐私 多你少你结果都差不多
posted @ 2026-09-04 23:23  Awananhh  阅读(6)  评论(0)    收藏  举报