【 10个概念 】

数据脱敏

数据脱敏:10个核心概念信息图

难易分类

简单概念

1 掩码

保留部分字符并隐藏其余字符的脱敏方法。

测试人员处理订单数据时,采用“138****5678”的方式降低识别精度。这个具体处理方法就是掩码。

把“掩码”和“加密”混为一谈。掩码的关键是“保留部分字符并隐藏其余字符的脱敏方法”;加密关注的是另一种对象、位置、作用或处理关系。

2 替换

使用虚构值、固定值或映射值替代真实数据。

测试人员处理订单数据时,采用“13900000000”的方式降低识别精度。这个具体处理方法就是替换。

把“替换”和“掩码”混为一谈。替换的关键是“使用虚构值、固定值或映射值替代真实数据”;掩码关注的是另一种对象、位置、作用或处理关系。

3 截断

删除敏感字段的一部分,仅保留业务所需内容。

测试人员处理订单数据时,采用“只保留地址中的省市”的方式降低识别精度。这个具体处理方法就是截断。

把“截断”和“删除”混为一谈。截断的关键是“删除敏感字段的一部分”;删除关注的是另一种对象、位置、作用或处理关系。

4 泛化

降低数据精度,如把具体年龄改为年龄区间。

测试人员处理订单数据时,采用“把31岁改成30—39岁”的方式降低识别精度。这个具体处理方法就是泛化。

把“泛化”和“随机扰动”混为一谈。泛化的关键是“降低数据精度”;随机扰动关注的是另一种对象、位置、作用或处理关系。

5 随机扰动

对数值加入一定随机变化,同时尽量保持统计特征。

测试人员处理订单数据时,采用“把统计值1000调整为998”的方式降低识别精度。这个具体处理方法就是随机扰动。

把“随机扰动”和“替换”混为一谈。随机扰动的关键是“对数值加入一定随机变化”;替换关注的是另一种对象、位置、作用或处理关系。

难懂概念

6 数据脱敏

通过掩码、替换、截断、泛化或扰动降低敏感数据的可识别性。

哪些敏感字段需要降低可识别性,应选择什么方法,处理后还能否满足业务用途?

单表无法识别个人,与外部数据关联后身份完全暴露

测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:数据脱敏的效果取决于可关联数据、使用环境和复原可能性。

7 静态脱敏

对数据副本预先处理后用于测试、分析或共享。

提供给测试、分析或共享的数据副本是否已提前完成脱敏,并与真实生产数据隔离?

单表无法识别个人,与外部数据关联后身份完全暴露

测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:静态脱敏的效果取决于可关联数据、使用环境和复原可能性。

8 动态脱敏

根据访问者身份和角色,在查询或展示时实时隐藏敏感字段。

不同身份和角色查询同一份数据时,系统应当实时显示哪些内容、隐藏哪些字段?

单表无法识别个人,与外部数据关联后身份完全暴露

测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:动态脱敏的效果取决于可关联数据、使用环境和复原可能性。

9 去标识化

使个人信息在不借助额外信息时难以识别特定个人。

删除直接身份信息后,接收者在缺少额外对应表时是否仍能识别具体个人?

单表无法识别个人,与外部数据关联后身份完全暴露

测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:去标识化的效果取决于可关联数据、使用环境和复原可能性。

10 匿名化

处理后无法识别特定个人且不能复原。

处理后的数据是否在任何合理条件下都无法识别特定个人,并且无法恢复原身份?

单表无法识别个人,与外部数据关联后身份完全暴露

测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:匿名化的效果取决于可关联数据、使用环境和复原可能性。