【 10个概念 】
数据脱敏
难易分类
简单概念
1 掩码
概念解释:保留部分字符并隐藏其余字符的脱敏方法。
实例:测试人员处理订单数据时,采用“138****5678”的方式降低识别精度。这个具体处理方法就是掩码。
易混淆:把“掩码”和“加密”混为一谈。掩码的关键是“保留部分字符并隐藏其余字符的脱敏方法”;加密关注的是另一种对象、位置、作用或处理关系。
2 替换
概念解释:使用虚构值、固定值或映射值替代真实数据。
实例:测试人员处理订单数据时,采用“13900000000”的方式降低识别精度。这个具体处理方法就是替换。
易混淆:把“替换”和“掩码”混为一谈。替换的关键是“使用虚构值、固定值或映射值替代真实数据”;掩码关注的是另一种对象、位置、作用或处理关系。
3 截断
概念解释:删除敏感字段的一部分,仅保留业务所需内容。
实例:测试人员处理订单数据时,采用“只保留地址中的省市”的方式降低识别精度。这个具体处理方法就是截断。
易混淆:把“截断”和“删除”混为一谈。截断的关键是“删除敏感字段的一部分”;删除关注的是另一种对象、位置、作用或处理关系。
4 泛化
概念解释:降低数据精度,如把具体年龄改为年龄区间。
实例:测试人员处理订单数据时,采用“把31岁改成30—39岁”的方式降低识别精度。这个具体处理方法就是泛化。
易混淆:把“泛化”和“随机扰动”混为一谈。泛化的关键是“降低数据精度”;随机扰动关注的是另一种对象、位置、作用或处理关系。
5 随机扰动
概念解释:对数值加入一定随机变化,同时尽量保持统计特征。
实例:测试人员处理订单数据时,采用“把统计值1000调整为998”的方式降低识别精度。这个具体处理方法就是随机扰动。
易混淆:把“随机扰动”和“替换”混为一谈。随机扰动的关键是“对数值加入一定随机变化”;替换关注的是另一种对象、位置、作用或处理关系。
难懂概念
6 数据脱敏
概念解释:通过掩码、替换、截断、泛化或扰动降低敏感数据的可识别性。
主要对应的问题:哪些敏感字段需要降低可识别性,应选择什么方法,处理后还能否满足业务用途?
特殊异常情况:单表无法识别个人,与外部数据关联后身份完全暴露
测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:数据脱敏的效果取决于可关联数据、使用环境和复原可能性。
7 静态脱敏
概念解释:对数据副本预先处理后用于测试、分析或共享。
主要对应的问题:提供给测试、分析或共享的数据副本是否已提前完成脱敏,并与真实生产数据隔离?
特殊异常情况:单表无法识别个人,与外部数据关联后身份完全暴露
测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:静态脱敏的效果取决于可关联数据、使用环境和复原可能性。
8 动态脱敏
概念解释:根据访问者身份和角色,在查询或展示时实时隐藏敏感字段。
主要对应的问题:不同身份和角色查询同一份数据时,系统应当实时显示哪些内容、隐藏哪些字段?
特殊异常情况:单表无法识别个人,与外部数据关联后身份完全暴露
测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:动态脱敏的效果取决于可关联数据、使用环境和复原可能性。
9 去标识化
概念解释:使个人信息在不借助额外信息时难以识别特定个人。
主要对应的问题:删除直接身份信息后,接收者在缺少额外对应表时是否仍能识别具体个人?
特殊异常情况:单表无法识别个人,与外部数据关联后身份完全暴露
测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:去标识化的效果取决于可关联数据、使用环境和复原可能性。
10 匿名化
概念解释:处理后无法识别特定个人且不能复原。
主要对应的问题:处理后的数据是否在任何合理条件下都无法识别特定个人,并且无法恢复原身份?
特殊异常情况:单表无法识别个人,与外部数据关联后身份完全暴露
测试库删除了姓名和手机号,只保留分钟级下单时间、商品和街道。员工把这些字段与公开社交信息关联,在5000条记录中识别出17名顾客。这个实例说明:匿名化的效果取决于可关联数据、使用环境和复原可能性。