【 1-7 】

数据汇聚、分析的风险与管理

第1.7章 数据汇聚、分析的风险与管理

本章内容依据《数据安全工程技术人员(初级)第一模块零基础详细学习教材》整理,系统讲解数据汇聚、分析的风险与管理。

7.1 什么是数据汇聚

数据汇聚是把多个来源、多个系统或多个业务环节的数据集中到统一平台进行存储、关联和分析。数据汇聚能够提高分析能力,同时会扩大集中存储、越权访问、关联识别和批量泄露风险。

7.2 为什么汇聚后风险会增加

风险机制说明例子
集中价值上升攻击者一次入侵可能获得更多数据分析平台同时包含用户、订单、行为和设备数据
关联识别增强单个数据集看似无法识别个人,关联后可能识别学习记录与设备信息、时间信息关联
权限范围扩大分析人员可能获得跨系统数据运营人员可查询原本只属于考试系统的数据
复制链条增加产生中间表、临时文件、导出文件CSV 临时文件留在个人终端
用途偏离分析目的可能超出原始收集目的报名数据被用于无关营销画像
第三方风险外部分析工具或云服务接触数据将生产数据上传到外部分析平台

7.3 数据汇聚前的审批要点

  1. 明确汇聚目的、预期产出和使用部门。
  2. 列明数据来源、字段、规模、时间范围和更新频率。
  3. 确认原始数据取得和使用的依据。
  4. 评估是否涉及敏感个人信息、重要业务数据或大规模数据。
  5. 确定是否需要脱敏、去标识化、聚合或字段删除。
  6. 设置分析人员、管理员和导出人员的权限。
  7. 规定中间数据、临时文件和分析结果的保存期限。
  8. 确定日志、审计、异常告警和事件处置要求。

7.4 分析环境的安全控制

控制领域基础措施
身份与权限实名账号、多因素认证、角色权限、定期复核
数据进入审批、字段最小化、来源登记、恶意文件检查
存储分区隔离、加密、备份、敏感数据标签
分析使用脱敏视图、受控查询、禁止无授权复制
导出审批、数据量限制、水印、加密、操作审计
开发测试优先使用模拟、脱敏或去标识化数据
结果发布发布审核、敏感内容检查、最小披露
清理按期限删除临时表、缓存、脚本输出和个人副本

7.5 重新识别风险

去掉姓名和手机号后,数据仍可能通过出生日期、地区、职业、精确时间、设备信息等组合识别个人。这类风险称为重新识别风险。

判断方法:字段越多、粒度越细、样本越小、外部公开数据越丰富、关联能力越强,重新识别风险通常越高。

7.6 测试环境风险

测试环境常具有更多人员、更宽权限、较弱审计和较频繁复制。将完整生产数据直接复制到测试环境,会扩大泄露范围。

  • 使用模拟数据或专门构造的测试数据。
  • 确需使用生产数据时,先完成审批和风险评估。
  • 对直接标识符实施删除、替换或掩码。
  • 降低地址、时间、金额等字段精度。
  • 限制测试人员访问和导出。
  • 测试完成后按计划清理数据副本。

7.7 分析结果也需要保护

分析结果可能包含个人画像、风险评分、经营预测、客户名单和商业秘密。即使原始数据已脱敏,结果仍可能具有较高敏感性,应进行分类分级、访问控制和发布审核。

本节自测

1. 为什么多个低敏感数据集汇聚后可能形成高风险数据集?

2. 分析平台中的临时表为什么需要设置保存期限?

3. 去掉姓名和手机号后,数据是否一定无法识别个人?