【 1-7 】
数据汇聚、分析的风险与管理
第1.7章 数据汇聚、分析的风险与管理
本章内容依据《数据安全工程技术人员(初级)第一模块零基础详细学习教材》整理,系统讲解数据汇聚、分析的风险与管理。
7.1 什么是数据汇聚
数据汇聚是把多个来源、多个系统或多个业务环节的数据集中到统一平台进行存储、关联和分析。数据汇聚能够提高分析能力,同时会扩大集中存储、越权访问、关联识别和批量泄露风险。
7.2 为什么汇聚后风险会增加
| 风险机制 | 说明 | 例子 |
|---|---|---|
| 集中价值上升 | 攻击者一次入侵可能获得更多数据 | 分析平台同时包含用户、订单、行为和设备数据 |
| 关联识别增强 | 单个数据集看似无法识别个人,关联后可能识别 | 学习记录与设备信息、时间信息关联 |
| 权限范围扩大 | 分析人员可能获得跨系统数据 | 运营人员可查询原本只属于考试系统的数据 |
| 复制链条增加 | 产生中间表、临时文件、导出文件 | CSV 临时文件留在个人终端 |
| 用途偏离 | 分析目的可能超出原始收集目的 | 报名数据被用于无关营销画像 |
| 第三方风险 | 外部分析工具或云服务接触数据 | 将生产数据上传到外部分析平台 |
7.3 数据汇聚前的审批要点
- 明确汇聚目的、预期产出和使用部门。
- 列明数据来源、字段、规模、时间范围和更新频率。
- 确认原始数据取得和使用的依据。
- 评估是否涉及敏感个人信息、重要业务数据或大规模数据。
- 确定是否需要脱敏、去标识化、聚合或字段删除。
- 设置分析人员、管理员和导出人员的权限。
- 规定中间数据、临时文件和分析结果的保存期限。
- 确定日志、审计、异常告警和事件处置要求。
7.4 分析环境的安全控制
| 控制领域 | 基础措施 |
|---|---|
| 身份与权限 | 实名账号、多因素认证、角色权限、定期复核 |
| 数据进入 | 审批、字段最小化、来源登记、恶意文件检查 |
| 存储 | 分区隔离、加密、备份、敏感数据标签 |
| 分析使用 | 脱敏视图、受控查询、禁止无授权复制 |
| 导出 | 审批、数据量限制、水印、加密、操作审计 |
| 开发测试 | 优先使用模拟、脱敏或去标识化数据 |
| 结果发布 | 发布审核、敏感内容检查、最小披露 |
| 清理 | 按期限删除临时表、缓存、脚本输出和个人副本 |
7.5 重新识别风险
去掉姓名和手机号后,数据仍可能通过出生日期、地区、职业、精确时间、设备信息等组合识别个人。这类风险称为重新识别风险。
判断方法:字段越多、粒度越细、样本越小、外部公开数据越丰富、关联能力越强,重新识别风险通常越高。
7.6 测试环境风险
测试环境常具有更多人员、更宽权限、较弱审计和较频繁复制。将完整生产数据直接复制到测试环境,会扩大泄露范围。
- 使用模拟数据或专门构造的测试数据。
- 确需使用生产数据时,先完成审批和风险评估。
- 对直接标识符实施删除、替换或掩码。
- 降低地址、时间、金额等字段精度。
- 限制测试人员访问和导出。
- 测试完成后按计划清理数据副本。
7.7 分析结果也需要保护
分析结果可能包含个人画像、风险评分、经营预测、客户名单和商业秘密。即使原始数据已脱敏,结果仍可能具有较高敏感性,应进行分类分级、访问控制和发布审核。
本节自测
1. 为什么多个低敏感数据集汇聚后可能形成高风险数据集?
2. 分析平台中的临时表为什么需要设置保存期限?
3. 去掉姓名和手机号后,数据是否一定无法识别个人?