【 第 6 步 】

数据识别室

师傅:“业务和接口已经梳理清楚,现在要判断这些字段到底属于什么数据。今天进行数据识别。不能只看字段名称,因为一个叫‘code’的字段可能是验证码、门店代码,也可能是其他标识;

正确方法是结合数据字典、受控样本、业务用途、数据主体、关联识别能力、数据规模以及组织采用的分类分级依据共同判断。评估中重点区分一般个人信息、敏感个人信息、重要数据和业务敏感数据

例如会员姓名、联系方式需要检查目的、权限和期限;更敏感的数据则需要进一步关注必要性和更强保护。技术工具可以帮忙发现线索,但最终结果仍然需要业务和专业人员人工复核。”

数据识别室情景阅读暂用场景图

01 · 现场对话

数据识别室的知识任务

01

先从字段名称开始

字段名只是第一条线索。

小白

“这里有个字段叫 customer_code。”

师傅

“只看名字能判断内容吗?”

小白

“不能。”

师傅

“先看数据字典,再在受控条件下抽样确认。”

02

再看它和谁有关

判断能不能识别具体个人。

小白

“这一列只有一个会员编号。”

师傅

“单独看可能看不出是谁。”

小白

“但如果能和会员表关联,就可能找到具体人员。”

师傅

“所以还要看关联识别能力。”

03

不同数据关注点不同

识别结果会影响后续评估。

小白

“姓名和手机号属于个人相关数据。”

师傅

“还要看是否存在更敏感的数据。”

小白

“比如支付信息、精确位置等,需要更严格检查必要性和保护。”

师傅

“对。”

04

工具结果需要人工复核

不能按字段名自动下结论。

安全人员

“工具识别出300个疑似敏感字段。”

小白

“全部直接登记?”

师傅

“先结合真实数据、业务用途和系统关系复核。”

小白

“工具负责找线索,人负责做最终判断。”

师傅

“对。”

02 · 小白做现场笔记

重要概念及注释

01

数据识别

正式含义
结合字段名称、字段样本、业务用途、关联能力、数据规模和行业目录,判断数据实际属于什么类型。
识别路线
字段名称和数据字典 ↓ 受控查看样本 ↓ 核对业务用途 ↓ 确认数据主体 ↓ 分析关联能力 ↓ 结合规模、目录和分类分级
这是教材给出的基础识别方法。

字段叫什么只是线索,真正分类要看内容和业务。

02

一般个人信息

教材中的常见示例
姓名 联系方式 账号 地址 订单
评估关注
处理目的 告知 权限 保存期限 权利响应

和个人有关的数据,要继续检查为什么用、谁能用、用多久。

03

敏感个人信息

教材中的常见示例
证件号 金融账户 生物识别 健康信息 精确位置 未成年人信息
评估重点
业务目的是否明确 是否确有必要 有没有低敏感替代方式 适用依据 加密和脱敏 访问与导出控制 保存期限 影响评估

数据越敏感,越要问“真的必须用它吗”。

04

重要数据

教材中的基础解释
与国家安全、经济运行、社会稳定、公共健康和安全等密切相关的数据。
初级人员主要做
收集字段 收集用途 收集规模 了解行业 了解区域 分析潜在影响 形成待核实清单
正式认定需要结合主管部门目录、行业规则和组织流程。

初级人员可以发现重要数据线索,但不应只凭个人判断完成正式认定。

05

业务敏感数据

常见示例
核心配方 客户名单 价格信息 研发资料 交易模型 源代码
面包厂场景
30份核心配方不一定属于个人信息,但仍然可能是非常重要的业务敏感数据。

不是个人信息的数据,也可能对企业经营非常重要。

06

直接识别、间接识别与关联识别

核心内容
直接识别 → 字段本身就能找到个人 例如姓名、手机号 间接识别 → 多个字段组合后识别个人 关联识别 → 和其他数据源连接后识别个人
教材也使用这三个层次解释个人识别能力。

看不出名字,不代表一定识别不了个人。

07

工具识别与人工复核

面包厂场景
工具发现字段:
phone
它可能是:
客户手机号 设备联系电话 门店号码
因此还要看:
数据字典 真实样本 业务用途 关联关系
教材明确要求技术工具发现结果进行人工复核。

工具负责找“像什么”,人负责判断“实际上是什么”。

03 · 经验和难点

小结

这一站,小白从字段名称、样本、业务用途、数据主体和关联能力等方面识别了不同类型的数据,并理解了工具识别与人工复核的关系。最值得记住的经验是:数据类型不能只靠字段名称判断,要结合内容和真实业务场景。初学者最容易遇到的难点,是看到一个模糊字段名就直接分类,或者完全相信工具识别结果而没有人工确认。