【 3-11 】
故障分析与运行保障
第3.11章 故障分析与运行保障
本章内容依据《数据安全工程技术人员(初级)第3模块零基础详细学习教材》整理,系统讲解故障分析与运行保障。
11.1 七步故障分析法
1. 确认现象:记录时间、告警、用户反馈和表现。
2. 界定范围:判断影响账号、服务、区域或整个系统。
3. 保留证据:保存日志、配置快照、错误信息和监控曲线。
4. 分析原因:检查近期变更、资源、依赖、网络和产品日志。
5. 实施处置:按授权执行回退、恢复、调整或故障转移。
6. 验证恢复:验证业务、安全功能、日志和告警。
7. 记录复盘:形成故障单,明确根因、影响和改进。
11.2 为什么先保留证据
直接重启、清理日志或重新安装可能暂时恢复服务,也可能覆盖原因和安全事件证据。应先记录时间、现象、版本、配置、日志和近期变更,再执行批准处置。
现场保护:涉及疑似数据泄露、恶意攻击或重大异常时,应按照应急流程上报。初级人员应停止无授权操作,保留证据并等待负责人组织处置。
11.3 常见故障与排查
| 现象 | 初步排查 | 重点记录 |
|---|---|---|
| 管理页面无法访问 | 服务、端口、路由、证书和负载 | 时间、错误码、服务和网络日志 |
| 日志未采集或延迟 | 源配置、网络、容量、时间和解析规则 | 最后采集、丢失范围和变更 |
| 脱敏规则未生效 | 角色、字段映射、优先级、缓存和接口 | 账号、页面/接口、规则版本和步骤 |
| 审计日志不完整 | 策略、代理、连接方式和容量 | 缺失操作、账号和时间段 |
| 备份任务失败 | 空间、权限、网络、任务和密钥 | 任务编号、错误和最近成功时间 |
| 资源使用过高 | 进程、连接、磁盘、内存和查询 | 资源曲线、峰值和关联变更 |
11.4 排查顺序:从外到内
用户现象
↓
网络与 DNS
↓
端口与服务进程
↓
应用与产品日志
↓
依赖服务、数据库和存储
↓
近期变更、配置和资源
↓
根因与恢复验证
↓
网络与 DNS
↓
端口与服务进程
↓
应用与产品日志
↓
依赖服务、数据库和存储
↓
近期变更、配置和资源
↓
根因与恢复验证
11.5 故障单内容
| 字段 | 填写内容 |
|---|---|
| 故障编号与时间 | 发现、开始、恢复和关闭时间 |
| 现象 | 用户表现、错误码和告警 |
| 影响范围 | 系统、数据、用户、区域和业务 |
| 证据 | 日志、监控、配置、截图和操作 |
| 根因 | 直接原因和深层原因 |
| 临时措施 | 用于快速恢复的处置 |
| 永久措施 | 消除根因和防止复发 |
| 验证 | 业务、安全功能、日志和告警 |
| 责任与期限 | 责任人、复核人和完成时间 |
11.6 根因分析示例
日志停止采集,因为磁盘已满;磁盘已满,因为保留策略未生效;策略未生效,因为配置变更后没有验证;变更未验证,因为变更清单缺少存储检查项。永久措施应修复流程和基线,避免只处理表面现象。
11.7 恢复后的验证
- 业务页面、接口和数据访问是否恢复。
- 权限、脱敏、审计和告警是否正常。
- 日志是否连续,时间是否一致。
- 备份和恢复任务是否正常。
- 资源是否回到合理范围。
- 临时措施是否需要撤销或转为正式配置。
- 文档、基线和监控规则是否更新。
本节自测
1. 故障处理为什么要记录近期变更?
2. 直接重启服务可能带来什么问题?
3. 临时措施和永久措施有什么区别?