数据分类与最小化
负责任地处理数据。
数据分类与最小化 是 CoddyKit 上的免费 Cyber Security Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Cyber Security Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Cyber Security Academy 课程共包含 4 节课。
为何要对数据分类
您无法保护尚未分类的数据。数据分类会分配敏感性级别,使控制措施与风险相匹配:数据越敏感,所需的防护措施就越强。
分类会影响访问控制、加密要求、保留期限以及数据泄露响应的优先级。
分类级别
一种常见方案包含四个层级:
- 公开:泄露也不会造成损害
- 内部:日常业务数据
- 机密:客户数据、合同
- 受限:特殊类别数据、秘密、凭据
每个级别都对应所需的控制措施。标签应当足够简单,以便员工能够真正正确地使用。
数据发现
在进行分类之前,您必须先找到数据。个人数据可能隐藏在日志、备份、电子表格、支持工单和被遗忘的数据库(影子数据)中。
数据发现工具会扫描各类存储,查找国民 ID 号码、卡号和电子邮件地址等模式,以建立数据清单。
# Simple regex sweep for emails and card-like numbers in a codebase/logs
grep -rEn '[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Za-z]{2,}' ./logs
grep -rEn '\b(?:[0-9]{4}[ -]?){4}\b' ./logs数据映射
数据地图会追踪个人数据在其生命周期中的流转:数据从哪里进入、存储在哪里、谁可以访问、流向何处,以及从哪里离开。
- 收集点(表单、应用程序接口、软件开发工具包)
- 存储系统
- 第三方处理者
- 删除端点
如果您不知道某人的数据存放在哪里,就无法兑现删除请求。
最小化原则
数据最小化意味着只为特定且明确说明的目的收集和保留必要的数据。
- 不要因为某个字段将来可能有用,就收集它
- 当 ID 已足够时,不要记录完整载荷
- 不要在达到目的后继续保留数据
数据越少,数据泄露造成的影响就越小,合规负担和存储成本也越低。
实际应用中的最小化
具体的工程措施:
- 在只需进行比较的情况下,存储哈希值而不是原始值
- 在日志中截断或掩码处理(仅显示最后 4 位)
- 使用汇总分析,而不是存储每位用户的事件
- 使用不持久化的临时处理
# Mask a card number in application logs, keep only last 4
# 4242 4242 4242 4242 -> **** **** **** 4242
sed -E 's/[0-9]{4}([ -]?[0-9]{4}){2}([ -]?)([0-9]{4})/**** **** **** \3/g'保留与删除
存储限制要求定义保留期限,并在期限届满后实际删除数据。无限期保留不是便利措施,而是违规行为。
- 按类别设置保留计划
- 自动执行删除任务
- 不要只记得主数据库,还要考虑备份和日志
# Automated retention: purge support tickets closed over 24 months ago
DELETE FROM support_tickets
WHERE status = 'closed'
AND closed_at < NOW() - INTERVAL '24 months';访问控制与最小权限
只有访问权限与分类级别相匹配,分类才能发挥保护作用。应用最小权限原则:人员和服务只能获得完成任务所需的最低访问权限。
- 将基于角色的访问权限与分类级别关联
- 为敏感查询提供即时访问权限
- 定期审查访问权限,并在角色变更时撤销权限
受限数据应当只允许尽可能少的身份访问。
与分类相匹配的加密
更高的分类级别要求更强的保护措施:
- 对机密和受限数据进行静态数据加密
- 在所有场景中进行传输中加密(TLS)
- 对最敏感的字段使用字段级加密或令牌化
加密还可以减少数据泄露通知义务:经过适当加密的数据可能不构成需要报告的数据暴露。
嵌入流水线
将分类和最小化作为开发流水线中的默认设置,而不是定期审计,效果最佳。
- 在架构或数据目录中标记字段的敏感性
- 在代码审查中对新增 PII 字段进行静态检查
- 通过集中式日志记录器阻止记录受限字段
- 在设计阶段审查数据收集(隐私保护设计)
备份与影子副本
最小化和删除必须覆盖主存储之外的范围。个人数据会持续存在于团队容易遗忘的地方:
- 数据库备份和快照
- 日志聚合和分析流水线
- 缓存的导出文件和电子表格
- 使用生产数据初始化的副本及开发/测试环境
如果数据仍存在于昨夜的备份或测试数据库中,就不能算满足删除请求。
快速检查
检验您对数据最小化的理解。
回顾
您已经学会了负责任地处理数据:
- 将数据分类为不同的敏感性层级,以指导控制措施
- 发现并映射个人数据的存放位置和流向
- 实行最小化:只收集、记录和保留必要的数据
- 根据分类级别执行保留/删除、最小权限和加密
- 将所有措施作为流水线默认设置嵌入流程
接下来:发生问题时该怎么办——数据泄露通知和 DPIA。
常见问题解答
「数据分类与最小化」课时是免费的吗?
是的 — 「数据分类与最小化」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Cyber Security Academy 课程的其余内容,请升级到 CoddyKit PRO。 Cyber Security Academy 课程共包含 4 节课。
「数据分类与最小化」这节课中我会学到什么?
负责任地处理数据。 你通过在浏览器中直接运行的动手代码来练习 Cyber Security Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Cyber Security Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Cyber Security Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「数据分类与最小化」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Cyber Security Academy 课中编写并运行代码吗?
能。每节 Cyber Security Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 数据隐私为何重要
- GDPR 与 KVKK 基础
- 数据分类与最小化
- 泄露通知与 DPIA