邮箱地址算不算个人信息?邮件正文算不算个人敏感信息?该怎么判定?
判定邮箱数据的敏感度,需要同时使用两套依据,它们的作用不同。
GB/T 35273-2020 是推荐性国家标准,它给出了个人信息与个人敏感信息的定义、判定方法,并以附录形式给出范围举例与判定方法。它的价值在于「怎么判」——提供了可操作的推导路径。
个人信息保护法是法律,它定义了个人信息为以电子或者其他方式记录的与已识别或者可识别的自然人有关的各种信息,不包括匿名化处理后的信息;并把敏感个人信息定义为一旦泄露或者非法使用,容易导致自然人的人格尊严受到侵害或者人身、财产安全受到危害的个人信息。它的价值在于「判完之后要承担什么」——处理敏感个人信息需要特定的目的和充分的必要性,并采取严格保护措施,还需要取得个人的单独同意。
两者的关系是:用标准的方法去判,用法律的后果去定控制强度。只看标准会低估法律责任,只看法律会缺少可操作的判定路径。
先看最基础的一项。邮箱地址的核心判定标准是「可识别性」:它能否单独或与其他信息结合识别到特定自然人。
- 姓名拼音形式的企业邮箱(如 zhangsan@example.com):地址本身即包含姓名信息,域名指向具体单位。它单独就能识别到自然人,属于个人信息,没有争议。
- 工号形式的企业邮箱(如 e12345@example.com):地址本身不含姓名,但组织内部持有工号与姓名的对应关系。按「可识别」的口径,对持有对应关系的组织而言它仍是个人信息——法律用的是「已识别或者可识别」,而不是「从字面能看出来」。
- 职能邮箱(如 support@example.com):不指向特定自然人,通常不构成个人信息。但一旦它的收件记录能反映出具体经办人,情况就会变化。
至于是否构成敏感个人信息,需要回到法律定义做推理:泄露后是否容易导致人格尊严受侵害或人身、财产安全受危害。单纯一个企业邮箱地址通常不满足这个门槛;但如果地址所属的域名本身即暴露了特殊身份属性——例如某类专科医疗机构、特定信仰团体、或某类特殊人群服务机构的域名——那么「持有该域名邮箱」这一事实本身就泄露了敏感属性。这种情况下,地址应当按敏感个人信息对待。
这正是判定必须结合上下文的原因:同样格式的一个字符串,在不同域名下的敏感度可以完全不同。
比地址更需要重视的是三类衍生数据。
第一类是邮件正文与附件。邮件是通用载体,其内容可以是任何东西——身份证扫描件、银行流水、体检报告、劳动合同、家庭住址。这意味着邮件内容的敏感度不可能被事先确定,只能按其中可能出现的最高敏感度来设计控制。期待通过「用户不要用邮件发敏感文件」的制度约束来降低这一风险,在实践中从未成功过。
第二类是通信关系。即使不看正文,「谁在什么时候给谁发了邮件」这一元数据本身就有很强的推断力:它能还原组织结构、项目团队构成、外部合作关系、以及个人的作息规律。大量元数据聚合后的敏感度,可以超过单封邮件正文。这一点在设计日志访问权限时经常被低估。
第三类是被删除内容的残留。用户删除的邮件可能仍存在于归档、备份、索引、缓存与回收站中。个人信息保护法规定了处理者应当主动删除个人信息的若干情形(如处理目的已实现或者不再必要、保存期限届满、个人撤回同意等),并规定保存期限未届满或者技术上难以删除的,应当停止除存储和采取必要的安全保护措施之外的处理。这一条给出了明确的技术出路:删不掉的,就必须冻结——只保留存储与保护,停止一切其他处理,包括检索、分析与展示。
判定的意义在于差异化配置控制,否则就退化成一份无用的文档。可参照的对应关系:
| 数据类别 | 典型判定 | 控制要点 |
|---|---|---|
| 职能邮箱地址 | 通常非个人信息 | 常规访问控制 |
| 员工邮箱地址 | 个人信息 | 最小必要、目录服务权限收敛、批量导出需审批 |
| SMTP 会话元数据 | 个人信息,聚合后敏感度上升 | 集中存储、访问留痕、按角色授权、限制批量查询 |
| 登录与访问记录 | 个人信息,含行踪与作息 | 同上,且明确保存期限 |
| 邮件正文与附件 | 按最高敏感度设计 | 传输与存储加密、越权访问检测、导出审批与留痕 |
| 特殊身份属性域名下的地址 | 按敏感个人信息 | 单独同意、严格保护措施、单独评估 |
其中有两个动作值得单独强调:
- 管理员访问用户邮箱必须被视为高风险操作。邮件系统管理员在技术上通常能读取任意邮箱,这是运维必需的能力,但必须配套双人审批、事由记录、时限控制与事后留痕。「技术上能做」与「制度上允许做」之间必须有一道可审计的闸门。
- 批量导出与检索要单独管控。单封邮件的越权访问影响有限,全域检索与批量导出的影响是量级不同的。这两类操作应当走不同的授权路径。
- 先做一次数据盘点。把邮件系统里所有会长期留存的数据形态列全:邮箱内容、归档、日志、索引、备份、通讯录、共享邮箱、公共文件夹、以及各类中间缓存。盘点漏掉的对象,后续所有控制都不会覆盖到它。
- 逐项做可识别性判定。对每一项回答:能否识别到自然人?单独能,还是需要结合其他信息?谁持有那个「其他信息」?
- 对判定为个人信息的项,再做敏感性判定。回答:泄露后是否容易导致人格尊严受侵害或人身、财产安全受危害?结论与理由都要写下来。理由比结论重要,因为业务变化后需要据此重新判定。
- 按判定结果配置控制,并验证配置生效。判定文档与实际权限配置必须能一一对应。
- 把判定纳入变更流程。新增一个业务邮箱、接入一个新的第三方服务、扩大一类日志的字段,都应当触发一次重新判定。一次性的判定会在半年内失效。
- 与等级保护要求对齐。GB/T 22239-2019 在安全计算环境层面设有个人信息保护控制点,其要求与这里的判定结果需要保持一致,避免两套文档互相矛盾。
参考:GB/T 35273-2020《信息安全技术 个人信息安全规范》,「国家标准全文公开系统」(国家市场监督管理总局、国家标准化管理委员会),https://openstd.samr.gov.cn/bzgk/gb/ ;《中华人民共和国个人信息保护法》,「国家法律法规数据库」(全国人民代表大会常务委员会法制工作委员会主办),https://flk.npc.gov.cn/ ;《中华人民共和国数据安全法》,「国家法律法规数据库」(全国人民代表大会常务委员会法制工作委员会主办),https://flk.npc.gov.cn/ ;GB/T 22239-2019《信息安全技术 网络安全等级保护基本要求》,「国家标准全文公开系统」(国家市场监督管理总局、国家标准化管理委员会),https://openstd.samr.gov.cn/bzgk/gb/ ;RFC 5322《Internet Message Format》,P. Resnick 编,2008 年 10 月,https://www.rfc-editor.org/rfc/rfc5322.html
