邮件里的 AI 检测模型会被对抗样本绕过吗?防守方怎么加固?

威胁本质:判分模型是一个可被反复查询的接口

邮件判分模型有一个无法回避的特性:攻击者可以低成本地反复试探它。向自己控制的邮箱投递,或向目标组织投递并观察是否收到退信、是否进入隔离,都能获得反馈。反馈足够多时,攻击者就能逼近判定边界。

NIST AI 100-2e2025 Adversarial Machine Learning: A Taxonomy and Terminology 对规避类攻击的定义正是:在部署阶段构造输入,使模型产生攻击者期望的错误输出。OWASP Machine Learning Security Top 10 也把此类风险列在机器学习系统的主要风险之中。

因此正确的假设是:任何单一判分模型都可以被绕过,问题只是成本。防守目标不是「不可绕过」,而是「绕过成本高于攻击收益,且绕过行为本身可被观测」。

邮件场景下对抗性改写的实际形态

与图像领域的像素级扰动不同,邮件侧的对抗更「粗糙」但同样有效:

  • 文本改写:同义替换、句式重排、插入无关正常段落稀释特征。
  • 载荷位移:把恶意 URL 移出正文,放进附件、图片、二维码、或多级跳转的落地页。
  • 信誉借用:使用具有良好历史的第三方托管服务承载落地页或附件,使 URL 本身信誉良好。
  • 时序规避:先投递完全无害的邮件建立通信历史,再投递载荷。
  • 渲染差异:利用检测系统与邮件客户端对 HTML 解析的差异,使二者「看到」的内容不同。

研判提示:最后一条最隐蔽也最值得排查——检测侧看到的应当是用户最终看到的渲染结果,而不只是原始源码。

加固原则一:多信号冗余,且信号要「异质」

增加模型数量没有意义,如果它们都依赖同一类特征。有效的冗余要求信号来自不同层面、被绕过所需的能力互不相同

  • 协议层:RFC 7208 Sender Policy Framework (SPF), Version 1、RFC 6376 DomainKeys Identified Mail (DKIM) Signatures、RFC 7489 Domain-based Message Authentication, Reporting, and Conformance (DMARC) 的鉴别结果与对齐情况——这一层攻击者无法靠改写文本绕过。
  • 关系层:发件域历史、首次通信、通信频次突变。
  • 基础设施层:发送 IP 的历史行为、域名注册时间、落地页跳转链路。
  • 内容层:模型判分(承认其可被绕过,因而不给它一票否决权)。
  • 行为层:收件人是否点击、是否提交凭据、事后是否出现异常登录。

关键设计:内容层模型不得单独决定拦截或放行。它只贡献权重,最终决策由多层组合给出。这样,仅攻破内容层无法改变结果。

加固原则二:判定必须可解释、可回溯

不可解释的判定在对抗环境中是双重损失:既无法向用户说明,也无法在被绕过后定位原因。

可操作要求:每封邮件的最终判定都应保存一条结构化记录,包含各层信号的取值、各自贡献、最终阈值与动作。这条记录是后续所有复盘、申诉、调优的唯一依据。缺了它,调优只能凭感觉。

加固原则三:把「判定翻转」当作一等公民监控

对抗行为最可观测的特征不是单封邮件的内容,而是判定结果在时间上的变化

  • 同一发件域/同一活动特征的邮件,短时间内从「拦截」变为「放行」。
  • 同一模板的多个变体在短时间内密集投递,判定分数呈现明显的爬坡趋势。
  • 某类邮件的分数分布整体向阈值靠拢。

这些是探测行为的直接指纹。应把它们做成独立告警,而不是淹没在单封邮件的告警里。发现探测比发现单封恶意邮件价值更高,因为它提示的是一次有组织的活动。

加固原则四:控制反馈回路的可污染性

用户标记构成的持续学习通道,是攻击者可以低成本影响模型的入口。

控制措施:记录每条标记的来源账号与时间;对异常高频标记、对同一发件域集中标记的账号设阈值并复核;模型更新前对候选样本做抽样人工审核;保留回滚能力,并保留上一版本的判定基线以便对比

自查清单
  1. 内容层模型是否拥有单独的拦截或放行决定权(若有,应改为组合决策)。
  2. 检测侧解析的是否为最终渲染结果,能否发现解析差异。
  3. 是否保存了逐封邮件的结构化判定记录。
  4. 是否存在「判定翻转」与「分数爬坡」的独立监控。
  5. 反馈标记是否留痕、是否有异常账号阈值。
  6. 模型更新是否可回滚、是否保留基线对比。

参考:NIST AI 100-2e2025 Adversarial Machine Learning: A Taxonomy and TerminologyOWASP Machine Learning Security Top 10RFC 7489 Domain-based Message Authentication, Reporting, and Conformance (DMARC)MITRE ATLAS™ (Adversarial Threat Landscape for AI Systems)