邮件里的 AI 检测模型会被对抗样本绕过吗?防守方怎么加固?
邮件判分模型有一个无法回避的特性:攻击者可以低成本地反复试探它。向自己控制的邮箱投递,或向目标组织投递并观察是否收到退信、是否进入隔离,都能获得反馈。反馈足够多时,攻击者就能逼近判定边界。
NIST AI 100-2e2025 Adversarial Machine Learning: A Taxonomy and Terminology 对规避类攻击的定义正是:在部署阶段构造输入,使模型产生攻击者期望的错误输出。OWASP Machine Learning Security Top 10 也把此类风险列在机器学习系统的主要风险之中。
因此正确的假设是:任何单一判分模型都可以被绕过,问题只是成本。防守目标不是「不可绕过」,而是「绕过成本高于攻击收益,且绕过行为本身可被观测」。
与图像领域的像素级扰动不同,邮件侧的对抗更「粗糙」但同样有效:
- 文本改写:同义替换、句式重排、插入无关正常段落稀释特征。
- 载荷位移:把恶意 URL 移出正文,放进附件、图片、二维码、或多级跳转的落地页。
- 信誉借用:使用具有良好历史的第三方托管服务承载落地页或附件,使 URL 本身信誉良好。
- 时序规避:先投递完全无害的邮件建立通信历史,再投递载荷。
- 渲染差异:利用检测系统与邮件客户端对 HTML 解析的差异,使二者「看到」的内容不同。
研判提示:最后一条最隐蔽也最值得排查——检测侧看到的应当是用户最终看到的渲染结果,而不只是原始源码。
增加模型数量没有意义,如果它们都依赖同一类特征。有效的冗余要求信号来自不同层面、被绕过所需的能力互不相同:
- 协议层:RFC 7208 Sender Policy Framework (SPF), Version 1、RFC 6376 DomainKeys Identified Mail (DKIM) Signatures、RFC 7489 Domain-based Message Authentication, Reporting, and Conformance (DMARC) 的鉴别结果与对齐情况——这一层攻击者无法靠改写文本绕过。
- 关系层:发件域历史、首次通信、通信频次突变。
- 基础设施层:发送 IP 的历史行为、域名注册时间、落地页跳转链路。
- 内容层:模型判分(承认其可被绕过,因而不给它一票否决权)。
- 行为层:收件人是否点击、是否提交凭据、事后是否出现异常登录。
关键设计:内容层模型不得单独决定拦截或放行。它只贡献权重,最终决策由多层组合给出。这样,仅攻破内容层无法改变结果。
不可解释的判定在对抗环境中是双重损失:既无法向用户说明,也无法在被绕过后定位原因。
可操作要求:每封邮件的最终判定都应保存一条结构化记录,包含各层信号的取值、各自贡献、最终阈值与动作。这条记录是后续所有复盘、申诉、调优的唯一依据。缺了它,调优只能凭感觉。
对抗行为最可观测的特征不是单封邮件的内容,而是判定结果在时间上的变化:
- 同一发件域/同一活动特征的邮件,短时间内从「拦截」变为「放行」。
- 同一模板的多个变体在短时间内密集投递,判定分数呈现明显的爬坡趋势。
- 某类邮件的分数分布整体向阈值靠拢。
这些是探测行为的直接指纹。应把它们做成独立告警,而不是淹没在单封邮件的告警里。发现探测比发现单封恶意邮件价值更高,因为它提示的是一次有组织的活动。
用户标记构成的持续学习通道,是攻击者可以低成本影响模型的入口。
控制措施:记录每条标记的来源账号与时间;对异常高频标记、对同一发件域集中标记的账号设阈值并复核;模型更新前对候选样本做抽样人工审核;保留回滚能力,并保留上一版本的判定基线以便对比。
- 内容层模型是否拥有单独的拦截或放行决定权(若有,应改为组合决策)。
- 检测侧解析的是否为最终渲染结果,能否发现解析差异。
- 是否保存了逐封邮件的结构化判定记录。
- 是否存在「判定翻转」与「分数爬坡」的独立监控。
- 反馈标记是否留痕、是否有异常账号阈值。
- 模型更新是否可回滚、是否保留基线对比。
参考:NIST AI 100-2e2025 Adversarial Machine Learning: A Taxonomy and Terminology | OWASP Machine Learning Security Top 10 | RFC 7489 Domain-based Message Authentication, Reporting, and Conformance (DMARC) | MITRE ATLAS™ (Adversarial Threat Landscape for AI Systems)
