机器学习反垃圾模型面临的对抗样本问题是什么?NIST 如何分类这些攻击?

1 机器学习反垃圾模型面临的对抗样本问题是什么?NIST 如何分类这些攻击?
标准定位与官方摘要

NIST AI 100-2 E2025 是 NIST 可信与负责任 AI 系列报告之一,2025 年 3 月发布。其官方摘要说明:本报告提供对抗性机器学习(AML)领域的概念分类法并定义术语;该分类法以概念层级组织,涵盖关键的 ML 方法类型、攻击的生命周期阶段,以及攻击者的目标、目的、能力与知识。报告还识别 AI 系统生命周期中的当前挑战,并描述相应的缓解与后果管理方法;所用术语与 AML 文献保持一致,并辅以 AI 系统安全关键术语表。NIST 表明,分类法与术语合在一起旨在通过为快速演进的 AML 领域建立共同语言,为其他标准以及未来评估与管理 AI 系统安全的实践指南提供依据。该出版物的官方关键词包括:人工智能、机器学习、攻击分类法、滥用、数据投毒、规避、攻击缓解、大语言模型、聊天机器人、隐私泄露。NIST 另于 2025 年 4 月 1 日上传了更正版 PDF,并于 2025 年 6 月 3 日就报告第 x 页的一处错误发布了「潜在更新」说明。

对应到反垃圾场景的四类风险
  • 规避(evasion):即狭义的对抗样本——垃圾邮件发送者在不改变邮件对人的语义的前提下微调内容,使分类器判为正常。邮件领域的经典形态包括同形异义字符替换、零宽字符插入、把正文渲染为图片或 HTML/CSS 拼接、在不可见区域堆砌大量正常词以稀释特征、把恶意链接藏在多跳跳转或合法云文档之后。
  • 数据投毒(data poisoning):污染训练与在线学习的数据源。反垃圾系统普遍依赖用户「标记为垃圾/非垃圾」的反馈与蜜罐语料,攻击者可通过批量误标或向蜜罐定向投递特制样本,逐步把决策边界推向对己有利的方向。
  • 隐私泄露:邮件语料含大量个人信息,模型可能通过输出反推训练样本;共享或外包模型训练时尤其需要评估这一风险。
  • 滥用(abuse):把合法功能用于非预期目的,例如滥用「申诉/误判反馈」通道对特定发件域实施定向白名单化。
为什么反垃圾是对抗性最强的 ML 应用之一

反垃圾与多数 ML 应用的根本差别在于:它的输入分布由一个有经济动机、会主动响应防御变化的对手持续塑造。攻击者可以近乎零成本地反复投递探测邮件,观察是否进入收件箱,从而在黑盒条件下获得逼近梯度的反馈信号——这使「查询即梯度」的规避攻击在邮件领域天然可行。同时,防守方的容错空间极不对称:漏判一封钓鱼可能导致账号失陷,而误判一封发票邮件则直接造成业务损失,两类错误都不能通过简单调高阈值来消解。

工程缓解方向

参照 AI 100-2 E2025 所强调的「按生命周期阶段与攻击者能力/知识来组织防御」的思路,邮件侧可采取:纵深与异构——不把判定押在单一模型上,将统计模型与确定性证据(SPF/DKIM/DMARC 认证结果、域名信誉、发送 IP 历史、URL 落地页分析)并联,确定性证据不受文本层扰动影响;限制探测反馈——避免向未认证发送方泄露精确的判定结果与分数,减缓黑盒探测效率;净化反馈闭环——对用户标记数据做发送者信誉加权与异常检测,防止批量误标投毒,关键类别的再训练保留人工抽检;输入规范化——在特征提取前统一 Unicode 归一化、剥离零宽与不可见字符、对图片正文做 OCR,压缩同形异义与隐藏字符类规避的空间;持续对抗评测——建立内部红队样本集,把对抗鲁棒性作为模型上线的门禁指标而非事后观察项;可回滚——保留规则层旁路,在模型出现大面积漂移时可快速降级到确定性策略。

参考:NIST AI 100-2 E2025《Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations》,Apostol Vassilev(NIST)、Alina Oprea(Northeastern University)、Alie Fordyce(Cisco)、Hyrum Anderson(Cisco)、Xander Davies(U.K. AI Security Institute)、Maia Hamin(U.S. AI Safety Institute),2025 年 3 月发布(03/24/25 定稿),DOI 10.6028/NIST.AI.100-2e2025,https://csrc.nist.gov/pubs/ai/100/2/e2025/final