M3AAWG 建议如何评估邮件反滥用产品?

1 M3AAWG 建议如何评估邮件反滥用产品?
文献定位与适用范围

M3AAWG(Messaging, Malware and Mobile Anti-Abuse Working Group,消息、恶意软件与移动反滥用工作组)发布的《Email Anti-Abuse Product Evaluation Best Current Practices》是一份专门讨论如何评估邮件反滥用产品或服务的最佳共同实践文档,2019 年 3 月版更新自 2010 年 8 月初版,全文 10 页。

文件说明其目的是汇总反滥用社区成员在评估邮件反滥用产品/服务时使用的最佳共同实践。2019 年版的更新要点是:明确不仅 ISP,邮件服务提供商(ESP)与其他各类组织也需要为自身网络评估反滥用产品;并针对云服务等新技术以及反滥用产品自身的变化,强化了若干条建议、新增图示、删除了过时的调查内容。

适用范围(Scope)方面,文件主要聚焦于测试那些试图将邮件识别为滥用内容(垃圾邮件、恶意软件、钓鱼等)的产品或方案,因此主要适用于对单封邮件做检查并返回判定或评分的内容过滤类产品;文中讨论的技法同样可应用于 DNSBL(基于 DNS 的黑名单)等基于信誉的产品。

文件的问题意识很明确:恶意行为者投递滥用邮件的手法快速变化,导致 ISP 与企业在测试反滥用技术、寻找最有效且最准确的方案时经常遇到困难;本文档即基于成员经验给出可准确判定方案有效性的流程与技法建议。

评估规划:四类前置输入

文件把评估规划拆为四步:

  1. 确定你自己的功能需求。每位测试者的功能需求取决于既有环境、被测产品类型以及新方案需解决的具体关切点。文件给出的示例包括:托管/SaaS 型还是设备(appliance)型、硬件架构要求(如 x86 与 SPARC)、网络要求、与既有消息平台的集成与兼容性,以及误判(FP)与漏判(FN)的识别与缓解方法等。
  2. 确定业务需求。把采购与运营侧的约束(预算、合同、SLA、合规等)与技术需求并列考虑。
  3. 确定产品自身的功能需求。即产品为正常发挥效能所需要的环境与配置前提。
  4. 确定关键绩效指标(KPI)。见下一节。
七项关键绩效指标(KPI)

文件明确列出评估反滥用产品整体有效性时应确定的 KPI:

  • 过滤百分比(Filtering Percentage,即「捕获率 catch-rate」)——产品判定为滥用的流量占总流量的百分比。
  • 过滤准确率(Filtering Accuracy)——正确识别为合法或滥用的流量所占百分比。它由下述漏判率与误判率推导得出,并可能随攻击类型部署环境而变化。
  • 漏判率(False-Negative Rate)——产品未能捕获的滥用流量数量。
  • 误判率(False-Positive Rate)——被错误标记为滥用的合法流量数量。
  • 反应时间(Reaction Time)——产品对新型攻击做出反应与自适应的速度。
  • 稳定性/容错性(Stability/Fault Tolerance)——产品可能出现的故障或问题对整体服务的影响程度。
  • 消息吞吐量(Message Throughput)——产品在给定时间内可处理的流量(即每秒消息数)。

文件说明该清单并非穷尽定义,只是给出评估期间建议关注的若干领域。

执行评估:三类测试与收敛

文件指出,评估通常由整体功能测试(视产品类型决定是否含负载测试)开始,随后进行过滤准确性测试;准确性测试是两者中远为困难的一项,但通常也是测试中最受关注的部分。

  • 功能测试(Functional Testing):在确定 KPI 与需求后,先在测试环境中做初步评估,重点是确认评估前设定的功能需求,并为后续准确性测试做准备。此阶段与厂商配合把产品配置到最优状态至关重要,这样后续准确性测试才能给出可靠结果。由于本阶段不特别关注过滤准确性,大多数让测试流量通过产品的方法都可接受。文件建议使用内容多样的消息语料库——正文内容各异、包含各种邮件头、消息大小不一,并混合 HTML 内容、图片与附件;条件允许时,取自生产流量样本的语料库是最理想的。此阶段需回答三个问题:产品是否满足核心功能需求(准确性之外)?测试方与厂商是否一致认为产品配置已最优?产品是否满足所需的负载与吞吐要求?
  • 负载测试(Load Testing):在测试设备类或基于软件的内容扫描类产品时,须通过负载测试确定消息吞吐量与系统资源占用。应使用能产生足够流量的合适压测工具,多数支持 SMTP 的负载生成工具即可满足;压测所用消息样本应与功能测试相似,即内容与大小各异。
  • 准确性测试(Accuracy Testing):这是评估中最具挑战的部分,主要原因是多数测试环境的固有局限——实验室通常看不到与生产环境相同的流量,因此难以在实验室中判定产品的准确性。为此,有的组织选择用部分或分阶段的生产试运行(production trials)来衡量准确性,有的则采用把生产邮件流量导入实验室环境的技法,各有利弊。选择方法时需重点考虑两方面:一是公司政策——必须理解并纳入本组织关于「将生产系统用于评估」的政策,以及关于「测试所用邮件流量」的隐私政策;二是被测产品的类型与其所用的一般技术。

评估收尾阶段,文件建议使用决策矩阵(Decision Matrix)把功能满足度、各项 KPI 实测值与业务约束汇总打分,形成可复核的选型结论。对国内组织的实践启示是:反滥用产品选型不应只看厂商宣传的「捕获率」单一数字,而应同时约束误判率、反应时间与吞吐量,并坚持用贴近自身生产流量的语料做验证。

参考:M3AAWG《Email Anti-Abuse Product Evaluation Best Current Practices》,2019 年 3 月更新(初版 2010 年 8 月),共 10 页,文档参考地址 www.m3aawg.org/AntiAbuseProducts,PDF:m3aawg.org/sites/default/files/doc_files/m3aawg-anti-abuse-product-evaluation-2019.pdf