arXiv新框架:DistilBERT+对抗训练+可解释AI,抗AI钓鱼且给出人话解释

TL;DR — 本文译自 arXiv:2511.12085(2026-02)。提出轻量钓鱼分类框架:DistilBERT(6600 万参数)经 FGM 对抗训练 + 字符级扰动增强鲁棒性,融合 LIME/SHAP/Integrated Gradients 三型 XAI,并用 Flan-T5-Small 生成通俗安全解释,弥合模型可靠性与用户信任鸿沟。

问题:Transformer 强却黑箱,且怕对抗扰动

Transformer 类模型凭借上下文理解显著提升钓鱼检测,但有两个老难题:一是敏感于对抗扰动(轻微文本修改即可误导模型),常被视为黑箱;二是 AI 生成的钓鱼内容语法完美、语境契合,进一步削弱检测器韧性。纯精度高、不可解释,难以在真实安全场景中落地——用户不信"为什么被标记"。

方法:对抗训练 + 字符级数据增强

框架选用 DistilBERT(约 6600 万参数)做分类,在效率与性能间取平衡。鲁棒性来自两层:① 单步 FGM(Fast Gradient Method)对抗训练——在嵌入层施加梯度方向扰动,使模型在受操纵时保持稳定表示;② 随机字符级扰动(插入/删除/替换)作为数据增强,模拟真实世界的字符级规避(如混淆字符、不可见字符)。两者结合,对嵌入级攻击与字符级混淆均具韧性。

可解释:三型 XAI + 小模型说人话

框架在分类管线中集成三种局部可解释技术:LIME、SHAP、Integrated Gradients(IG),量化每个 token 的归因权重,高亮对"钓鱼/合法"判定影响最大的词。再由规则化提示把"预测 + 置信度 + 高影响 token"喂给轻量指令微调模型 Flan-T5-Small,生成用户友好的安全叙述——例如"此邮件冒充 IT 支持索要凭证,关键信号为紧急语气与可疑链接"。

结果:精度与鲁棒双升

实验表明,该框架在准确率与鲁棒性上均优于未做鲁棒增强的 DistilBERT 基线。这种"分层"思路(强分类器 + 对抗鲁棒 + XAI 解释)把模型可靠性与用户信任连接起来,推动透明化钓鱼分类在邮件安全产品中的实际部署。

意义

对邮件安全运营者:可解释不是锦上添花——当用户看到"为何被拦"的通俗理由,误报投诉与绕过意愿都会下降。轻量(6600 万参数)+ 可本地部署(数据不出域)的特性,尤其适合国产化、隐私合规要求高的邮件系统。

参考来源(本文译自以下原文)

  1. Sajad U P. "A Robust and Explainable Transformer-Based Framework for Phishing Email Detection". arXiv:2511.12085 [cs.CR], v2 2026-02-06. https://arxiv.org/abs/2511.12085
  2. MITRE ATT&CK T1566: Phishing. https://attack.mitre.org/techniques/T1566/
  3. LIME — Ribeiro et al. "Why Should I Trust You?" (2016). https://arxiv.org/abs/1602.04938
← 返回行业资讯列表 更多技术前沿资讯 →