贝叶斯垃圾邮件过滤是如何工作的?如何调优降低误报?
1
贝叶斯垃圾邮件过滤是如何工作的?如何调优降低误报?
▼
原理
贝叶斯过滤以词(token)在垃圾/非垃圾两类的条件概率为基础,依贝叶斯定理计算邮件为垃圾的后验概率。它从用户已标注样本自学习,个性化强,是内容过滤的经典方法。
训练
需提供“已标垃圾”与“已标正常”两套语料训练;过滤器统计每个 token 的 P(垃圾|token) 与 P(正常|token)。新邮件对各 token 概率取对数求和得总分。RFC 2505 将内容过滤列为反垃圾手段之一。
调优
用更丰富的近义词表、忽略高频无区分度词、对 HTML/URL 结构特征加权;定期用最新样本再训练;设阈值并保留“疑似”队列人工复核,降低误杀正常邮件(false positive)。
局限
纯贝叶斯易被“贝叶斯毒化”(在垃圾中混入正常词)绕过;应作为多层防御的一环,与 DNSBL、发信认证、速率限制结合,而非单独依赖。
参考:RFC 2505(反垃圾邮件建议);贝叶斯内容过滤实践
