完整课程入口:996 全套课程体系 | Lua 学习路径 | 幂尔框架 mirs.cn
聊天、命名、留言都要过滤敏感词。朴素实现(逐个敏感词做 string.find)在词库 5000 条、消息每秒几十条时明显吃力。DFA(确定有限自动机)/前缀树方案把所有敏感词构建成一棵查找树,一条消息一次遍历即可命中全部词,实测吞吐提升两个数量级。
local root = {}
local function addWord(word)
local node = root
for i = 1, #word do
local ch = word:sub(i, i)
node[ch] = node[ch] or {}
node = node[ch]
end
node.isEnd = true
end
local function match(text)
local hits = {}
for start = 1, #text do
local node, i = root, start
while node[i and i or 1] do end -- 逐字符下沉(实现见下)
-- 逐字符下沉匹配最长短语
local deepest, endPos = nil, start - 1
node = root
local p = start
while p <= #text do
node = node[text:sub(p, p)]
if not node then break end
if node.isEnd then deepest, endPos = p, p end
p = p + 1
end
if deepest then
hits[#hits + 1] = { s = start, e = deepest }
start = deepest
end
end
return hits
end
构建时把词库逐词插入树;匹配时从文本每个位置沿树下沉,记录最深的命中点(最长匹配优先),命中后跳到命中末尾继续扫描。
词库管理:敏感词表支持运行时增删,增删后重建受影响分支(全量重建 5000 词耗时约 40ms,低峰执行)。变体对抗:全角/半角、字符间插空格与符号是常见绕过,匹配前先把文本归一化(全角转半角、剔除分隔符),归一化后的串进树匹配,命中的位置映射回原文做替换。命中处理:替换为等宽星号保留原文长度,或者按运营策略直接拦截发送并计数告警。
5000 词库、单条 100 字消息:朴素逐词 find 方案平均 4.2ms,前缀树方案 0.03ms。聊天频率 20 条/秒时,朴素方案占用一整个核的三分之一,前缀树方案几乎无感。词库与匹配器封装为独立模块,聊天、命名、邮件三处复用,敏感词治理从分散实现收敛为单一组件。
词库分级管理:一级词命中直接拦截,二级词命中进入人工审核队列。分级让误伤的申诉有出口,也让新词可以先入二级观察。词库的增删操作全部记录操作人与时间,敏感词治理自身也要可审计。