私聊的敏感词过滤用 DFA(确定有限自动机)算法实现:比逐词遍历的效率高一个量级,千字消息的匹配耗时在微秒级。DFA 的构建将敏感词库编译成状态转移表,匹配时一次遍历完成所有词的检测。
---DFA 自动机的构建
function DFA.build(wordList)
local root = {}
for _, word in ipairs(wordList) do
local node = root
for i = 1, #word do
local ch = string.sub(word, i, i)
node.children = node.children or {}
node.children[ch] = node.children[ch] or {}
node = node.children[ch]
end
node.isEnd = true
end
return root
end
DFA 的构建将词库编译成树形结构:每个字符是一个状态节点,词尾节点标记 isEnd。匹配时从根节点出发逐字符跳转,到达 isEnd 节点即命中的敏感词。DFA 的匹配效率与文本长度线性相关,与词库大小无关。
---DFA 匹配:检测文本中的敏感词
function DFA.match(dfa, text)
local node = dfa
local start = 1
for i = 1, #text do
local ch = string.sub(text, i, i)
if node.children and node.children[ch] then
node = node.children[ch]
if node.isEnd then
return true, start, i
end
else
node = dfa
start = i + 1
end
end
return false
end
DFA 的匹配逐字符推进:字符匹配到子节点则深入,不匹配则回退到根节点重新开始。命中的位置与长度记录用于后续的遮罩处理。私聊的敏感词过滤与世界频道共用同一个 DFA 实例,词库的热更新让新词的封堵分钟级生效。DFA 的内存占用与词库大小成正比,万级词库的内存占用在几 MB 的量级。
DFA 的匹配性能与词库大小的比值监控,性能的退化触发树结构优化。
DFA 的匹配曾经漏掉了跨字节的 UTF-8 字符,中文的敏感词按字节截取导致断码,UTF-8 的字符级遍历替代字节级遍历修复。DFA 的构建在词库更新时全量重建,万级词库的重建耗时百毫秒,增量更新(只加不减)的优化让热更新不影响匹配。
DFA 的词库来源多元化:官方词库、玩家举报新词、变体训练集三渠道汇入,词库的更新走审批后热加载。DFA 的匹配结果进审计日志,命中的词与上下文留存 7 天供复核。私聊的敏感词过滤与世界频道共用同一个 DFA 实例,词库的热更新让新词的封堵分钟级生效。
本文由 996 技术组基于 996 引擎官方知识库与浮生梦老师课程体系整理。团队长期从事传奇类引擎 Lua 后端逻辑、客户端界面与商业版本交付,内容以官方知识库与真实项目为出处,按版本持续修订。
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
设计初衷 单抽与十连卖的是一个奖池,买的是两种心情:单抽是概率的刺激,十连是确定的体面。数值设计要回答三问:十连的保底值多少…
设计初衷 裁决之杖能走三条养成线:强化加攻击、精炼加防御、铭刻加特殊词条。玩家资源有限,三线齐开的结果是每条都浅、战力密度稀…
底层原理 缓存的两难:无上限则内存失控,弱引用交给 GC 又没有容量语义(上轮弱表方案的短板正是无法承诺"最多占多少")。L…
底层原理 固定周期刷新(祖玛教主每 14400 秒一只)有个致命副作用:全程可预测。蹲点脚本掐着表守在刷新点,普通人永远抢不…
设计初衷 挂机与副本的产出没有天花板时,肝帝一天刷出普通人一周的产能,经济投放失控、玩家差距撕开。疲劳值的立场不是禁止而是衰…
业务场景 活动发"沙巴克功勋"称号,7 天有效。散装写法只发不收,到期后称号属性一直挂着,白嫖队列越排越长;补收又靠每日扫描…