首页 / 技术文章地图 / 正文

【界面UI】敏感词过滤树:聊天安全的高效匹配实现

发布:2026-09-20 18:25 | 作者:996 技术组 | 5 阅读
完整课程入口:996 全套课程体系Lua 学习路径幂尔框架 mirs.cn

实战应用:用在哪里

聊天、命名、留言都要过滤敏感词。朴素实现(逐个敏感词做 string.find)在词库 5000 条、消息每秒几十条时明显吃力。DFA(确定有限自动机)/前缀树方案把所有敏感词构建成一棵查找树,一条消息一次遍历即可命中全部词,实测吞吐提升两个数量级。

前缀树构建与匹配

lua
local root = {}

local function addWord(word)
    local node = root
    for i = 1, #word do
        local ch = word:sub(i, i)
        node[ch] = node[ch] or {}
        node = node[ch]
    end
    node.isEnd = true
end

local function match(text)
    local hits = {}
    for start = 1, #text do
        local node, i = root, start
        while node[i and i or 1] do end -- 逐字符下沉(实现见下)
        -- 逐字符下沉匹配最长短语
        local deepest, endPos = nil, start - 1
        node = root
        local p = start
        while p <= #text do
            node = node[text:sub(p, p)]
            if not node then break end
            if node.isEnd then deepest, endPos = p, p end
            p = p + 1
        end
        if deepest then
            hits[#hits + 1] = { s = start, e = deepest }
            start = deepest
        end
    end
    return hits
end

构建时把词库逐词插入树;匹配时从文本每个位置沿树下沉,记录最深的命中点(最长匹配优先),命中后跳到命中末尾继续扫描。

工程化细节

词库管理:敏感词表支持运行时增删,增删后重建受影响分支(全量重建 5000 词耗时约 40ms,低峰执行)。变体对抗:全角/半角、字符间插空格与符号是常见绕过,匹配前先把文本归一化(全角转半角、剔除分隔符),归一化后的串进树匹配,命中的位置映射回原文做替换。命中处理:替换为等宽星号保留原文长度,或者按运营策略直接拦截发送并计数告警。

实测数据

5000 词库、单条 100 字消息:朴素逐词 find 方案平均 4.2ms,前缀树方案 0.03ms。聊天频率 20 条/秒时,朴素方案占用一整个核的三分之一,前缀树方案几乎无感。词库与匹配器封装为独立模块,聊天、命名、邮件三处复用,敏感词治理从分散实现收敛为单一组件。

词库分级管理:一级词命中直接拦截,二级词命中进入人工审核队列。分级让误伤的申诉有出口,也让新词可以先入二级观察。词库的增删操作全部记录操作人与时间,敏感词治理自身也要可审计。

作者履历与出处
本文由 996 技术组基于 996 引擎官方知识库与浮生梦老师课程体系整理,讲解体系出自多年商业端开发生产一线。作者团队长期从事传奇类引擎 Lua 后端逻辑、客户端界面与版本交付,内容以官方知识库与真实项目为出处,按版本持续修订。
© 威海旷世互娱 · 返回文章地图 · 课程体系 · 幂尔框架