服务端进程运行三个月后内存从初始的 800MB 增长到 3GB,触发操作系统 OOM 杀进程导致全服掉线。内存红线管理给进程设置两道红线:黄线 800MB 触发主动回收、红线 1200MB 强制回收并通知运维排查泄漏源。
定时器每 120 秒读取一次进程内存占用,超过黄线触发增量回收、超过红线触发全量回收并邮件告警运维排查泄漏源。
setontimerex(220, 120)
function ontimer220()
local mb = math.floor(collectgarbage("count") / 1024)
if mb > 1200 then
collectgarbage("collect")
sendmail("#运维老张", 952, "内存红线告警",
"当前内存 " .. mb .. "MB,已触发全量回收", "")
sendcentermsg("服务端内存异常,正在紧急处理")
elseif mb > 800 then
collectgarbage("step")
end
end
红线告警触发后,通过对比前后两次采样的各模块内存占比来定位泄漏源,泄漏量最大的模块优先排查其全局表与缓存。
local moduleStats = {}
local function snapshotModules()
for name, size in pairs(getModuleMem()) do
local prev = moduleStats[name] or 0
moduleStats[name] = size
if size - prev > 50 then
sendcentermsg("模块 " .. name .. " 内存增长 " .. (size - prev) .. "MB")
end
end
end
模拟内存持续增长场景验证黄线与红线告警的分档触发;全量回收后核对内存回落的幅度;泄漏定位报告与实际泄漏模块比对。监控每周内存的增长趋势与回收后的回落幅度,增长趋势持续为正即立项排查泄漏。
collectgarbage("count") 返回的是 KB 而不是 MB,阈值判断时忘了除以 1024 导致红线提前触发,单位统一换算后才正确。GC 回收本身会引发一次停顿,高峰期触发全量回收导致全服卡顿 3 秒,改为低峰期定时执行。内存增长不全是 Lua 层的泄漏,C 层的怪物 AI 数据不归 Lua 管辖,单独监控 C 层内存水位。moduleStats 的快照在模块卸载后残留旧数据,对比时产生了虚假的增长差值,卸载钩子里同步清除快照。
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
实战应用:用在哪里 装备回收商 NPC 每天按评分收购玩家的装备,裁决之杖、骨玉权杖按攻击、持久加权打分,榜上只要前五名。数…
实战应用:用在哪里 沙巴克攻城是全服行会战的最高舞台:攻方砸开城门、抢占皇宫,守方依托城墙与复活点反打。规则设计的关键是节奏…
实战应用:用在哪里 影分身玩法给法师职业补上生存短板:危急时刻召唤四个影分身分担仇恨,敌人需要在六格范围内分辨真身,猜错就浪…
实战应用:用在哪里 组队邀请、行会宣战这类关键信令丢了没有兜底,玩家只能反复手点,高峰期体验很差。重试机制给信令加确认回执:…
实战应用:用在哪里 新资料片上线首日预约量常是日常十倍,一口气全开会让数据库与登录网关同时过载。滚动开区把开区动作排成队列:…
实战应用:用在哪里 百人同屏的沙巴克外围战场,每个玩家每秒跑动会触发数次位置更新,全部即时下发时广播量随人数平方增长,网关先…