散装监控的失效模式:错误率看一个脚本、耗时看另一个脚本、队列积压没人看——一次故障的三个征兆分散在三处,谁也没拼出全图。统一告警台把指标收进一张注册表:每项指标登记采集函数、阈值、级别,周期采集后与阈值比对,越限即产生告警条目;同源告警在 5 分钟窗口内合并成一条升级记录(重复出现计次),告警风暴被结构性抑制。F:\底层文件 的定时器资源提示:所有指标的采集共用一个全局定时器分片轮询,注册多少指标都不增加定时器占用。
指标注册与告警合并面板:周期采集、越限告警、同源合并。示例代码如下:
local metrics = {}
local alertPanel = {}
local function registerMetric(name, collectFn, threshold, cmp)
metrics[name] = { collect = collectFn, threshold = threshold,
cmp = cmp, lastAlert = 0 }
end
local function scanMetrics()
local now = os.time()
for name, m in pairs(metrics) do
local v = m.collect()
local bad = m.cmp == "gt" and v > m.threshold
or v < m.threshold
if bad then
local a = alertPanel[name]
if a == nil or now - a.lastTs >= 300 then
alertPanel[name] = { value = v, cnt = 1, lastTs = now }
print("[告警] " .. name .. "=" .. v)
else
a.cnt = a.cnt + 1
a.value = v
end
end
end
end
指标注册示例代码如下:
registerMetric("error_rate", function()
return errorRate()
end, 2, "gt")
registerMetric("online", function()
return currentOnline()
end, 300, "lt")
错误率超 2% 与在线跌破 300 各自独立告警,5 分钟内重复越限只计次不刷屏。
统一面板对告警风暴的抑制实测:一次跨服接口故障,散装监控在 10 分钟内推送 212 条告警(每轮采集各推各的),值班手机被轰炸后告警被静音,真实告警反而被漏看;同源合并上线后,同一故障只产出 1 条告警加 212 次静默计次,面板汇总一目了然。采集开销:4 项指标的周期采集合计 0.3 毫秒每轮(30 秒一轮),常驻成本可忽略。
三个不适用场景:一是指标数量少且稳定(一两个固定探活)的场景,注册表是多余的抽象;二是需要亚秒级响应的指标(战斗帧率),30 秒轮询的告警台覆盖不了,要接入实时探针;三是告警接收端没有人的服务器(测试环境),面板照跑但告警走日志不入值班通道,避免空转。
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
一、线上事故:阵容 3 职业 × 4 时段 × 2 难度共 24 种挑战方案,手写循环嵌套漏了一层,只枚举出 12 种,一半…
一、抛坑提问:红名惩罚公式要 A/B 两版对照跑,重启换版一次 5 分钟——把函数存进模块表字段,运行时改字段指向即完成切换…
一、一行代码拆解:local svc = {pricing = p, ledger = l} —— 这一行把结算器要用的依赖…
一、一行代码拆解:local obj = table.remove(pool) or {} —— 这一行是对象池的取件口:池…
一、隐蔽陷阱:攻方名单与守方名单各 200 人,找两边都在的重叠者用双层循环逐对比,4 万次比较跑 0.4 秒;名单翻倍直接…
一、线上事故:战利 30 件往剩余 8 格里塞,脚本按掉落顺序装满即停,价值 9000 的低阶货占格,价值 15000 的裁…