硬盘故障导致宕机 4 小时:SMART 硬件预警其实提前两天就在机器日志里,但没人接监控;故障后备机切换靠运维远程手工操作耗时 2 小时;切换完成后对账发现宕机窗口漏了 17 笔交易记录。复盘的三项修复:硬件指标接入告警台、备机切换自动化、切换后强制对账补漏。
切换后对账与补录:窗口期交易比对、缺口补写。示例代码如下:
local function reconcileAfterFailover(fromTs, toTs)
local primary = queryMaster("SELECT id,amount FROM trades WHERE ts BETWEEN " ..
fromTs .. " AND " .. toTs)
local backup = queryBackup("SELECT id,amount FROM trades WHERE ts BETWEEN " ..
fromTs .. " AND " .. toTs)
local missing = {}
for _, p in ipairs(primary) do
local found = false
for _, b in ipairs(backup) do
if b.id == p.id then
found = true
break
end
end
if not found then
missing[#missing + 1] = p
end
end
for _, m in ipairs(missing) do
insertBackup(m.id, m.amount)
end
return #missing
end
接入告警台的硬件探测示例代码如下:
registerMetric("disk_health", function()
return diskSmartStatus()
end, 1, "lt")
SMART 状态低于阈值 1 即告警,硬盘报废前两天就有预警窗口完成切换演练。
reconcileAfterFailover 以主库为准反查备库缺口(宕机窗口内的 17 笔交易在主库恢复后可查、备库缺失),逐条补写后返回补录数量。registerMetric 复用监控告警台的注册表,把硬件指标纳入统一面板——SMART 预警从此与业务告警同屏可见。
宕机复盘踩过三个坑:一是备机数据滞后主库几分钟,切换瞬间这几分钟的交易在备库侧不存在,对账窗口必须覆盖"末次同步到切换完成"的完整区间;二是切换后 IP 漂移,部分客户端缓存了旧地址连不上,切换脚本要同步更新域名解析并压缩 TTL;三是复盘报告写完归档无人再读,三项修复的执行状态要进变更跟踪,下次演练逐项核销。
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
一、抛坑提问:名单展示要给隐私留余地,"裁决之杖"持有者的名字怎么打码?保留首尾字符中间换星,长度自适应,规则统一进一个函数…
一、一行代码拆解:DEG[dep] = (DEG[dep] or 0) + 1 —— 这一行统计每个脚本被依赖的入度:入度清…
一、隐蔽陷阱:5000 人里选前 10,全量 sort 再取头——n log n 白花;只要前 K 名时,维护一张 K 大小…
一、线上事故:全服 5000 名玩家状态挤一张大表,pairs 巡检一遍 5000 项耗时 120 毫秒,撞上主循环就是一次…
一、线上事故:装备合成链 A 吃 B、B 吃 A,合成脚本顺着链找源头,死循环 8 万次后栈爆,M2 卡死 40 秒;数据带…
一、抛坑提问:战报里直接写 os.time() 的原始秒数 1758849600,谁能看懂?按"3 分钟前""2 小时前"分…