装备搭配的最优组合是组合爆炸:20 件挑 6 件约 3.8 万种组合,叠加多约束后枚举不可行。模拟退火借冶金退火的隐喻:从随机解出发反复微调,新解更好就接受、更差按温度概率接受——温度高时敢跳出局部最优,温度逐轮下降后趋于收敛。它在"探索"与"收敛"之间动态平衡,用可控的计算量求近似最优解。
评分函数。示例代码如下:
local function score(cfg)
return cfg.atk * 2 + cfg.hp - math.abs(cfg.atk - cfg.hp) * 0.5
end
退火主循环。示例代码如下:
local function anneal(init, iterations)
local cur = { atk = init.atk, hp = init.hp }
local best = { atk = cur.atk, hp = cur.hp }
local temp = 100
for i = 1, iterations do
local cand = {
atk = math.max(0, cur.atk + math.random(-20, 20)),
hp = math.max(0, cur.hp + math.random(-20, 20))
}
local d = score(cand) - score(cur)
if d > 0 or math.random() < math.exp(d / temp) then
cur = cand
if score(cur) > score(best) then
best = { atk = cur.atk, hp = cur.hp }
end
end
temp = temp * 0.99
end
return best
end
print(anneal({ atk = 100, hp = 100 }, 5000).atk)
沙巴克攻城前的配装决策:从随机加点出发 5000 轮退火,温度从 100 按 0.99 衰减——前段敢跳出局部最优,后段精细收敛。
枚举 20 选 6 的全部组合约 3.8 万次评分;退火 5000 轮即 5000 次评分,解通常落在最优的 95% 以上——单次评分成本相同时,退火用约 13% 的计算量拿到"够好"的解。每轮成本为一次扰动加一次评分,微秒级。
三个不适用场景:一是有精确多项式解的简单问题,退火是杀鸡用牛刀;二是评分曲线平坦(解之间区分度低),退火与随机猜测无差别;三是需要证明最优性的场合,退火只保证近似、不保证最优。
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
【语法】 一、隐蔽陷阱 任务链按 next 映射逐格跳转,怀疑某条链绕回了旧节点。用 visited 表记录走过的节点能判环…
【游戏】 一、业务场景 交易行里有人收了定金就消失,买家吃闷亏还没处查底细。信用分规则上线:每笔成交双方互评,好评加 2 分…
【语法】 一、隐蔽陷阱 运营报表里"截止第 3 关的最高分"显示 40,可那一批数据里确实出过 120。数据没丢,问题出在统…
【游戏】 一、业务场景 玩家反映:花 30 金锭重随一件武器,好不容易出了一条攻击加成,下一轮重随又把它洗没了,连洗 8 次…
【语法】 一、隐蔽陷阱 把 1000 个金币打包成不超过 25 个包裹,单包容量多大才够?从 1 开始逐个容量去试要跑上千次…
【游戏】 一、业务场景 帮会仓库积了 80 万资金,帮众修装备要借钱,之前的写法是谁申请谁直接扣款,一周被冒领 12 万。资…