《AI十二问》第二问:当AI学会了故障自愈,会不会把真问题也当假警报杀了?
发布时间:2026-09-12 13:42 浏览量:1
引子:从“修”到“自愈”
《AI十二问》第一问聊的是AI怎么帮你排查故障,这一问要聊的是——如果干脆把修故障的权力也交给它,会怎样?
故障自愈听起来很美:系统自己感知异常,自动完成修复,人不必半夜爬起来盯告警。但我在自己的环境做过不少模拟实测,越往下测,越能看见这件事背面隐藏的风险。
《AI十二问》第二问:当AI学会了故障自愈,会不会把真问题也当假警报杀了?
故障自愈,是运维圈子很诱人的想象:系统自己感知异常,自动完成修复,人不必半夜爬起来盯告警。
随着大模型接入监控体系,这个设想离现实越来越近。我在自己的环境做过不少模拟实测,越往下测,越能看见这件事背面隐藏的风险。
真实线上环境告警本身就充满噪音。爬虫瞬时涌入、访问脉冲、第三方接口抖动,都会触发警报,很多只是临时扰动;但也有一部分告警,是系统逐步恶化的早期信号。
交给AI去自动甄别告警,模型依靠历史样本学习区分故障与波动。但线上总会出现训练样本从来没有见过的新状况。为了压低告警打扰,系统会生出一种危险倾向:把真实隐患归类为普通流量扰动,直接静默屏蔽。监控面板一片祥和,可病根还埋在系统内部慢慢发酵,等到彻底爆发,问题已经被掩盖很久。
我做模拟测试就遇到过类似情形:流量突然冲高,AI判定资源不足,自动执行扩容脚本。高峰仅仅持续四十分钟,扩容实例却连续跑了十几个小时,产生额外成本。更值得警惕的场景,是服务出现内存泄漏,AI检测到异常就自动拉起重启,日志打印一行“自动恢复成功”。表面一切正常,但内存泄漏的根源没有消除,问题被一次次止血,却始终没有缝合伤口,隐患不断积累。
后来我跟一个做运维的老朋友聊起这个事。他说了一句话我记到现在:
自动化最大的风险,不是它做错了什么,是它做对了之后,你就不再看了。
传统运维里,故障意味着“有事发生”,人会紧张、会追查、会复盘。但故障自愈把“有事发生”变成了“没事了”——服务自动恢复了,人看不到告警,也失去了追问的习惯。偶尔在日志里瞥见一行“自动恢复成功”,只是瞄一眼就翻过去了,心想“反正它自己处理了”。但那些被掩盖的问题,就一点点沉淀下来。
内存泄漏多撑了一个月才爆,数据库连接池老化到很多次重启才露出马脚,一个配置错误反复被回滚了很多次才引起注意。每次重启都是一次止血,没人去缝针。直到大出血的那天,才发现伤口早就在了。
故障自愈不等于简单地发现问题、解决问题。它需要分辨何为临时波动,何为溃烂的开端;哪些可以自动处置,哪些必须唤醒人介入。模型可以持续优化判断概率,但做不到百分之百不出错。
自动化自愈可以承接一部分简单已知故障。但面对陌生异常、历史遗留带来的复杂问题,盲目的自动处置,反而会掩盖问题。自动化只能做第一道过滤网,关键异常,仍然要人把关。
——
阿荣
2026年8月,成都
关于阿荣
阿荣(孙晋荣),风尚中国创始人,珠宝鉴定师,资深产业媒体人。
三十年珠宝鉴定经验,二十三年产业媒体深耕,曾就职于计算机世界、中国房地产报等。
2008年创办风尚中国至今十八年。主导创作《钻石十二问》《翡翠十二问》《奢侈品十二问》及「阿荣手记」系列内容,坚持“不站队、只讲真相”的创作原则,践行“赶路,不必赶”的长期主义。