深夜,手机震动,上百条数据库告警短信涌来——这是古茗科技集团运维负责人刘星光的常态。全国上万家门店,每一杯奶茶的下单、库存调度、会员积分、联名营销,都跑在100多个数据库实例上:RDS、Redis、MongoDB、PolarDB,类型繁杂。门店扩张、订单增长、联名活动频率翻倍,尖刺流量来去匆匆,而支撑这一切的DBA团队只有几个人。

刘星光坦言,团队每天70%的时间耗在「接警—登跳板机—看Process List—定位问题」的循环里,告警只是通知有人出了问题,真正解决还得靠人肉排查。这种「告警找人」的模式,在万店规模下已经逼近极限——告警太多,人不够用,响应速度跟不上业务节奏。
古茗的解法是引入AI Agent,让机器先接手一部分运维工作。核心思路不再是「告警通知人」,而是「Agent先接手」:告警触发后,Agent自动登录跳板机、查看进程列表、分析慢查询、定位可能的根因,甚至直接执行一些低风险的恢复操作,只有遇到无法处理的疑难杂症,才升级给人。这样一来,DBA从重复的「接警—排查」中解放出来,把精力放到更复杂的架构优化和故障预防上。
这套逻辑的关键在于「信任边界」:哪些操作Agent可以自主执行,哪些必须经过人审批?古茗的做法是分层授权——只读诊断完全自动化,写操作或高危变更仍需人工确认。同时,Agent的决策过程全程留痕,方便事后审计和复盘。
从行业视角看,古茗的实践代表了一种趋势:AI to B不再停留在「智能告警」或「辅助分析」,而是真正进入「执行层」,承担起一部分运维操作。这降低了运维团队应对突发流量的人力门槛,也让「万店运维」这种极端场景有了可持续的方案。当然,Agent的可靠性仍需长期验证,但至少在古茗的案例里,它已经让深夜的手机震动少了一些。
(编辑评论:AI Agent 进入运维执行层,意味着企业级AI应用从「建议者」向「操作者」迈进,但信任和审计机制仍是落地的前提。)
