软件与互联网 · 算力基础设施与AI平台 / 智能运维与巡检
畅捷通携手阿里云STAROps,实现AI驱动的智能运维升级
畅捷通基于阿里云云监控2.0与STAROps,构建五层可观测体系,叠加智能巡检、故障自愈与容量预测三大AI场景,SLA提升至99.995%,故障定位时间缩短至30秒内。
业务效果
整体SLA从99.9%提升至99.995%,年度不可用时间从近9小时压缩至不足半小时。
未披露
业务效果
故障定位时间从平均10分钟以上缩短至30秒以内,MTTK效率提升超过20倍。
未披露
业务效果
实现99%故障事前预防、10分钟内止损的目标。
未披露
01
业务背景
畅捷通是面向小微企业提供财税及业务云服务的提供商,业务覆盖五大产线、九大集群,服务数百万小微企业。核心业务已全面SaaS化和云原生改造,采用多租户、多中心架构。随着业务增长,传统运维体系暴露不足。
02
遇到的问题
原有运维监控存在三大挑战:看不见(用户体验感知滞后,底层指标正常但用户已受影响);管不住(告警泛滥,海量告警淹没核心事件,故障定位平均超10分钟);动不了(故障处置依赖个人经验,自动化止损和前置防护不足)。
03
AI 解决方案
畅捷通引入阿里云云监控2.0和STAROps,构建五层一体化可观测体系(基础、中间件、应用、业务、用户体验监控),并基于UModel构建运维数字孪生,实现故障快速定位。同时分四个阶段演进,在方法论固化后叠加AI能力,落地智能巡检、故障自愈和容量预测三大AI场景闭环,实现AI为主、人工审核的运维模式。
- 1建立五层监控模型,覆盖基础设施到用户体验,并实现告警聚合与根因分析。
- 2引入UModel运维数字孪生,构建应用-资源-租户三维拓扑,实现30秒内全链路分析。
- 3分阶段推进智能运维演进:体系建设、平台化、方法论固化、AI加持。
- 4落地智能巡检,覆盖运维风险、数据库红线、变更风险等,自动生成工单闭环。
- 5实施故障自愈,预定义高频故障场景的自愈策略,实现自动化执行并保留人工审核。
- 6部署容量预测,基于AI时序预测替代静态阈值,结合FinOps实现成本优化。
04
实施结果
业务效果:整体SLA从99.9%提升至99.995%,年度不可用时间从近9小时压缩至不足半小时。
业务效果:故障定位时间从平均10分钟以上缩短至30秒以内,MTTK效率提升超过20倍。
业务效果:实现99%故障事前预防、10分钟内止损的目标。
业务效果:运维模式实现从以人为主到AI为主、人工审核的转换,释放人力投入更高价值工作。
05
风险与边界
AI决策需要人工审核以确保可靠性;自愈策略可能误操作,需严格验证;数据隐私和安全需重视。
该案例展现了云原生与AI结合提升运维效率的典型路径,适合对可用性有高要求、已具备云原生基础的企业,可参考其分阶段演进方法论。
适合
采用云原生架构、多租户多中心的大型互联网企业有复杂运维场景、追求高可用性和自动化运维的企业已具备一定可观测基础,希望升级为智能运维的企业
前置条件
核心业务已云原生改造,采用微服务架构已有基础的监控体系和自动化工具组织具备运维开发能力和AI意识
信息来源
2 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。