软件与互联网 · 智能运维与巡检 / 算力基础设施与AI平台
畅捷通携手阿里云STAROps实现AI驱动智能运维升级,SLA提升至99.995%
畅捷通基于阿里云云监控2.0与STAROps,构建五层可观测体系与运维数字孪生,落地智能巡检、故障自愈、容量预测三大AI场景,实现SLA从99.9%提升至99.995%,故障定位时间缩短至30秒内。
业务效果
整体SLA从99.9%提升至99.995%,年度不可用时间从近9小时降至不足半小时。
未披露
业务效果
故障定位时间从平均10分钟以上压缩至30秒以内,MTTK环节效率提升20倍。
未披露
业务效果
达成99%故障事前预防、10分钟内止损的目标。
未披露
01
业务背景
畅捷通是国内领先的小微企业财税及业务云服务提供商,业务覆盖五大产线、九大集群,服务数百万小微企业。核心业务已全面SaaS化并完成云原生改造,采用多租户、多中心架构。随着客户规模增长和架构复杂化,传统运维监控体系面临挑战。
02
遇到的问题
原有监控体系存在三大难题:一是用户体验感知缺失,底层资源监控正常但用户侧问题频发,难以主动发现;二是告警泛滥且缺乏分级聚合,故障定位平均耗时超过10分钟;三是处置依赖人工经验,自动化预案和前置预防不足,导致故障恢复周期长。
03
AI 解决方案
畅捷通采用阿里云云监控2.0与STAROps平台,分四阶段推进智能运维演进:首先建设基础监控体系,其次平台化提升,然后沉淀方法论,最后叠加AI能力。核心方案包括:构建五层一体化可观测体系(基础、中间件、应用、业务、用户体验),引入UModel运维数字孪生建立三维拓扑;落地智能巡检、故障自愈、容量预测三大AI场景,实现告警降噪、根因分析、自动止损;通过AI大模型与自动化流程结合,形成'感知-分析-决策-执行'闭环。
- 1建设五层监控模型,覆盖基础设施到用户体验,实现全域数据采集。
- 2引入UModel数字孪生,构建应用-资源-租户拓扑,实现告警下钻与根因定位。
- 3分四阶段演进:先建体系,再平台化,然后固化方法论,最后叠加AI能力。
- 4落地智能巡检场景,自动扫描风险并生成工单闭环。
- 5实施故障自愈,预定义策略并自动化执行,人工审核兜底。
- 6部署容量预测与成本管控,AI预测趋势并优化资源。
04
实施结果
业务效果:整体SLA从99.9%提升至99.995%,年度不可用时间从近9小时降至不足半小时。
业务效果:故障定位时间从平均10分钟以上压缩至30秒以内,MTTK环节效率提升20倍。
业务效果:达成99%故障事前预防、10分钟内止损的目标。
业务效果:运维模式从'以人为主'转向'AI为主、人审核',释放人力投入高价值工作。
业务效果:形成可观测数据→AI分析→自动化动作→知识沉淀的正循环,系统越用越智能。
05
风险与边界
AI模型依赖数据质量,初期需要大量标注和调优;自动化自愈需谨慎设计,避免误操作;组织需适应新的运维模式,人员技能转型有挑战。
该案例展示了从传统运维向智能运维演进的完整路径,通过分阶段建设逐步叠加AI能力,实现可用性跃升。适合希望系统性提升运维智能化水平的云原生企业,但需长期投入和持续优化。
适合
拥有复杂云原生架构、多租户环境的中大型企业对服务可用性要求高、希望提升运维效率的组织已具备一定自动化基础,希望进一步引入AI能力的企业
前置条件
完成云原生或SaaS化转型具备统一监控数据采集能力有明确的运维流程和应急预案
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。