软件与互联网 · 智能运维与巡检 / 算力基础设施与AI平台
精臣智慧借助阿里云 STAROps 实现 AI 智能运维转型
精臣智慧利用阿里云 STAROps 构建全域智能运维体系,通过 AI 实现业务系统拓扑自动生成与故障根因智能分析,将运维效率提升超15倍,MTTR缩短至分钟级。
业务效果
业务系统全链路拓扑图构建由人工3-5天缩短至4小时,效率提升超15倍。
未披露
业务效果
故障恢复时间(MTTR)从数十分钟级缩短至分钟级。
未披露
业务效果
运维团队从被动响应转向主动巡检,将更多精力投入架构优化。
未披露
01
业务背景
精臣智慧是一家提供智能标签打印硬件及云服务的企业,业务遍及全球,拥有超过2200万用户。随着业务快速增长和全球化布局,IT系统规模急剧扩大,运维复杂度大幅提升。原有依赖人工运维的方式难以应对新的挑战,亟需更智能、自动化的运维体系。
02
遇到的问题
面临的核心问题:1) 业务系统拓扑复杂,应用间依赖关系不清晰,人工梳理效率低下;2) 多维度观测数据(如指标、日志、链路)采集不完整,且难以关联分析;3) 告警噪音多,故障发生时产生'告警风暴',难以快速定位根因,恢复耗时长达数十分钟,严重影响业务可用性。
03
AI 解决方案
基于阿里云 STAROps 构建全域智能运维体系:1) 利用云监控统一采集和存储指标、日志、链路等多维度数据;2) 通过 UModel 实现运维数字孪生,自动生成应用内及云资源依赖的全链路拓扑图;3) 引入智能根因分析,自动关联上下游链路与观测数据,提供诊断结论;4) 通过 OpenAPI 集成自建 SRE 平台,实现一键诊断和流式结果展示。
- 1统一采集与存储多维可观测数据,构建数据基础。
- 2利用 UModel 自动建模业务系统,生成实时拓扑图。
- 3配置智能告警与自动根因分析。
- 4通过 OpenAPI 将 STAROps 对接至自建 SRE 平台。
- 5在 SRE 平台内部署闭环诊断流程,并持续优化。
04
实施结果
业务效果:业务系统全链路拓扑图构建由人工3-5天缩短至4小时,效率提升超15倍。
业务效果:故障恢复时间(MTTR)从数十分钟级缩短至分钟级。
业务效果:运维团队从被动响应转向主动巡检,将更多精力投入架构优化。
05
风险与边界
AI 诊断结果可能受数据质量影响,需要持续优化模型和观测数据采集;初始部署和系统集成有一定技术门槛。
精臣案例展示了 AI 在运维领域的典型应用,通过构建数字孪生和智能根因分析,显著提升排障效率。适合有类似痛点的企业借鉴。
适合
面向业务系统复杂、运维压力大的中大型互联网企业希望将传统运维升级为 AI 运维的企业
前置条件
需具备完整的可观测数据基础需要云环境或混合云部署
信息来源
2 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。