汽车 · 智能运维与巡检 / 算力基础设施与AI平台
吉利汽车构建全域智能运维体系,实现故障主动免疫
吉利汽车携手阿里云基于 STAROps 打造智能运维体系,通过统一可观测数据底座、运维数字孪生和智能诊断,解决报警风暴和根因定位难题,实现从被动响应到主动免疫的转变。
运维链路重构
从“监控-报警-工单”转为“可观测数据-统一建模-智能体诊断-自动治愈”。
未披露
业务效果
运维团队角色转型为平台运营者,专注架构规划。
未披露
业务效果
一线团队从对AI不信任到积极采纳智能运维。
未披露
01
业务背景
吉利汽车自成立以来以“让世界充满吉利”为愿景,致力于打造智能精品车。自2021年起,吉利与阿里云合作推进云原生改造。随着极氪并入吉利集团以及核心应用统一技术栈,吉利汽车用户数据中心承载的系统规模与复杂度持续攀升,现有运维体系面临巨大压力。
02
遇到的问题
业务快速发展导致系统规模指数级增长,运维复杂度显著提升。具体表现为:数百个系统分布在多云、跨机房环境,拓扑不透明,日志、链路、指标数据各自为政,难以关联分析;故障时监控屏涌现大量告警,根因定位困难,平均恢复时间长达一两个小时;传统方案难以支撑“1分钟发现、5分钟定位、30分钟恢复”的黄金 SLA,影响面向用户的实时业务。
03
AI 解决方案
吉利基于阿里云可观测产品构建“数据-建模-诊断-沉淀”四层智能运维体系。首先,基于云监控2.0统一存储和分析指标、日志、链路等异构数据,形成统一可观测数据底座。其次,利用UModel自动为云资源建模并跨域关联,支持内嵌业务模型,让智能体理解IT世界。然后,智能诊断与告警降噪:智能体自动收集证据、分析影响范围,快速过滤无用告警,提供排查思路。最后,将治愈模块标准化供模型调用,通过STAROps的Skill机制沉淀Runbook和应急策略,形成闭环。
- 1构建统一可观测数据底座,整合指标、日志、链路、事件等数据。
- 2基于UModel建立运维数字孪生,自动建模并关联资源。
- 3部署智能诊断模块,自动分析告警和异常,定位根因。
- 4将治愈模块标准化,结合STAROps Skill机制沉淀运维经验。
- 5逐步推广智能运维能力,覆盖更多业务场景。
04
实施结果
运维链路重构:从“监控-报警-工单”转为“可观测数据-统一建模-智能体诊断-自动治愈”。
业务效果:运维团队角色转型为平台运营者,专注架构规划。
业务效果:一线团队从对AI不信任到积极采纳智能运维。
业务效果:测试环境联调成为高性价比场景,降低沟通成本。
05
风险与边界
智能运维依赖数据质量和模型准确性,初期可能出现误报或漏报;需要团队适应新的工作流程,加强AI信任建设;跨系统数据整合涉及安全与隐私问题。
该案例展示了智能运维在大型制造企业中的落地路径,通过数据整合与AI诊断提升运维效率,值得类似规模企业借鉴。
适合
大型企业,系统复杂、多云环境对业务连续性要求高的行业,如汽车、金融已有一定运维自动化基础的企业
前置条件
统一可观测数据平台建设多云环境数据整合能力运维团队具备数据分析和研发能力
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。