软件与互联网 · 智能运维与巡检
盼之网络利用STAROps构建智能运维体系,实现故障快速定位与主动巡检
盼之网络借助阿里云STAROps及大模型能力,构建自动化运维体系,将故障定位时长缩短50%,运维效率提升3倍,实现从被动救火到主动预防的转变。
业务效果
整体运维效率提升3倍。
未披露
业务效果
问题定位时长平均缩短50%。
未披露
业务效果
实现了从被动救火到主动防火的转变。
未披露
01
业务背景
盼之网络成立于2018年,旗下平台于2024年升级为‘盼之游戏服务’,覆盖300余款游戏,拥有千万级用户,提供账号代售、中介担保等服务。随着业务升级,公司基于云原生完成架构升级,但系统数量激增,关联关系复杂,对运维提出了更高要求。
02
遇到的问题
日常运维面临三大挑战:一是云产品使用门槛高,排查依赖专家经验,普通员工难以独立定位问题;二是风险发现滞后,团队常处于被动救火状态,缺乏主动巡检机制;三是传统AIOps方案接入成本高、周期长,难以快速落地。
03
AI 解决方案
盼之网络采用阿里云STAROps平台,参考全域运维自动化解决方案,构建了自动化运维体系。具体措施包括:利用STAROps的大模型能力,对实时推送的服务异常和告警进行智能根因分析,快速锁定问题;配置数据库、中间件等核心产品的定时巡检任务,每日自动生成巡检报告并推送至钉钉,实现风险主动发现;通过统一接入云监控2.0,利用UModel构建拓扑,内置Skill实现开箱即用,无需二次开发。
- 1将核心云产品的数据统一接入云监控2.0,并利用UModel构建服务拓扑。
- 2配置STAROps,设定异常和告警的实时推送,启用大模型根因分析功能。
- 3针对数据库、中间件等关键实例,创建定时巡检任务并设置巡检周期。
- 4将巡检报告推送至钉钉群,确保团队及时获取风险信息。
- 5通过自然语言交互方式,让运维人员直接提问,获取问题分析及解决建议。
- 6持续优化巡检规则和模型,逐步扩大覆盖范围。
04
实施结果
业务效果:整体运维效率提升3倍。
业务效果:问题定位时长平均缩短50%。
业务效果:实现了从被动救火到主动防火的转变。
业务效果:降低了云产品使用的上手门槛,减少了对资深专家的依赖。
业务效果:巡检任务覆盖核心云产品,潜在风险可提前发现并修复。
05
风险与边界
依赖阿里云平台的稳定性;大模型分析结果需要人工复核;巡检策略需不断优化以适应系统变化;数据安全与隐私保护需注意。
该案例展示了利用大模型和STAROps实现运维智能化的可行路径,对于运维团队人力紧张、系统告警频繁的企业有较高参考价值,落地门槛相对较低。
适合
系统复杂度高、运维压力大的互联网企业希望提升运维效率、减少被动救火的企业正在使用阿里云产品并寻求智能化运维方案的企业
前置条件
已有云原生架构或使用阿里云监控相关产品具备一定的数据接入基础运维团队愿意接受新工具和流程变革
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。