成功可信度高

软件与互联网 · 算力基础设施与AI平台 / 智能运维与巡检

畅捷通携手阿里云STAROps,实现AI驱动的智能运维升级

畅捷通基于阿里云云监控2.0与STAROps,构建五层可观测体系,叠加智能巡检、故障自愈与容量预测三大AI场景,SLA提升至99.995%,故障定位时间缩短至30秒内。

畅捷通发布于 2026年8月12日阅读 0

业务效果

整体SLA从99.9%提升至99.995%,年度不可用时间从近9小时压缩至不足半小时。

未披露

业务效果

故障定位时间从平均10分钟以上缩短至30秒以内,MTTK效率提升超过20倍。

未披露

业务效果

实现99%故障事前预防、10分钟内止损的目标。

未披露

01

业务背景

畅捷通是面向小微企业提供财税及业务云服务的提供商,业务覆盖五大产线、九大集群,服务数百万小微企业。核心业务已全面SaaS化和云原生改造,采用多租户、多中心架构。随着业务增长,传统运维体系暴露不足。

02

遇到的问题

原有运维监控存在三大挑战:看不见(用户体验感知滞后,底层指标正常但用户已受影响);管不住(告警泛滥,海量告警淹没核心事件,故障定位平均超10分钟);动不了(故障处置依赖个人经验,自动化止损和前置防护不足)。

03

AI 解决方案

畅捷通引入阿里云云监控2.0和STAROps,构建五层一体化可观测体系(基础、中间件、应用、业务、用户体验监控),并基于UModel构建运维数字孪生,实现故障快速定位。同时分四个阶段演进,在方法论固化后叠加AI能力,落地智能巡检、故障自愈和容量预测三大AI场景闭环,实现AI为主、人工审核的运维模式。

  1. 1建立五层监控模型,覆盖基础设施到用户体验,并实现告警聚合与根因分析。
  2. 2引入UModel运维数字孪生,构建应用-资源-租户三维拓扑,实现30秒内全链路分析。
  3. 3分阶段推进智能运维演进:体系建设、平台化、方法论固化、AI加持。
  4. 4落地智能巡检,覆盖运维风险、数据库红线、变更风险等,自动生成工单闭环。
  5. 5实施故障自愈,预定义高频故障场景的自愈策略,实现自动化执行并保留人工审核。
  6. 6部署容量预测,基于AI时序预测替代静态阈值,结合FinOps实现成本优化。

04

实施结果

业务效果整体SLA从99.9%提升至99.995%,年度不可用时间从近9小时压缩至不足半小时。

业务效果故障定位时间从平均10分钟以上缩短至30秒以内,MTTK效率提升超过20倍。

业务效果实现99%故障事前预防、10分钟内止损的目标。

业务效果运维模式实现从以人为主到AI为主、人工审核的转换,释放人力投入更高价值工作。

05

风险与边界

AI决策需要人工审核以确保可靠性;自愈策略可能误操作,需严格验证;数据隐私和安全需重视。

编辑点评 · AI 辅助生成并经审核

该案例展现了云原生与AI结合提升运维效率的典型路径,适合对可用性有高要求、已具备云原生基础的企业,可参考其分阶段演进方法论。

适合

采用云原生架构、多租户多中心的大型互联网企业有复杂运维场景、追求高可用性和自动化运维的企业已具备一定可观测基础,希望升级为智能运维的企业

前置条件

核心业务已云原生改造,采用微服务架构已有基础的监控体系和自动化工具组织具备运维开发能力和AI意识

信息来源

2 个来源

页面内容为结构化改写;关键结论应可追溯到以下材料。

02
畅捷通携手阿里云STAROps,实现AI驱动的智能运维升级

畅捷通 - 阿里云客户案例 · 2026-08-12T18:03:25.424Z

支持:案例事实来源

继续阅读

相关案例

更多软件与互联网案例
价值极高
部分达成可信度中

软件与互联网 · 企业知识库 · 2025

星环科技:AI 基础软件矩阵(TDH/Sophon LLMOps/向量库)落地金融能源政务,25Q4 营收提速

星环科技打造大数据与 AI 基础软件矩阵,涵盖 TDH 大数据平台、Sophon LLMOps 大模型运营工具、向量数据库 Hippo、知识平台 TKH。25Q4 营收 1.9-2.2 亿元、同比 +20.4%~38.9%(显著高于前三季度 7.4%),反映 AI 基础软件旺盛需求;基于海光 CPU 的 ArgoDB 联合方案在金融、能源、政务多行业落地并创 TPC-DS 性能纪录,受益于信息系统国产替代。

星环科技 · medium

更新于 2026年7月

价值中
成功可信度高

软件与互联网 · 算力基础设施与AI平台 · 2025

谷歌:自研 TPU Ironwood 推理成本较 GPU 低 30-40%,ASIC 规模化降本成基建标配

谷歌以自研 ASIC 重构 AI 算力成本。第五代 TPU Ironwood 通过架构优化形成 1.77 PB HBM3e 共享内存池与 42.5 Exaflops FP8 算力,内部实测同等负载下推理成本较 GPU 旗舰系统低 30%-40%;第五代 TPU、亚马逊 Trainium2 的单位算力成本已分别降至英伟达 H100 的 70%、60%,推动 ASIC 从可选项变为大规模应用的刚性需求。

谷歌(Google) · giant

更新于 2026年7月

价值高
成功可信度高

软件与互联网 · Agent · 2025

DeepSeek:全开源模型矩阵(价格约竞品 1/30)+ 国产芯片 day0 适配,V4 编程领先

DeepSeek 以全系列开源大模型构建高性价比 AI 生态:R1 价格约为 OpenAI o1 的 1/30,V2 价格约为 GPT-4 Turbo 的 1/70;V3.2-Exp 发布当日即实现寒武纪、华为昇腾 day0 适配,并大幅降价(API 超 50%)。据媒体报道,有望于 2 月发布的 V4 编程能力超过 Claude 与 GPT 系列。其自研 TileLang 将 CUDA/C++ 算子代码从 500 余行压缩至约 80 行、性能提升约 30%,推动国产软硬件生态去英伟达化。

DeepSeek(深度求索) · large

更新于 2026年7月