其他行业 · AI应用
Sprinklr 在 AWS Inferentia 上降低机器学习推理成本
Sprinklr 面临传统GPU实例上机器学习推理的高成本和延迟问题。为此,他们迁移到了由 AWS Inferentia 驱动的 Amazon EC2 Inf1 实例,这些实例专为高性能机器学习工作负载设计。这一战略转变使延迟降低了超过30%,同时 Sprinklr 每天可处理约100亿次预测,覆盖500多个模型。这一迁移不仅带来了显著的成本节约,还通过提升其 Unified-CXM 平台的性能改善了客户体验,并实现了两周内快速部署模型。
推理延迟
降低超过30%
来源披露
成本节约
显著节约
来源披露
模型部署时间
两周内
来源披露
01
业务背景
Sprinklr 面临传统GPU实例上机器学习推理的高成本和延迟问题。为此,他们迁移到了由 AWS Inferentia 驱动的 Amazon EC2 Inf1 实例,这些实例专为高性能机器学习工作负载设计。这一战略转变使延迟降低了超过30%,同时 Sprinklr 每天可处理约100亿次预测,覆盖500多个模型。这一迁移不仅带来了显著的成本节约,还通过提升其 Unified-CXM 平台的性能改善了客户体验,并实现了两周内快速部署模型。
02
遇到的问题
Sprinklr 在基于 GPU 的 Amazon EC2 实例上运行机器学习推理工作负载,面临高计算成本和较高延迟,影响了成本效益和客户体验。
03
AI 解决方案
将 Unified-CXM 平台上的延迟敏感型推理工作负载从 GPU 实例迁移到基于 AWS Inferentia 的 Amazon EC2 Inf1 实例,利用片上内存和 NeuronCore 加速推理并降低成本;逐步迁移了文本、计算机视觉等模型,并优化部署流程,实现两周内快速上线。
- 12021年7月开始测试 Amazon EC2 Inf1 实例。
- 2运行基准测试,验证延迟降低超过30%后,决定将所有延迟优化型工作负载迁移到 Inf1。
- 3首批迁移约20个模型,随后扩展至计算机视觉和文本模型。
- 4优化部署流程,使单模型部署周期缩短至两周以内。
04
实施结果
推理延迟:降低超过30%(超过30%)
成本节约:显著节约(未量化)
模型部署时间:两周内(缩短至两周内)
每日推理处理量:约100亿次预测
05
风险与边界
未披露
“The goal is always to have lower latency, which means a better customer experience. Using Amazon EC2 Inf1 Instances, we are able to achieve that.”
Jamal Mazhar · Vice President of Infrastructure and DevOps, Sprinklr
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。