其他行业 · AI应用
使用Amazon SageMaker加速大语言模型
Cisco面临在其应用中部署大语言模型(LLM)时推理成本高、效率低的问题。为此,该公司将LLM迁移至Amazon SageMaker,并使其与Amazon EKS上的应用解耦。这一战略分离增强了可扩展性并优化了资源分配,显著缩短了应用启动时间。结果,Cisco实现了更快的开发和部署周期,并通过异步推理大幅节省成本。整体上,该方法使Cisco在管理运营支出的同时更有效地利用先进AI能力。
应用启动时间
显著缩短
来源披露
成本节省
通过异步推理将端点缩放到零,在不影响可用性的前提下节省成本
来源披露
开发与部署周期
显著加速,实验速度提升
来源披露
01
业务背景
Cisco面临在其应用中部署大语言模型(LLM)时推理成本高、效率低的问题。为此,该公司将LLM迁移至Amazon SageMaker,并使其与Amazon EKS上的应用解耦。这一战略分离增强了可扩展性并优化了资源分配,显著缩短了应用启动时间。结果,Cisco实现了更快的开发和部署周期,并通过异步推理大幅节省成本。整体上,该方法使Cisco在管理运营支出的同时更有效地利用先进AI能力。
02
遇到的问题
Cisco的Webex团队将大语言模型(LLM)嵌入Amazon EKS上的容器镜像中,导致资源需求大、效率低、成本高,且LLM拖慢了资源分配和应用启动速度。
03
AI 解决方案
将LLM与应用程序解耦,把模型迁移到Amazon SageMaker端点,应用继续在Amazon EKS上运行。集成NVIDIA Triton Inference Server实现模型并发和全球扩展;利用SageMaker异步推理,根据推理请求自动伸缩端点(包括缩至零)以节省成本;2023年11月采用多模型端点功能,进一步提升近实时推理的资源效率。
- 1在多个环境中测试Amazon SageMaker
- 2将跨越3个环境和10多个应用的大型模型快速迁移到SageMaker端点,与EKS上的应用分离
- 3采用NVIDIA Triton Inference Server,支持模型并发并在全球AWS数据中心扩展
- 4配置SageMaker异步推理,使端点根据请求流量自动扩展并在无请求时缩减至零,以降低闲置成本
- 52023年11月启用多模型端点功能,将多个模型部署在单一端点之后,提升扩展速度和响应时间并节省额外成本
04
实施结果
应用启动时间:显著缩短(缩短)
成本节省:通过异步推理将端点缩放到零,在不影响可用性的前提下节省成本(节省)
开发与部署周期:显著加速,实验速度提升(加速)
多模型端点效率:额外成本节省,更快扩展,更好响应时间(提升)
05
风险与边界
未披露
“AWS services are reliable and cost effective. We have a lot of options for using our resources efficiently.”
Travis Mehlinger · Principal Engineer at Cisco
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。