其他行业 · AI应用
Mazzuma使用Amazon SageMaker上的DeepSpeed ZeRO将训练时间从23小时缩短至30分钟
Mazzuma是一家位于加纳的初创公司,面临模型训练时间过长的问题,这阻碍了其生成式AI应用MazzumaGPT的开发进程,该应用旨在帮助开发人员高效编写代码。为解决此问题,团队采用了Amazon SageMaker上的DeepSpeed ZeRO,从而显著优化了训练工作流。结果,他们将训练时间从23小时缩短至仅30分钟,并在六个月内训练了35个模型。这一转变不仅提高了运营效率,还实现了延迟降低40%和每秒处理800个token的出色能力,增强了其AI解决方案的整体性能。
训练模型数量
35
来源披露
单次模型训练时间
30分钟
来源披露
推理延迟
降低40%
来源披露
01
业务背景
Mazzuma是一家位于加纳的初创公司,面临模型训练时间过长的问题,这阻碍了其生成式AI应用MazzumaGPT的开发进程,该应用旨在帮助开发人员高效编写代码。为解决此问题,团队采用了Amazon SageMaker上的DeepSpeed ZeRO,从而显著优化了训练工作流。结果,他们将训练时间从23小时缩短至仅30分钟,并在六个月内训练了35个模型。这一转变不仅提高了运营效率,还实现了延迟降低40%和每秒处理800个token的出色能力,增强了其AI解决方案的整体性能。
02
遇到的问题
模型训练时间过长,原始训练时间为23-24小时,阻碍了生成式AI应用MazzumaGPT的开发进程。
03
AI 解决方案
采用Amazon SageMaker平台,利用其深度学习容器中预置的DeepSpeed ZeRO框架进行分布式训练优化,大幅缩短大规模语言模型的训练时间。
04
实施结果
训练模型数量:35(在6个月内完成)
单次模型训练时间:30分钟(缩短了约22.5小时)
推理延迟:降低40%(40%)
Token处理速度:800
请求处理能力:10-12
05
风险与边界
未披露
“Amazon SageMaker is a comprehensive solution that offers all the services and tools that we needed in a holistic manner.”
Nii Osae · Cofounder and Director of Software Engineering, Mazzuma
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。