其他行业 · AI应用
使用OLAF优化机器学习数据负载预测
Observe.AI在准确预测其联络中心AI平台的机器学习负载大小时面临挑战,这影响了成本效率和性能。为此,他们开发了One Load Audit Framework(OLAF),并将其与Amazon SageMaker集成,以增强负载测试能力。这一创新方法不仅提供了对成本和性能的宝贵洞察,还简化了实例识别过程,将时间从一周缩短到几小时。结果,Observe.AI将大语言模型(LLM)成本降低了50%以上,并成功扩展服务以处理十倍的数据负载,显著优化了其机器学习部署。
大语言模型成本降低
超过50%
来源披露
支持的数据负载增长
10倍
来源披露
实例识别时间缩短
从一周缩短至几小时
来源披露
01
业务背景
Observe.AI在准确预测其联络中心AI平台的机器学习负载大小时面临挑战,这影响了成本效率和性能。为此,他们开发了One Load Audit Framework(OLAF),并将其与Amazon SageMaker集成,以增强负载测试能力。这一创新方法不仅提供了对成本和性能的宝贵洞察,还简化了实例识别过程,将时间从一周缩短到几小时。结果,Observe.AI将大语言模型(LLM)成本降低了50%以上,并成功扩展服务以处理十倍的数据负载,显著优化了其机器学习部署。
02
遇到的问题
在向生产环境过渡模型时,准确预测机器学习系统的负载能力面临挑战,难以在控制延迟和成本的同时部署更大的模型以提升准确性。
03
AI 解决方案
开发并开源了One Load Audit Framework(OLAF),将其与Amazon SageMaker集成,用于自动识别机器学习服务的瓶颈和性能问题,提供静态与动态负载下的延迟和吞吐量测量。随后陆续集成Amazon SQS和Amazon SNS,以支持队列处理系统负载测试和特定消息模式复制,帮助工程师快速确定最佳实例配置。
- 1创建OLAF并与Amazon SageMaker集成,实现自动负载测试和瓶颈识别。
- 2集成Amazon SQS,下载负载轨迹以观察消息进入速率,测试基于队列的阵列处理系统。
- 3集成Amazon SNS,复制特定消息模式,增强负载测试的多样性。
04
实施结果
大语言模型成本降低:超过50%(降低超过50%)
支持的数据负载增长:10倍(增长10倍)
实例识别时间缩短:从一周缩短至几小时(缩短至几小时)
05
风险与边界
未披露
“Through fine-tuning Amazon SageMaker instance sizes with OLAF while maintaining constant data input load, we optimized costs for our LLM deployment by over 50 percent.”
Aashraya Sachdeva · Staff Engineer, Machine Learning at Observe.AI
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。