其他行业 · AI应用
利用 Fireworks.ai 实现大规模模型部署
Fireworks.ai 面临高效部署大规模生成式 AI 模型同时确保经济性和安全性的挑战。为此,他们开发了基于 Amazon EC2 P5 实例(配备 NVIDIA H100 Tensor Core GPU)的解决方案,显著提升了性能指标。与传统开源解决方案相比,每个实例的吞吐量提高了四倍,延迟降低了 50%。因此,客户的总成本最多降低四倍,使其能够在不牺牲预算或安全标准的情况下利用先进的 AI 能力。
每实例吞吐量
4 倍
来源披露
延迟降低
30-50%
来源披露
客户总成本降低
最多 4 倍
来源披露
01
业务背景
Fireworks.ai 面临高效部署大规模生成式 AI 模型同时确保经济性和安全性的挑战。为此,他们开发了基于 Amazon EC2 P5 实例(配备 NVIDIA H100 Tensor Core GPU)的解决方案,显著提升了性能指标。与传统开源解决方案相比,每个实例的吞吐量提高了四倍,延迟降低了 50%。因此,客户的总成本最多降低四倍,使其能够在不牺牲预算或安全标准的情况下利用先进的 AI 能力。
02
遇到的问题
为规模化部署生成式AI推理,需要在保证高性能的同时降低成本并满足严格安全标准。Fireworks.ai 面临在 PyTorch 生态中实现最优成本-性能比的挑战,尤其因模型规模大、领域发展快,传统方案难以兼顾速度与成本。
03
AI 解决方案
Fireworks.ai 基于 Amazon EC2 P5 实例(搭载 NVIDIA H100 Tensor Core GPU)构建推理平台,从 Amazon EC2 P4d 实例升级至 P5,通过深度优化推理引擎,使每实例吞吐量较开源方案提升4倍、延迟降低50%;平台支持 SaaS 和客户 VPC 内容器化部署,兼容 Llama 2、Stable Diffusion XL、StarCoder 等主流开源模型,并满足 HIPAA 和 SOC2 Type II 安全合规要求,同时在 AWS Marketplace 上架以简化客户采购。
- 1初始阶段采用 Amazon EC2 P4d 实例(NVIDIA A100 GPU)运行推理工作负载。
- 22023年7月 AWS 发布 Amazon EC2 P5 实例后,迁移至该实例并重新优化推理引擎。
- 3通过 AWS Marketplace 推出平台即服务,允许客户直接订阅使用。
04
实施结果
每实例吞吐量:4 倍(提升至 4 倍)
延迟降低:30-50%(降低 30-50%)
客户总成本降低:最多 4 倍(降低最多 4 倍)
Cody 代码补全接受率:翻倍(提升一倍)
Cody 后端延迟:加速超过 2 倍(加速超过 2 倍)
05
风险与边界
未披露
“Using AWS, Fireworks.ai helps developers integrate powerful open models into their prototype applications without breaking the bank as they experiment, explore, and play with different models.”
Dmytro Dzhulgakov · Cofounder and Chief Technology Officer, Fireworks.ai
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。