其他行业 · AI应用
在 Amazon SageMaker 上训练 Falcon LLM 400 亿参数模型
Technology Innovation Institute (TII) 面临开发高性能大语言模型的挑战,该模型需能处理多种应用且成本效益高。为此,TII 利用 Amazon SageMaker 训练了 Falcon LLM,一个 400 亿参数的模型,数据集包含 1 万亿个 token。该方法不仅能够高效处理海量数据,还利用了包括 384 个 NVIDIA A100 GPU 和 18,504 个 vCPU 在内的强大资源,实现了卓越的性能指标。结果,Falcon LLM 在 Hugging Face Open LLM 排行榜上名列前茅,展示了其卓越能力,树立了 AI 创新的新标准。
Hugging Face 开放 LLM 排行榜排名
第一
来源披露
训练吞吐量(147B 模型测试)
166
来源披露
训练吞吐量(13B 模型测试)
173
来源披露
01
业务背景
Technology Innovation Institute (TII) 面临开发高性能大语言模型的挑战,该模型需能处理多种应用且成本效益高。为此,TII 利用 Amazon SageMaker 训练了 Falcon LLM,一个 400 亿参数的模型,数据集包含 1 万亿个 token。该方法不仅能够高效处理海量数据,还利用了包括 384 个 NVIDIA A100 GPU 和 18,504 个 vCPU 在内的强大资源,实现了卓越的性能指标。结果,Falcon LLM 在 Hugging Face Open LLM 排行榜上名列前茅,展示了其卓越能力,树立了 AI 创新的新标准。
02
遇到的问题
Technology Innovation Institute 需要开发一个具备顶尖性能且成本效益高的大语言模型,该模型能处理多种应用场景,但在训练过程中面临大规模计算资源管理、高效数据处理、训练速度与成本控制的挑战,亟需一种能够高效利用云端资源并达成卓越模型性能的解决方案。
03
AI 解决方案
利用 Amazon SageMaker Training 的瞬时 GPU 集群(最多 48 个 ml.p4d.24xlarge 实例,共 384 块 NVIDIA A100 GPU)进行模型训练,采用完全自定义的 3D 并行大语言模型训练框架,整合定制优化的 CUDA 核与网络拓扑感知通信;使用 Amazon S3 构建无服务器数据流水线,通过 SageMaker Training 的 CPU 作业(最大 257 个 ml.c5.18xlarge 实例,累计 18,504 vCPU)并行执行数据预处理与去重;构建自定义训练启动客户端,并通过 AWS Lambda 与 Amazon CloudWatch 实现自动化监控与干预;训练后期在内部 SageMaker 实时推理端点和 Slack 机器人上进行定性质量审核。
- 1使用 SageMaker Training CPU 作业(单实例与多实例)对 PB 级网页数据进行过滤、去重和分类,构建 1 万亿 token 高质量训练数据集
- 2在由 48 个 ml.p4d.24xlarge 实例组成的 SageMaker GPU 集群上,运行自定义 3D 并行训练框架,利用优化的矩阵乘法和多查询注意力技术训练 400 亿参数模型
- 3通过 CloudWatch 告警和 Lambda 函数自动监控 GPU/CPU/内存利用率,并在资源闲置或训练停滞时自动停止作业以控制成本
- 4训练结束后,将模型部署到内部 SageMaker 端点,并集成 Slack 机器人与研究人员交互以进行推理质量定性评估
04
实施结果
Hugging Face 开放 LLM 排行榜排名:第一(未披露)
训练吞吐量(147B 模型测试):166(未披露)
训练吞吐量(13B 模型测试):173(未披露)
05
风险与边界
未披露
“We proudly announce the official open-source release of Falcon-40B, the world’s top-ranking open-source language model.”
Dr. Ebtesam Almazrouei · Executive Director–Acting Chief AI Researcher of the AI-Cross Center Unit and Project Lead for LLM Projects at TII
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。