其他行业 · AI应用
利用IBM Cloud克服基础设施限制
哈佛大学的 Calmon 实验室面临严重的基础设施限制,阻碍了其在模型对齐和AI安全方面的AI研究。为解决这些挑战,他们转向 IBM Cloud,后者提供了强大的 NVIDIA HGX H100 服务器。这一转变使实验室能够以超过每秒2000个令牌的速度运行推理,消除了模型训练的等待时间。结果,实验室的研究速度大幅提升,在模型多样性和AI安全方面取得了新的突破。值得注意的是,他们仅在一周内就实现了这一高性能环境,显著增强了研究能力。
推理速度
超过2000
来源披露
模型训练等待时间
无等待时间
来源披露
研究突破
在模型多样性和AI安全方面取得突破
来源披露
01
业务背景
哈佛大学的 Calmon 实验室面临严重的基础设施限制,阻碍了其在模型对齐和AI安全方面的AI研究。为解决这些挑战,他们转向 IBM Cloud,后者提供了强大的 NVIDIA HGX H100 服务器。这一转变使实验室能够以超过每秒2000个令牌的速度运行推理,消除了模型训练的等待时间。结果,实验室的研究速度大幅提升,在模型多样性和AI安全方面取得了新的突破。值得注意的是,他们仅在一周内就实现了这一高性能环境,显著增强了研究能力。
02
遇到的问题
哈佛Calmon实验室在AI安全研究中面临基础设施限制:哈佛集群需求过载,运行前沿模型需多块NVIDIA H100 GPU,导致实验等待时间长,限制了对大模型的高效实验,拖慢研究进度。
03
AI 解决方案
Calmon实验室与IBM合作,在IBM Cloud的安全VPC中配置两台NVIDIA HGX H100 8-GPU服务器(每台640GB GPU内存、2TB物理内存),搭配高IOPS块存储、快速网络文件共享和Cloud Object Storage;使用Red Hat Enterprise Linux 9、Anaconda和vLLM进行模型服务,一周内搭建高性能环境运行推理与训练。
- 1在IBM Cloud安全VPC中配置两台NVIDIA HGX H100 8-GPU服务器及存储网络
- 2使用Red Hat Enterprise Linux 9、Anaconda和vLLM搭建模型服务环境
- 3一周内运行超过2000 tokens/s推理并无延迟训练模型
04
实施结果
推理速度:超过2000(无等待时间)
模型训练等待时间:无等待时间(消除等待)
研究突破:在模型多样性和AI安全方面取得突破(未披露)
05
风险与边界
未披露
“As a research team working on the frontiers of information theory and generative AI, we need an increasingly powerful compute infrastructure. Our experience working on IBM Cloud was phenomenal. The capabilities and expertise from IBM helped us to run large models that require large GPU clusters quickly and efficiently, helping us obtain new research results—related to AI safety— in record time.”
Flavio du Pin Calmon · Thomas D. Cabot Associate Professor, Harvard School of Engineering and Applied Sciences
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。