AWS与NVIDIA将合作开发下一代EC2 P5实例以加速生成式AI

AWS与NVIDIA合作开发下一代AI基础设施

AWS与NVIDIA宣布合作开发一种高度可扩展的按需AI基础设施,专为训练大型语言模型和创建先进的生成式AI应用而设计。该合作旨在打造最优化和高效的系统,以满足日益复杂的AI任务需求。

关键技术组件

  • Amazon EC2 P5实例:由NVIDIA H100 Tensor Core GPU驱动,结合AWS先进的网络和可扩展性,提供高达20 exaFLOPS的计算性能,用于创建和训练最大的深度学习模型。
  • Elastic Fabric Adapter (EFA):P5实例是首个受益于AWS第二代EFA的GPU实例,提供3200 Gbps的低延迟、高带宽网络吞吐量。
  • EC2 UltraClusters:P5实例部署在强大的超大规模集群中,这些集群由顶级计算、网络和存储资源组成,是全球最强大的超级计算机之一。

合作背景与目标

  • 长期合作:AWS与NVIDIA已有十多年的合作历史,共同开发AI和高性能计算(HPC)基础设施,推出了P2、P3、P3dn和P4d(e)实例。
  • 第五代产品:P5实例是第五代NVIDIA GPU驱动的AWS产品,专为训练复杂的大型语言模型和计算机视觉模型而优化,适用于语音识别、代码生成和视频/图像生成等生成式AI应用。
  • 未来设计:两家公司已开始合作设计未来服务器,以提高后续代系统设计、冷却技术和网络可扩展性的效率。

客户受益

  • 超级计算机级性能:客户可以在EC2 UltraClusters中扩展至20000个H100 GPU,按需访问超级计算机级性能。
  • 高效深度学习训练:通过EFA的自定义操作系统和与NVIDIA GPUDirect RDMA的集成,显著降低了延迟并提高了带宽利用率,这对于跨数百个P5节点的深度学习模型训练至关重要。

行业影响

  • 加速计算与AI的到来:NVIDIA创始人兼CEO Jensen Huang表示,加速计算和AI的到来恰逢其时,加速计算提供了阶梯式速度提升,同时降低了成本和功耗,使企业能够以更少的资源做更多的事情。
  • 生成式AI的觉醒:生成式AI已经唤醒企业重新构想其产品和商业模式,成为颠覆者而不是被颠覆者。

通过这次合作,AWS和NVIDIA将继续推动AI和高性能计算领域的前沿技术发展,为客户提供更强大、更高效的解决方案。

阅读 38
0 条评论