Azure预览ND H100 V5虚拟机以加速生成式AI

Azure发布ND H100 v5虚拟机预览,加速AI开发

Azure近日宣布推出ND H100 v5虚拟机的预览版,该虚拟机集成了最新的Nvidia H100 Tensor Core GPU,并支持Quantum-2 InfiniBand网络。微软表示,这一新选项将为AI开发者提供跨数千个GPU的更高性能和扩展能力。

主要特点与性能提升

  1. GPU与处理器:ND H100 v5虚拟机配备了Nvidia H100 Tensor Core GPU,并采用第4代Intel Xeon可扩展处理器。每块GPU通过400 Gb/s的Nvidia Quantum-2 CX7 InfiniBand互联。
  2. 性能提升:据Nvidia称,H100 v5在大型语言模型(LLM)上的性能比上一代Ampere架构快30倍。
  3. 应用范围:该虚拟机专为对话式AI项目设计,支持从8个到数千个GPU的规模,适用于大规模AI模型的训练和部署。

微软的战略与优化

Azure的产品经理Matt Vegas表示,这一新选项将帮助微软及其合作伙伴(如Inflection、Nvidia和OpenAI)实现新一类大规模AI模型的开发。微软还通过系统级优化和软件技术,提升了GPU和网络设备的利用率,显著降低了训练和部署大规模模型所需的资源与时间。

面向广泛用户群体

ND H100 v5虚拟机不仅面向微软和其他大型企业,还旨在为初创公司和中小企业提供超级计算能力,而无需大规模硬件或软件投资。

行业竞争与合作

Azure并非唯一与Nvidia合作开发可扩展AI基础设施的云服务提供商。AWS最近也宣布了其即将推出的EC2 UltraClusters of P5实例,支持多达20000个互联的H100 GPU。此外,Nvidia还发布了H100 NVL,这是一款专为大型语言模型设计的内存服务器卡。

GPU供应短缺问题

由于对话式AI需求的激增,一些分析师认为Nvidia GPU正面临严重的供应短缺,可能导致部分企业转向AMD GPU或Cerebras WSE等替代硬件。

预览版访问

Azure ND H100 v5虚拟机的预览版目前仅对通过申请批准的参与者开放。

阅读 63
0 条评论