研究人员发布算法高效深度学习的调查报告

研究背景与目的

劳伦斯利弗莫尔国家实验室(LLNL)和MosaicML的研究人员发表了一篇关于算法高效深度学习的综述,涵盖了超过200篇论文。该综述不仅对加速训练的方法进行了分类,还为实践者提供了缓解训练瓶颈的指南。研究团队指出,深度学习效率指标存在混杂因素(如硬件),导致不同研究结果难以比较。为此,他们定义了“算法加速”的概念:通过改变训练方法减少总训练时间,同时保持模型质量。基于此定义,他们将加速策略分为三个维度:组件(在哪里进行更改)、操作(进行哪些更改)和机制(何时以及如何进行更改)。

主要贡献

研究的主要贡献包括:

  1. 对算法效率文献进行了系统性整理。
  2. 对影响加速报告和实现的实践问题进行了技术性描述。
  3. 提供了减少训练时间的实用指南,以应对深度学习在经济、环境和包容性方面的挑战。

深度学习训练效率的挑战

尽管深度学习模型在许多基准测试中表现出色,但模型规模和训练时间及成本的增加也带来了问题。例如,GPT-3的训练成本估计接近200万美元。此外,训练和部署模型的能源消耗也引发了广泛关注。减少训练时间是缓解这些负担的最直接方法。

加速训练的技术分类

研究将加速技术按以下方式分类:

  1. 组件:包括函数(如模型参数)、数据(如训练数据集)和优化(如训练目标)。
  2. 操作:即“5R”策略,旨在减少每次训练迭代的时间或迭代次数,或两者兼有:

    • 移除:移除组件中的某些元素以减少迭代时间。
    • 限制:减少可能值的空间以减少迭代时间。
    • 重新排序:调整元素引入的时机以减少迭代时间和次数。
    • 替换:将某个元素替换为另一个以减少迭代时间和次数。
    • 改造:与移除相反,以减少迭代次数。

实践指南

研究提供了一系列减少训练时间的实践指南,指出了硬件层面的瓶颈(如GPU内存或存储容量),并提供了缓解这些瓶颈的建议。例如,减少张量的大小可以缓解GPU计算瓶颈。研究还指出,数据加载是一个常见但并非唯一的瓶颈。

专家观点

MosaicML的研究科学家、合著者Davis Blalock在Twitter上总结了这项研究,强调“减少训练时间”是一个非常有效的策略。他还提醒注意数据加载器的瓶颈,指出数据加载器瓶颈不仅浪费计算资源,还可能掩盖模型的实际性能。

相关成果

MosaicML最近参与了MLPerf竞赛,在Open类别中以2.7倍的速度训练BERT模型,取得了领先的自然语言处理(NLP)性能。此前,InfoQ也曾报道过MLPerf在2021年12月的结果。

阅读 21
0 条评论