Google AI发布通用语音模型(USM)更新,支持“1,000种语言计划”
Google AI最近发布了其通用语音模型(Universal Speech Model, USM)的更新,以支持其“1,000种语言计划”。此次更新使得USM在自动语音识别(ASR)的所有领域表现均优于OpenAI的Whisper模型。
通用语音模型(USM)概述
USM是一系列先进的语音模型,拥有20亿参数,训练数据包括1200万小时的语音和280亿句文本,覆盖300多种语言。该模型能够识别从资源匮乏语言(如阿姆哈拉语、宿务语、阿萨姆语、阿塞拜疆语)到常用语言(如英语、普通话)的多种语言。
训练过程
USM的训练过程分为三个阶段:
- 无监督学习:首先在大量语言的语音音频上进行无监督学习。
- 预训练(可选):根据文本数据的可用性,通过文本数据进行预训练,以提高模型质量和语言覆盖范围。如果加入这一阶段,USM性能会显著提升。
- 微调:在训练管道的最后阶段,使用少量监督数据对下游任务(如自动语音识别或自动语音翻译)进行微调。
自动语音识别的挑战
自动语音识别(ASR)面临两大挑战:
- 可扩展性:传统监督学习方法难以扩展,因为收集足够的数据来构建高质量模型,特别是对于没有代表性的语言,非常困难。
- 计算效率:需要一个灵活、高效且通用的学习算法,能够处理来自各种来源的大量数据,并在不进行完全重新训练的情况下推广到新的语言和用例。
自监督学习的优势
自监督学习是扩展ASR到多种语言的更好方法,因为它可以利用更易获取的纯音频数据。USM通过在大型未标记的多语言数据集上预训练编码器,并在较小的标记数据集上进行微调,成功识别了代表性不足的语言。此外,训练过程能够有效适应新数据和语言。
应用与意义
通用语音模型在促进机器与人类之间自然直观的互动方面发挥着关键作用,并可以作为不同语言和文化之间的桥梁。这些模型在虚拟助手、语音激活设备、语言翻译和语音到文本转录等应用中具有巨大潜力。
总结
通过此次更新,USM成为全球最全面的语音识别模型之一。这一进展是Google创建更具包容性和可访问性的互联网的重要一步,将使使用少数民族或较少使用语言的人们能够以更有意义的方式与技术互动。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。