谷歌通用语音模型支持数百种语言的语音识别

Google 发布通用语音模型 (USM)

Google Research 宣布推出通用语音模型 (Universal Speech Model, USM),这是一个拥有 20 亿参数的自动语音识别 (ASR) 模型,训练数据超过 1200 万小时的语音音频。USM 能够识别超过 100 种语言的语音,包括资源较少的语言,并在多个基准测试中取得了最新的最先进性能。

模型架构与训练

USM 的核心是基于 Conformer 的编码器,通过无监督学习在包含超过 300 种语言的 YouTube 视频音频上进行训练。为了应对长音频输入时 Conformer 模型的质量下降问题,Google 团队在模型架构中引入了新的“分块”注意力机制。在下游任务中,团队没有对整个模型进行微调,而是在冻结的编码器上添加了小型适配器网络单元,用于 ASR 和自动语音翻译 (AST) 任务。

训练过程

USM 的训练分为三个阶段:

  1. 音频数据训练:使用无监督学习在 1200 万小时的 YouTube 音频数据(涵盖 300 种语言)以及 51 种语言的 42.9 万小时公开数据集上训练 Conformer 编码器。
  2. 多目标监督预训练 (MOST):在音频、文本以及配对的音频-文本数据上进一步训练编码器。
  3. 任务特定微调:冻结编码器,仅微调任务特定的适配器,而不是整个模型。

性能评估

USM 在多个 ASR 和 AST 基准测试中表现出色,包括 SpeechStew、FLEURS 和 CoVoST 等。在包含 73 种语言的 YouTube 字幕数据集中,USM 的词错误率 (WER) 低于 30%,且“没有已发布的模型能够成功解码所有 73 种语言”。与 OpenAI 的 Whisper 模型相比,USM 在“Whisper 能够成功解码且 WER 低于 40% 的 18 种语言”上表现更优。

低资源语言的处理

USM 在处理低资源语言方面表现出色,尽管这些语言的训练数据稀缺。通过在大规模未标记的多语言数据集上预训练编码器,并在少量标记数据上进行微调,USM 能够识别这些代表性不足的语言。一位 Hacker News 用户评论道,模型的核心编码器在学习了广泛语言的基本知识后,只需少量的标记数据即可在小语种上取得良好表现。

可用性

目前,USM 仅通过 Google Cloud Platform 的私有托管推理 API 提供,用户需要申请访问权限,优先提供给“研究人员和机构”。

阅读 25
0 条评论