谷歌语音AI AudioPaLM实现带音色转换的翻译

Google 推出 AudioPaLM:多功能语音处理大模型

Google 的研究人员宣布了 AudioPaLM,这是一款基于 PaLM-2 的大型语言模型(LLM),能够执行文本到语音(TTS)、自动语音识别(ASR)以及带语音转换的语音到语音翻译(S2ST)。AudioPaLM 在翻译基准测试中表现优于 OpenAI 的 Whisper

模型架构与特点

  • 架构:AudioPaLM 是一个仅解码器的基于 Transformer 的模型,将文本和音频输入结合为单一的嵌入表示。
  • 创新点:与传统的 S2ST 模型(使用 ASR、机器翻译(MT)和 TTS 模型的级联)不同,AudioPaLM 能够保留说话者的声音等声学特征。
  • 性能:在 S2ST 和 ASR 基准测试中,AudioPaLM 取得了最先进的成绩,并展示了零样本能力,能够处理训练数据中未出现的输入和目标组合。
  • 数据集表现:在 FLEURS 数据集 上,AudioPaLM 在 ASR 任务中显著优于 OpenAI 的 Whisper。

与其他模型的对比

  • Whisper:OpenAI 于 2022 年发布,基于编码器/解码器的 Transformer 模型,支持 97 种语言的语音转录和翻译。
  • MMS:Meta 今年发布的基于 wav2vec 的模型,支持 1,100 多种语言的 ASR 和 TTS。
  • AudioPaLM 的独特性:仅解码器的 Transformer 模型,基于预训练的 PaLM-2,扩展了包含声学标记的词汇表,能够处理音频和文本输入。

训练与评估

  • 训练数据:AudioPaLM 使用了数千小时的音频数据,涵盖 100 多种语言。
  • 评估基准:包括 CoVoST2(AST)、CVSS(S2ST)和 VoxPopuli(ASR)。AudioPaLM 在 AST 和 S2ST 上表现优于基线模型,在 ASR 上表现“具有竞争力”。
  • 零样本评估:在 FLEURS 基准测试中,AudioPaLM 在零样本 AST 任务中显著优于 Whisper,甚至在 Whisper 训练过但 AudioPaLM 未训练的语言上也表现更佳。

语音生成质量

  • 评估方法:通过“客观指标和主观评估研究”结合,评估 AudioPaLM 在 S2ST 中保留原说话者声音的能力。
  • 结果:AudioPaLM 显著优于基线模型。
  • 研究建议:Google 团队指出,需要更多生成音频任务的基准和指标,以进一步推动研究。

用户反馈与示例

  • 用户讨论:在 Hacker News 上,用户讨论了 AudioPaLM 的翻译准确性,认为其“幻觉”几乎不存在,并对其翻译能力表示赞赏。
  • 示例:AudioPaLM 的输出示例可在网上查看,展示了其在语音处理和翻译方面的强大能力。

总结:AudioPaLM 是一款多功能语音处理大模型,结合了文本和音频处理能力,在多个基准测试中表现优异,尤其是在语音翻译和生成质量方面。其创新设计和强大性能为语音处理领域带来了新的突破。

阅读 38
0 条评论