Google 推出 AudioPaLM:多功能语音处理大模型
Google 的研究人员宣布了 AudioPaLM,这是一款基于 PaLM-2 的大型语言模型(LLM),能够执行文本到语音(TTS)、自动语音识别(ASR)以及带语音转换的语音到语音翻译(S2ST)。AudioPaLM 在翻译基准测试中表现优于 OpenAI 的 Whisper。
模型架构与特点
- 架构:AudioPaLM 是一个仅解码器的基于 Transformer 的模型,将文本和音频输入结合为单一的嵌入表示。
- 创新点:与传统的 S2ST 模型(使用 ASR、机器翻译(MT)和 TTS 模型的级联)不同,AudioPaLM 能够保留说话者的声音等声学特征。
- 性能:在 S2ST 和 ASR 基准测试中,AudioPaLM 取得了最先进的成绩,并展示了零样本能力,能够处理训练数据中未出现的输入和目标组合。
- 数据集表现:在 FLEURS 数据集 上,AudioPaLM 在 ASR 任务中显著优于 OpenAI 的 Whisper。
与其他模型的对比
- Whisper:OpenAI 于 2022 年发布,基于编码器/解码器的 Transformer 模型,支持 97 种语言的语音转录和翻译。
- MMS:Meta 今年发布的基于 wav2vec 的模型,支持 1,100 多种语言的 ASR 和 TTS。
- AudioPaLM 的独特性:仅解码器的 Transformer 模型,基于预训练的 PaLM-2,扩展了包含声学标记的词汇表,能够处理音频和文本输入。
训练与评估
- 训练数据:AudioPaLM 使用了数千小时的音频数据,涵盖 100 多种语言。
- 评估基准:包括 CoVoST2(AST)、CVSS(S2ST)和 VoxPopuli(ASR)。AudioPaLM 在 AST 和 S2ST 上表现优于基线模型,在 ASR 上表现“具有竞争力”。
- 零样本评估:在 FLEURS 基准测试中,AudioPaLM 在零样本 AST 任务中显著优于 Whisper,甚至在 Whisper 训练过但 AudioPaLM 未训练的语言上也表现更佳。
语音生成质量
- 评估方法:通过“客观指标和主观评估研究”结合,评估 AudioPaLM 在 S2ST 中保留原说话者声音的能力。
- 结果:AudioPaLM 显著优于基线模型。
- 研究建议:Google 团队指出,需要更多生成音频任务的基准和指标,以进一步推动研究。
用户反馈与示例
- 用户讨论:在 Hacker News 上,用户讨论了 AudioPaLM 的翻译准确性,认为其“幻觉”几乎不存在,并对其翻译能力表示赞赏。
- 示例:AudioPaLM 的输出示例可在网上查看,展示了其在语音处理和翻译方面的强大能力。
总结:AudioPaLM 是一款多功能语音处理大模型,结合了文本和音频处理能力,在多个基准测试中表现优异,尤其是在语音翻译和生成质量方面。其创新设计和强大性能为语音处理领域带来了新的突破。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。