Meta开源多语言翻译基础模型SeamlessM4T

Meta开源多语言多模态翻译AI SeamlessM4T

Meta最近开源了Massively Multilingual & Multimodal Machine Translation(SeamlessM4T),这是一个能够跨近100种语言进行语音和文本数据翻译的多语言翻译AI。SeamlessM4T基于100万小时的音频数据进行训练,并在语音到文本翻译任务上超越了当前最先进的模型。

SeamlessM4T的功能与特点

SeamlessM4T是一个多模态模型,能够处理文本和音频的输入和输出,具备以下功能:

  • 自动语音识别(ASR)
  • 文本到文本翻译(T2TT)
  • 语音到文本翻译(S2TT)
  • 文本到语音翻译(T2ST)
  • 语音到语音翻译(S2ST)

该模型以非商业用途的CC BY-NC 4.0许可证发布。Meta还发布了其训练数据集SeamlessAlign,该数据集包含27万小时的音频数据及其对应的文本转录,以及从互联网上挖掘这些数据的代码。

Meta的动机与目标

Meta的研究动机是构建一个类似《银河系漫游指南》中巴别鱼的通用翻译系统。他们认为,SeamlessM4T是朝着这一目标迈出的重要一步,能够为不同语言使用者提供按需翻译,显著提升低资源和中资源语言的翻译性能。Meta希望未来探索如何利用这一基础模型实现新的通信能力,最终让每个人都能被理解。

相关背景与对比

Meta此前已经推出了多个多语言翻译模型,包括:

  • No Language Left Behind (NLLB):支持200种语言的文本到文本翻译。
  • Massively Multilingual Speech (MMS):支持超过1100种语言的自动语音识别和文本到语音合成。

其他公司在多语言翻译领域的研究也取得了进展,例如:

  • OpenAI的Whisper:支持97种语言的语音转录和翻译。
  • Google的Universal Speech Model (USM):支持超过100种语言的自动语音识别。
  • Google的AudioPaLM:此前的语音到语音翻译最先进模型。

SeamlessM4T的技术架构

SeamlessM4T基于UnitY神经网络架构,由三个组件组成:

  1. 编码器:处理语音和文本输入,识别输入的含义。语音部分基于w2v-BERT,文本部分基于NLLB。
  2. 解码器:基于NLLB,将含义转换为目标语言的文本输出。
  3. 文本到声学单元解码器:将目标文本转换为语音。

性能评估

Meta将SeamlessM4T与级联模型(由ASR、T2TT和TTS模型组成的管道)和单模型系统进行了比较,评估基准为FLEURSCVSS。在FLEURS上,SeamlessM4T“为多目标语言翻译设定了新标准”,性能优于AudioPaLM 20%。在CVSS上,SeamlessM4T比级联模型强58%。

社区反馈与资源

在Hacker News上,用户对SeamlessM4T进行了讨论。有用户分享了如何本地运行该模型的技巧,并指出其上下文限制为4096个token。还有用户询问是否会推出类似whispercpp的简化版本,以便更容易操作。

SeamlessM4T的代码和模型已在GitHub上发布,同时Huggingface上提供了一个交互式翻译演示

阅读 26
0 条评论