Meta发布Voicebox语音生成模型
Meta最近发布了Voicebox语音生成模型,该模型能够在六种语言中进行文本到语音(TTS)合成,并且能够编辑和去除语音录音中的噪音。Voicebox在超过50,000小时的音频数据上进行训练,并在多个TTS基准测试中超越了之前的最先进模型。
Voicebox的创新架构
与许多自回归的TTS模型不同,Voicebox基于一种称为“流匹配”(flow-matching)的新型架构。该模型通过预测音频输入中被掩码的部分来进行训练,使其能够执行填充任务,例如去除语音录音中的环境噪音或纠正发音错误。Voicebox还可以执行未经专门训练的任务,如跨语言风格转换。该模型在英语、法语、德语、西班牙语、波兰语和葡萄牙语的电子书录音及其文本上进行训练。
安全考虑与开源问题
尽管Meta最近开源了另一个多语言TTS模型,但出于安全考虑,他们并未开源Voicebox。Meta表示,虽然生成语音模型有许多令人兴奋的应用场景,但由于潜在的滥用风险,他们目前不会公开Voicebox的模型或代码。Meta强调在开放与责任之间找到平衡的重要性,并分享了音频样本和研究论文以展示其成果。
Voicebox的多功能能力
Voicebox类似于大型语言模型(LLM),通过预测输入中被掩码的部分进行训练。输入包括一段语音音频及其文本转录。音频的一部分被掩码,但文本未被掩码,因此模型根据文本合成被掩码单词的音频。尽管Voicebox仅在这一任务上进行训练,但它能够进行上下文学习,执行其他任务,如风格转换和去噪。Meta团队在多个任务上评估了Voicebox的性能,包括零样本TTS、跨语言零样本TTS和文本引导去噪,并在单词错误率(WER)和音频相似性方面超越了之前的先进模型VALL-E和A3T。
安全措施
为了尽量减少Voicebox模型的潜在安全风险,Meta还开发了一个分类器模型,用于检测合成语音。在Librispeech基准测试中,该分类器能够“轻易”区分原始音频与由Voicebox从文本转录合成的语音。
社区讨论
在Hacker News关于Voicebox的讨论中,有用户指出Meta决定不发布该模型,并质疑在给定训练数据规模的情况下,复制该模型的难度。另一位用户认为,6,000本书的音频数据(假设每本10小时)是一个可实现的数据集,甚至可以通过挖掘BBC、NPR等播客档案获得数百万小时的音频数据。
相关模型比较
InfoQ最近报道了Meta开源的大规模多语言语音(MMS)模型,该模型可以在1,000多种语言中进行自动语音识别(ASR)和TTS,但无法执行Voicebox的编辑和风格转换任务。InfoQ还报道了Google的AudioPaLM模型,该模型能够执行ASR、TTS和语音到语音翻译(S2ST)并进行语音转换。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。