微软发布VALL-E,一款颠覆性的TTS语言模型

微软推出VALL-E:新型文本到语音合成技术

微软最近推出了VALL-E,这是一种新颖的语言模型方法,用于文本到语音合成(TTS)。VALL-E通过使用音频编解码代码作为中间表示,能够在仅听取三秒的音频录音后,复制任何人的声音。

VALL-E的核心技术

VALL-E是一种神经编解码语言模型,其AI将语音进行标记化处理,并利用这些标记构建波形,使生成的声音听起来像原说话者,包括保留说话者的音色和情感语调。

主要特点

根据研究论文,VALL-E能够仅通过三秒的录音生成高质量的个性化语音,无需额外的结构工程、预设计的声学特征或微调。它支持上下文学习和基于提示的零样本TTS方法。

演示与比较

VALL-E提供了音频演示,其中包括:

  • 说话者提示:三秒的听觉提示,VALL-E需要复制。
  • 真实样本:同一说话者使用特定短语的先前录音,作为实验中的“控制”。
  • 基线样本:典型的文本到语音合成示例。
  • VALL-E样本:VALL-E模型的输出。

性能评估

与最先进的零样本TTS系统相比,VALL-E在LibriSpeechVCTK数据集上表现显著更好。VALL-E在这些数据集上甚至实现了尖端零样本TTS的效果。

语音合成领域的进展

近年来,神经网络和端到端建模的发展推动了语音合成领域的显著进步。当前的TTS系统通常使用声学模型和声码器,以梅尔频谱图作为中间表示,能够合成单个或多个说话者的高质量语音。

应用场景

TTS技术已被广泛应用于各种应用和设备中,例如:

  • 虚拟助手:如亚马逊的Alexa和谷歌助手。
  • 导航应用电子学习平台
  • 娱乐、广告和客户服务行业,用于创造更具吸引力和个性化的体验。

VALL-E的推出标志着语音合成技术的一个重要里程碑,展示了AI在模仿人类语音方面的巨大潜力。

阅读 26
0 条评论