Meta开源了其文本到音乐生成AI AudioCraft

Meta开源文本到音乐生成AI——AudioCraft

Meta宣布开源其文本到音乐生成AI框架——AudioCraft,旨在帮助研究人员和从业者训练自己的模型,推动音频生成领域的技术进步。AudioCraft包含三个主要模型:MusicGen、AudioGen和EnCodec。

AudioCraft的组成

  1. MusicGen:能够根据文本提示生成音乐。
  2. AudioGen:能够生成环境音效,如狗叫、汽车鸣笛或木地板上的脚步声。
  3. EnCodec:一个AI驱动的编码器/量化器/解码器,用于实现高质量音频生成。

Meta此次发布了改进版的EnCodec解码器,能够生成更高质量的音乐并减少伪影;预训练的AudioGen模型;以及所有AudioCraft模型的权重和代码。

技术原理

AudioCraft通过EnCodec神经音频编解码器从原始信号中学习音频标记(audio tokens),构建一个固定的音乐样本“词汇表”。这些标记被输入到自回归语言模型中,该模型利用标记的内部结构来捕捉其长期依赖关系,这对于音乐生成至关重要。最终,模型根据文本描述生成新的标记,并通过EnCodec解码器合成为声音和音乐。

Meta指出,生成高质量音频需要建模不同尺度的复杂信号和模式,而音乐生成尤其具有挑战性,因为它由局部和长程模式组成,从一系列音符到多乐器的全局音乐结构。

开源与许可

AudioCraft的开源旨在促进研究社区的创新,并为未来的音频和音乐制作与聆听方式带来新的可能性。Meta希望通过开源基础,推动音频领域的进一步发展,例如结合音效和音乐的丰富故事朗读体验。

然而,尽管AudioCraft的大部分组件是开源的,但其模型权重的许可采用了CC-BY-NC(非商业用途),这并不符合开源促进会(Open Source Initiative)对完全开源的定义。这是因为Meta使用了其拥有和特定许可的音乐来计算这些权重。其他组件则采用MIT许可证。

总结

Meta的AudioCraft框架通过开源为音频生成领域提供了强大的工具和技术基础,特别是MusicGen和AudioGen模型,能够根据文本生成高质量的音乐和环境音效。尽管其模型权重的许可存在一定的限制,但这一开源举措有望推动音频生成技术的进一步创新和应用。

阅读 26
0 条评论