谷歌发布MusicLM,一款能够通过文本提示生成音乐的AI

Google推出AI音乐生成模型MusicLM

Google的研究人员近期推出了一款名为MusicLM的AI模型,能够根据文本生成高保真音乐。MusicLM通过将条件音乐生成过程建模为分层序列到序列的建模问题,以恒定的24 kHz频率生成长达数分钟的音乐。

主要特点与训练数据

  1. 训练数据:MusicLM基于一个包含28万小时音乐的数据集进行训练,能够根据复杂的文本描述生成符合逻辑的音乐作品。
  2. 性能优势:据研究论文称,MusicLM在音频质量和文本描述贴合度方面均优于之前的系统。
  3. 生成示例

    • 从简单的关键词(如“旋律电子”)生成五分钟的音乐片段。
    • 根据段落长度的描述(包括风格、氛围和具体乐器)生成30秒的完整歌曲。
  4. 故事叙述能力:MusicLM还能将一系列顺序书写的描述转化为基于现有旋律的音乐故事或叙事,这些旋律可以是口哨、哼唱、歌唱或乐器演奏。

AI生成音乐的历史与挑战

  1. 历史背景:AI生成音乐已有较长的历史,曾用于创作热门歌曲和增强现场表演。
  2. 技术发展:近期,通过AI图像生成引擎Stable Diffusion,文本提示被转换为声谱图和音乐。
  3. 挑战

    • 与文本到图像的机器学习不同,AI音乐面临缺乏耦合音频和文本数据的障碍。
    • 音乐的时间维度特性使得用简单文本传达音乐意图比描述静态图像更具挑战性。

Google的谨慎态度

Google对MusicLM的发布持谨慎态度,相较于竞争对手在类似技术上的激进策略,Google表示目前没有公开模型的计划。

总结

MusicLM是一款基于文本生成高保真音乐的AI模型,具有强大的音乐生成和故事叙述能力。尽管AI生成音乐面临数据和技术上的挑战,MusicLM在音频质量和文本贴合度上展现了显著优势。Google对技术的发布采取了保守策略,暂未计划公开模型。

阅读 49
0 条评论