谷歌AI推出Muse,一款新的文本到图像转换模型

Google AI发布Muse:基于掩码生成Transformer的文本到图像生成模型

Google AI最近发布了一篇关于Muse的研究论文,Muse是一种基于掩码生成Transformer的文本到图像生成模型,能够以远超竞争对手的速度生成高质量图像,质量与DALL-E 2和Imagen等模型相当。

主要技术特点

  1. 掩码生成Transformer

    • Muse使用了一个拥有9亿参数的掩码生成Transformer模型,而不是基于像素空间扩散或自回归模型。
    • 它通过预测随机掩码的图像标记来生成图像,这些标记来自预训练的大型语言模型的文本嵌入。
  2. 高效生成

    • 在TPUv4芯片上,Muse可以在0.5秒内生成一张256x256像素的图像,而Imagen需要9.1秒。
    • TPU(Tensor Processing Unit)是Google开发的专用AI加速芯片。
  3. 模型规模

    • Google AI训练了一系列不同规模的Muse模型,参数范围从6.32亿到30亿。
    • 研究发现,基于预训练大型语言模型的条件生成对于生成逼真、高质量图像至关重要。

性能优势

  1. 速度与效率

    • Muse在推理时间上比Imagen-3B或Parti-3B模型快10倍以上,比Stable Diffusion v1.4快3倍。
    • 这种高效性得益于并行解码技术。
  2. 语言理解与图像生成

    • Muse能够根据输入描述中的不同语言成分(如名词、动词、形容词)生成相应的图像。
    • 它还展示了对于视觉风格和多对象特征(如组合性和基数性)的理解。

行业背景与应用

  1. 生成式图像模型的进展

    • 近年来,生成式图像模型在训练方法和深度学习架构方面取得了显著进展。
    • 这些模型能够生成高度详细和逼真的图像,成为各行业和应用的强大工具。
  2. 应用潜力

    • Muse的高效性和高质量生成能力使其在广告、设计、娱乐等领域具有广泛的应用前景。

结论

Muse作为一种基于掩码生成Transformer的文本到图像生成模型,不仅在生成速度上具有显著优势,还能生成与输入描述高度匹配的高质量图像。其高效的并行解码技术和基于预训练语言模型的条件生成方法,使其在生成式图像模型领域处于领先地位。

阅读 28
0 条评论