Google AI发布Muse:基于掩码生成Transformer的文本到图像生成模型
Google AI最近发布了一篇关于Muse的研究论文,Muse是一种基于掩码生成Transformer的文本到图像生成模型,能够以远超竞争对手的速度生成高质量图像,质量与DALL-E 2和Imagen等模型相当。
主要技术特点
掩码生成Transformer:
- Muse使用了一个拥有9亿参数的掩码生成Transformer模型,而不是基于像素空间扩散或自回归模型。
- 它通过预测随机掩码的图像标记来生成图像,这些标记来自预训练的大型语言模型的文本嵌入。
高效生成:
- 在TPUv4芯片上,Muse可以在0.5秒内生成一张256x256像素的图像,而Imagen需要9.1秒。
- TPU(Tensor Processing Unit)是Google开发的专用AI加速芯片。
模型规模:
- Google AI训练了一系列不同规模的Muse模型,参数范围从6.32亿到30亿。
- 研究发现,基于预训练大型语言模型的条件生成对于生成逼真、高质量图像至关重要。
性能优势
速度与效率:
- Muse在推理时间上比Imagen-3B或Parti-3B模型快10倍以上,比Stable Diffusion v1.4快3倍。
- 这种高效性得益于并行解码技术。
语言理解与图像生成:
- Muse能够根据输入描述中的不同语言成分(如名词、动词、形容词)生成相应的图像。
- 它还展示了对于视觉风格和多对象特征(如组合性和基数性)的理解。
行业背景与应用
生成式图像模型的进展:
- 近年来,生成式图像模型在训练方法和深度学习架构方面取得了显著进展。
- 这些模型能够生成高度详细和逼真的图像,成为各行业和应用的强大工具。
应用潜力:
- Muse的高效性和高质量生成能力使其在广告、设计、娱乐等领域具有广泛的应用前景。
结论
Muse作为一种基于掩码生成Transformer的文本到图像生成模型,不仅在生成速度上具有显著优势,还能生成与输入描述高度匹配的高质量图像。其高效的并行解码技术和基于预训练语言模型的条件生成方法,使其在生成式图像模型领域处于领先地位。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。