伯克利开源AI图像编辑模型InstructPix2Pix

研究背景与成果

来自伯克利人工智能研究所(BAIR)的研究人员开源了InstructPix2Pix,这是一个能够根据人类指令编辑图像的深度学习模型。该模型在合成数据上进行了训练,并在性能上超越了基线AI图像编辑模型。

研究方法

BAIR团队在2023年IEEE/CVF计算机视觉与模式识别会议(CVPR)上展示了他们的工作。他们首先生成了一个合成训练数据集,其中训练样本由图像对和编辑指令组成,用于将第一张图像转换为第二张图像。该数据集用于训练一个图像生成扩散模型。最终,该模型能够根据给定的源图像和基于文本的指令进行编辑,例如将“骑马”的图像替换为“骑龙”。

模型特点

尽管InstructPix2Pix完全在合成数据上训练,但它能够实现零样本泛化,适用于任意真实图像和自然人类指令。该模型支持多种编辑操作,如替换对象、改变图像风格、设置和艺术媒介等。

技术细节

为了训练InstructPix2Pix,BAIR团队首先创建了一个合成数据集。他们对GPT-3进行了微调,使其能够根据输入标题生成编辑指令和输出标题。然后,他们使用预训练的Prompt-to-Prompt模型生成基于标题的图像对。InstructPix2Pix基于Stable Diffusion,并通过与基线模型SDEdit的比较来评估其性能。

评估与结果

在实验中,InstructPix2Pix在给定方向相似度值的情况下,生成的图像比SDEdit更具一致性。研究人员使用了两个指标进行权衡:一致性(输入图像和编辑图像的CLIP嵌入之间的余弦相似度)和方向相似度(编辑标题的变化与编辑图像变化的一致性)。

专家评价

AI研究员Andrew Ng在其深度学习通讯The Batch中评论道:

这项工作简化了——并提供了更一致的结果——在修订生成和人类制作的图像时。作者巧妙地利用了现有模型,使他们能够用相对较少的人工标注样本训练新任务。

资源获取

InstructPix2Pix代码已在GitHub上开源,模型基于Web的演示可在Huggingface上获取。

总结

InstructPix2Pix是一个创新的图像编辑模型,能够根据自然语言指令进行多种编辑操作。其基于合成数据的训练方法和零样本泛化能力使其在实际应用中表现出色,为AI图像编辑领域提供了新的可能性。

阅读 33
0 条评论