研究背景与主要贡献
来自微软、威斯康星大学麦迪逊分校和哥伦比亚大学的研究人员开源了大型语言与视觉助手(LLaVA)。LLaVA基于CLIP图像编码器和LLaMA语言解码器,通过在合成的指令跟随数据集上进行微调,并在ScienceQA基准测试中达到了最先进的准确率。
技术细节
数据集生成与模型微调:
- 研究人员使用GPT-4生成了指令跟随数据集,该数据集包含人类用户与AI助手之间关于图像内容的虚拟对话。
- 该数据集用于微调LLaVA模型,LLaVA由两个基础模型组成:CLIP用于视觉处理,LLaMA用于语言处理,并通过一个额外的网络层将两者连接起来。
- 在ScienceQA训练数据集上进一步微调后,LLaVA在基准测试中达到了92.53%的准确率,创下新纪录。
模型架构:
- LLaVA架构包括CLIP基础模型和一个投影矩阵层,用于将图像转换为词嵌入空间;文本输入也被转换到同一空间。
- 图像和词令牌随后传递给LLaMA解码器以生成输出。
- 预训练过程首先训练投影矩阵,然后微调过程更新投影层和LLaMA解码器的权重;CLIP权重保持不变。
研究目标与方法
研究团队的目标是通过视觉指令调优端到端地训练模型。他们从COCO数据集中提取图像,并使用GPT-4生成指令跟随数据,包括人与助手之间的虚拟对话、关于图像细节的问题以及需要推理的图像内容问题。生成的数据集包含158K样本。
与MiniGPT-4的比较
LLaVA的共同作者李春元在Twitter上回答了关于LLaVA与MiniGPT-4比较的问题。他指出,LLaMA能够重现GPT-4论文中的基于图像的结果,而MiniGPT-4无法做到。此外,LLaVA具有严格的定量结果,包括与Visual Chat和GPT-4的相似性水平、在Science QA上的最先进准确率以及对数据迭代和模型设计的消融研究。
开源与资源
LLaVA的源代码已在GitHub上开源,项目网站上提供了一个交互式演示。训练数据和模型权重可在Huggingface上获取。该模型在LLaMA之上使用增量权重,“仅用于研究目的”。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。