NExT-GPT:新加坡国立大学开源的多模态大语言模型
新加坡国立大学(NUS)的NExT研究中心最近开源了NExT-GPT,这是一种“任意到任意”的多模态大语言模型(LLM),能够处理文本、图像、视频和音频作为输入或输出。NExT-GPT基于现有的预训练模型,在训练过程中仅需更新其总参数的1%。
主要特点
- 多模态处理能力:NExT-GPT能够理解并生成文本、图像、视频和音频。
- 基于开源模型:系统使用开源的预训练编码器和解码器,包括Vicuna和Stable Diffusion,并在它们之间加入可训练的神经网络层。
- 创新训练技术:NExT团队发明了称为“模态切换指令微调”(MosIT)的技术,用于训练这些层。
架构
NExT-GPT的架构分为三个层次:
- 编码阶段加线性投影:将各种输入模态映射到单一空间。
- Vicuna LLM核心:生成令牌,包括指示输出模态的信号令牌。
- 解码阶段:由特定模态的转换器层和解码器组成。
由于编码器、解码器和Vicuna模型是冻结的,训练过程中仅更新约1%的参数,从而节省了训练成本。
训练与评估
- 指令微调:NUS团队创建了一个包含人类用户与聊天机器人之间对话示例的数据集,涵盖多种模态的输入和输出场景。数据集包含约5,000个对话。
- 性能评估:在多个多模态生成基准测试中,NExT-GPT表现与基线模型相当。人类评委在1到10的评分范围内,对图像生成场景的评分高于视频和音频。
技术细节
- 模态信号令牌生成:特殊令牌由LLM在用户请求NExT-GPT展示图像、视频或声音时生成。训练期间,这些预定义的特殊令牌被插入到LLM的词汇表中。
- 开源与演示:NExT-GPT的代码和模型文件已在GitHub上发布,并提供了一个交互式演示。
多模态AI研究背景
多模态AI是当前活跃的研究领域。NExT-GPT的发布为构建能够建模通用模态的AI代理展示了可能性,推动了更接近人类的AI研究。此前,DeepMind的Flamingo、OpenAI的GPT-4以及微软的Visual ChatGPT和LLaVA等模型也在这一领域取得了进展。
NExT-GPT的架构设计和训练方法为未来的多模态AI研究提供了新的思路和工具。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。