Meta AI 的大型语言模型,参数减少 10 倍

Meta AI 发布新大型语言模型 LLaMA

Meta AI 近日发布了名为 LLaMA(Language Large Models Meta AI)的新大型语言模型,该模型在性能上超越了 GPT-3 等基础模型,并与 PaLM 竞争,尽管其参数量仅为后者的十分之一。LLaMA 提供了多个版本,参数量从 70 亿到 650 亿不等。

模型性能与训练

LLaMA 使用的数据集包含来自 GitHub、Wikipedia、arXiv 和 Stack Exchange 等公开来源的 1.4 万亿个 token,采用了字节对编码(Byte-Pair Encoding)和 SentencePiece 软件进行 tokenization。模型架构基于 Transformer,使用了预归一化和 SwiGLU 激活函数。此外,LLaMA 采用了基于旋转的位置嵌入表示(Rotary Embeddings)和 AdamW 优化算法,并通过梯度裁剪和检查点技术提高了训练效率。

模型表现与任务

LLaMA 在自然问题、常识推理和数学推理等语言任务上表现优于 PaLM 和 GPT-3。例如,在精确匹配(EM)指标上,LLaMA 33B 的得分为 24.9,高于 GPT-3 的 14.6 和 PaLM-540B 的 21.2。LLaMA 可用于文本生成、对话、文本摘要以及解决数学定理或预测蛋白质结构等复杂任务。

模型应用与社区反馈

尽管 LLaMA 的主要应用集中在文本生成和对话方面,但社区对其较低的计算负担和与 GPT-3 或 PaLM 相当的性能表示赞赏。然而,社区对仅向学术界开放权重表示质疑。此外,LLaMA 的推理速度也受到了关注。

偏见与内容生成

大型语言模型在训练数据中可能会复制和放大偏见,并生成有毒或冒犯性内容。与 GPT-3 相比,LLaMA 65B 在性别和宗教等话题上的偏见略少。

模型获取与实现

LLaMA 的推理代码和权重可以通过 GitHub 获取,但仅限于学术用途。尽管权重未向非学术界开放,但已通过种子文件泄露。社区还开发了基于 HuggingFace 的 LLaMA 7B 提示 UI。

结论

Meta AI 的 LLaMA 模型在性能和效率上取得了显著进展,尽管在权重共享和偏见问题上仍存在争议,但其在语言任务中的表现和较低的计算负担使其成为大型语言模型领域的重要竞争者。

阅读 25
0 条评论