阿布扎比技术研究院发布 Falcon 180B 大语言模型
阿布扎比政府下属的技术创新研究院(Technology Innovation Institute, TII)发布了目前最大的开源大语言模型 Falcon 180B。该模型包含 1800 亿参数,在 MMLU(多任务语言理解)基准测试中表现优于 GPT-3.5。
关键信息与细节
模型训练与数据
- 训练数据:Falcon 180B 使用了 3.5 万亿个文本令牌进行训练,是 Llama 2 训练数据量的 4 倍。
- 数据集:基于 TII 的 RefinedWeb 数据集,数据量从 1.5 万亿令牌增加到 3 万亿。
- 训练资源:训练过程耗时约 700 万 GPU 小时,使用了 4096 个 GPU 并行运行,主要依托亚马逊的 Sagemaker 平台。
模型架构与创新
- 架构基础:Falcon 180B 基于 TII 此前发布的 Falcon 40B 模型。
- 创新技术:采用了多查询注意力机制(multiquery attention),显著降低了推理时的内存带宽需求。
模型性能
- 性能对比:TII 表示 Falcon 180B 的性能“难以明确排名”,但在某些基准测试中与谷歌的 PaLM 2 Large 相当,介于 GPT-3.5 和 GPT-4 之间。
- 应用领域:除了基础模型,TII 还发布了针对聊天任务优化的指令微调模型。
开源与商业使用
- 开源政策:TII 强调创新应被允许蓬勃发展,因此将所有 Falcon 模型开源或开放访问。Falcon 180B 可作为开放访问模型用于研究和商业用途。
- 使用限制:虽然模型可用于商业用途,但许可证包含多项限制,尤其是在托管服务中使用时需要额外许可。
用户反馈与讨论
- 本地运行挑战:由于模型规模庞大,大多数用户难以在本地运行。然而,Huggingface 科学家指出,4 位量化的 Falcon 180B 与 bfloat-16 版本在推理质量上无差异,可减少 75% 的内存需求。
- 开发者实践:llama.cpp 开发者 Georgi Gerganov 成功在 Apple M2 Ultra 上运行该模型。
- 生成能力预测:HyperWrite CEO Matt Shumer 预测,距离 GPT-4 级别的开源模型出现不到两个月。
- 代码训练争议:NVIDIA 高级 AI 科学家 Jim Fan 批评模型在源代码数据上的训练不足(仅占 5%),认为代码数据对提升推理能力、掌握工具使用和驱动 AI 代理至关重要。
可用资源
- 模型下载:Falcon 180B 的基础模型和聊天模型均可在 Hugging Face Hub 上获取。
- 互动演示:Huggingface 提供了交互式聊天演示和 RefinedWeb 数据集。
总结
Falcon 180B 是目前最大的开源大语言模型,凭借其庞大的参数规模和创新的架构设计,在多任务语言理解等基准测试中表现出色。TII 通过开源策略推动全球创新,同时模型的商业使用仍受一定限制。尽管在代码训练方面存在争议,Falcon 180B 的发布标志着开源大语言模型领域的重要进展,为未来更高性能的开源模型铺平了道路。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。