在移动设备和笔记本电脑上原生运行大型语言模型

MLC LLM 项目概述

MLC LLM 是一个新的开源项目,旨在将大型语言模型部署到各种硬件平台和应用中。该项目还包含一个框架,用于针对每个特定用例优化模型性能。

使命与目标

项目使命是让每个人都能在本地设备上开发、优化和部署 AI 模型。所有操作都无需服务器支持,并在手机和笔记本电脑上通过本地 GPU 加速运行。

技术基础

MLC LLM 的核心技术是机器学习编译(MLC),它结合了 ML 编程抽象、学习驱动的搜索、编译和优化的库运行时,以实现轻松部署。

主要挑战

与服务器级系统的部署相比,MLC LLM 面临的主要挑战是硬件规格的异构性。这包括支持不同型号的 CPU、GPU 以及其他协处理器和加速器;解决内存限制;以及应对操作系统环境的差异,例如某些依赖项(如 Python 或特定包)可能无法始终得到保证。

技术依赖

为了实现这些目标,MLC LLM 基于 Apache TVM Unity(一个深度学习系统的编译器堆栈),并利用了 Hugging Face 和 Google 的分词器,以及 Llama、Vicuna、Dolly 等开源大型语言模型。

工具与应用

项目包括一个 C++ CLI 工具 和一个 iOS 聊天应用,展示了如何集成编译后的工件和所需的前/后处理步骤。

硬件支持

MLC LLM 可以部署在以下硬件上:

  • Apple Silicon:包括 iPhone 14 Pro、搭载 M1 或 A12Z 芯片的 iPad Pro、以及 M1 及更新型号的 MacBook Pro。
  • AMD GPU:包括 Raden Pro 5300M、Steam Deck 上的 AMD GPU、RX6800 16G VRAM 等。
  • NVIDIA GPU:包括 GTX 1060 (6GB)、RTX 3080、RTX 2080Ti 等。
  • Intel UHD Graphics 630 GPU
  • Android 设备:支持正在开发中。

性能表现

不同硬件的性能差异显著:

  • 多个 NVIDIA GPU、AMD RX6800 16G VRAM 和 2021 MacBook Pro M1 Max 的生成速度超过 20 个 token/秒。
  • M1 iPad Pro 的生成速度为 10.6 个 token/秒。
  • iPhone 14 Pro 的生成速度为 7.2 个 token/秒。

项目优势

项目维护者表示,MLC LLM 使得快速实验、尝试编译器优化并最终轻松部署到目标设备成为可能。

相关资源

  • 官方文档MLC 文档 详细介绍了用于表示机器学习程序的关键抽象、自动优化技术以及如何优化依赖项、内存和性能。
  • 配套项目WebLLM 是一个专注于 Web 浏览器的配套项目。
阅读 26
0 条评论