MLC LLM 项目概述
MLC LLM 是一个新的开源项目,旨在将大型语言模型部署到各种硬件平台和应用中。该项目还包含一个框架,用于针对每个特定用例优化模型性能。
使命与目标
项目使命是让每个人都能在本地设备上开发、优化和部署 AI 模型。所有操作都无需服务器支持,并在手机和笔记本电脑上通过本地 GPU 加速运行。
技术基础
MLC LLM 的核心技术是机器学习编译(MLC),它结合了 ML 编程抽象、学习驱动的搜索、编译和优化的库运行时,以实现轻松部署。
主要挑战
与服务器级系统的部署相比,MLC LLM 面临的主要挑战是硬件规格的异构性。这包括支持不同型号的 CPU、GPU 以及其他协处理器和加速器;解决内存限制;以及应对操作系统环境的差异,例如某些依赖项(如 Python 或特定包)可能无法始终得到保证。
技术依赖
为了实现这些目标,MLC LLM 基于 Apache TVM Unity(一个深度学习系统的编译器堆栈),并利用了 Hugging Face 和 Google 的分词器,以及 Llama、Vicuna、Dolly 等开源大型语言模型。
工具与应用
项目包括一个 C++ CLI 工具 和一个 iOS 聊天应用,展示了如何集成编译后的工件和所需的前/后处理步骤。
硬件支持
MLC LLM 可以部署在以下硬件上:
- Apple Silicon:包括 iPhone 14 Pro、搭载 M1 或 A12Z 芯片的 iPad Pro、以及 M1 及更新型号的 MacBook Pro。
- AMD GPU:包括 Raden Pro 5300M、Steam Deck 上的 AMD GPU、RX6800 16G VRAM 等。
- NVIDIA GPU:包括 GTX 1060 (6GB)、RTX 3080、RTX 2080Ti 等。
- Intel UHD Graphics 630 GPU。
- Android 设备:支持正在开发中。
性能表现
不同硬件的性能差异显著:
- 多个 NVIDIA GPU、AMD RX6800 16G VRAM 和 2021 MacBook Pro M1 Max 的生成速度超过 20 个 token/秒。
- M1 iPad Pro 的生成速度为 10.6 个 token/秒。
- iPhone 14 Pro 的生成速度为 7.2 个 token/秒。
项目优势
项目维护者表示,MLC LLM 使得快速实验、尝试编译器优化并最终轻松部署到目标设备成为可能。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。