吐槽本地部署LLM的显卡久了,就想多了解一下显卡。
1. AI依赖显卡
AI领域与显卡(尤其是GPU)的关系极为密切,显卡的性能和架构设计直接影响了AI技术的发展速度和实际应用效果。
1.1. 为什么AI依赖显卡?
- 并行计算能力:
AI的核心运算(如矩阵乘法、卷积等)需要处理海量数据,而GPU的数千个计算核心(如NVIDIA CUDA核心)擅长并行计算,比CPU(通常几个到几十个核心)更适合加速这类任务。 - 高吞吐量:
训练深度学习模型需要反复调整数百万甚至数十亿参数,GPU的高内存带宽(如HBM显存)能快速传输数据,显著减少训练时间。 - 专用硬件加速:
现代GPU(如NVIDIA的Tensor Core)针对AI运算优化,支持混合精度计算(FP16/FP32)和稀疏计算,进一步提升效率。
1.2. 显卡在AI中的关键应用场景
- 模型训练:
训练大规模神经网络(如GPT、ResNet)需要数周甚至数月,使用多块GPU(如NVIDIA A100/H100)可将时间缩短到几天。 - 模型推理:
部署AI应用(如人脸识别、语音助手)时,GPU能实时处理输入数据(如Tesla T4常用于云端推理)。 特定任务优化:
- 计算机视觉:GPU加速卷积运算(CNN)。
- 自然语言处理(NLP):Transformer模型依赖GPU的矩阵运算。
- 科学计算:如AlphaFold的蛋白质结构预测。
2. AI:显卡 vs CPU
2.1. 硬件参数详细对比
1、消费级-高端 :CPU、显卡参数对比
| 项目 | Intel i7-13700K | NVIDIA RTX 4090 |
|---|---|---|
| 核心数 | 16(8P核+8E核) | 16384 CUDA核心 |
| 线程数 | 24 | 并行处理单元16384个 |
| 主频 | 3.4~5.4 GHz | 基础2235MHz,Boost 2520MHz |
| L3缓存 | 30MB | - |
| 内存容量 | 32GB DDR5(可扩展) | 24GB GDDR6X显存 |
| 内存带宽 | ~90GB/s(DDR5-5600) | 1TB/s(1000GB/s) |
| 浮点运算性能 | ~1.5 TFLOPS(双精度) | 82.6 TFLOPS(FP32单精度) |
| 架构特点 | 少核高主频,通用型 | 大量并行核,专为张量运算优化 |
| 价格 | 约2500元人民币 | 约1.2万元人民币 |
2、消费级-普通: CPU、显卡参数对比
| 项目 | i5-12400 | GTX 1650 | 集成显卡(Iris Xe) |
|---|---|---|---|
| 核心数 | 6核12线程 | 896 CUDA核心 | 96 EU |
| 主频 | 2.5~4.4GHz | 1485MHz | 400~1350MHz |
| 内存/显存 | 16GB DDR4 | 4GB GDDR5 | 与主内存共享 |
| 内存带宽 | ~25GB/s | 128GB/s | ~20~30GB/s |
| 浮点算力 | ~0.6 TFLOPS | 3 TFLOPS | ~0.5 TFLOPS |
| 价格 | 900元 | 1000元 | — |
2.2. 参数对比对实际AI场景的影响
- 核心数与并行能力
CPU:16核24线程
- 适合多任务、通用计算、逻辑分支多的任务。
- 面对深度学习大规模矩阵运算时,并行度远低于GPU。
GPU:16384 CUDA核心
- 专为并行矩阵/张量计算设计,适合神经网络的前向/反向传播。
- 大模型训练/推理时,可将运算任务切分到上万核心同时执行,速度极快。
- 内存/显存带宽与容量
CPU内存:带宽90GB/s,容量32GB(可扩展)
- 足够数据预处理、小模型推理,但难以承载大模型训练和高并发推理。
GPU显存:带宽1000GB/s,容量24GB
- 显存带宽是CPU内存的10倍以上,支持大batch并行训练、推理,加载大模型时不易成为瓶颈。
- 24GB显存能直接载入BERT-large、Llama-13B等大模型。
- 浮点运算性能(TFLOPS)
CPU约1.5 TFLOPS(双精度)
- 单位时间内浮点计算能力较弱。
GPU高达82.6 TFLOPS(单精度)
- AI任务主要依赖单精度/混合精度,GPU算力远超CPU,训练/推理效率高出一个数量级。
2.3. 实际场景详细对比
- 大模型训练(如BERT、Stable Diffusion)
CPU:
- 16核并行度有限,1.5TFLOPS浮点性能,90GB/s带宽。
- 训练速度极慢,显著受内存带宽和多核调度影响。
GPU:
- 16384核,82.6TFLOPS,1000GB/s带宽,专为大规模矩阵运算设计。
- 训练速度快几十倍到百倍,可实现分布式/多卡训练。
- 结论:GPU训练大模型效率远超CPU,是唯一可行选择。
- 大模型推理/生成(如ChatGPT、Stable Diffusion)
CPU:
- 单次推理只能用有限核数,带宽受限。
- Llama-7B、Stable Diffusion等模型推理慢,显存不足时需频繁调度数据,导致延迟更高。
GPU:
- 可同时推理多个请求,显存充足,数据高速交换。
- 单次推理速度快,支持高并发在线服务。
- 结论:GPU推理速度、并发能力和大模型兼容性全面碾压CPU。
- 小模型推理/文本分类/情感分析
CPU:
- 多核可并发处理,内存容量足,推理延迟几十毫秒,适合轻量模型。
GPU:
- 批量推理速度更快,但小模型单次推理优势不明显。
- 结论:CPU可胜任,GPU在高并发或批量场景下更优。
示例
| 场景 | 关键参数 | CPU(i7-13700K) | GPU(RTX 4090) |
|---|---|---|---|
| 大模型训练 | 核心/带宽/算力 | 16核/90GB/s/1.5TFLOPS | 16384核/1000GB/s/82.6TFLOPS |
| 效率 | 慢,几天~数周 | 快,数小时~一天 | |
| 大模型推理/生成 | 显存/带宽/并行 | 32GB/90GB/s/24线程 | 24GB/1000GB/s/16384线程 |
| 效率 | 单请求慢、并发弱 | 单请求快、高并发 | |
| 小模型推理 | 内存/并发 | 足够,几十毫秒/条 | 更快,适合批量/高并发 |
3. 显卡的组成
显卡(Graphics Card,又称GPU,Graphics Processing Unit)是计算机中负责图像处理和并行计算的核心硬件,尤其在游戏、AI、科学计算等领域至关重要。
显卡组成部分
| 特征 | 说明 | 示例(低/中/高端) | 对AI大模型影响 |
|---|---|---|---|
| 显存容量 | 存放数据/模型 | 4GB/8GB/24GB | 决定能否加载大模型 |
| CUDA核心数 | 并行计算能力 | 896/3584/16384 | 决定算力上限 |
| 显存带宽 | 数据吞吐速度 | 128GB/s/360GB/s/1000GB/s | 影响训练推理效率 |
| 浮点性能 | 计算速度 | 3TFLOPS/13TFLOPS/82.6TFLOPS | 影响AI/GPU任务速度 |
| 架构代际 | 设计新旧、特性 | Turing/Ampere/Ada Lovelace | 新架构更高效 |
| 专用单元 | AI/光追硬件 | 有/无Tensor Core | 有则AI速度大幅提升 |
| 功耗 | 最大耗电 | 75W/170W/450W | 需配合电源散热 |
| 接口 | PCIe/视频输出 | PCIe 3.0/4.0/HDMI/DP | 影响扩展能力 |
| 驱动生态 | 软件支持 | 新卡支持更好 | 影响AI开发体验 |
下面详细介绍各个组成部分。
3.1. 显存(VRAM)
定义:显存就是显卡上的专用内存,用于存储显卡正在处理的数据、纹理、神经网络参数等。
- 容量越大,能加载更大的AI模型、更高分辨率的图片或视频、更复杂的游戏场景。
- 对于AI大模型,显存容量是能否运行、训练大模型的硬性门槛。
例子:
- 4GB显存:仅能运行小型模型,如小型图片、视频、AI模型(如MobileNet、DistilBERT)。
- 8GB显存:可运行主流游戏中等画质,AI能跑如Stable Diffusion等中小模型。
- 24GB显存(如RTX 4090):可以加载和推理13B参数的LLM(如Llama-13B),并行训练大模型,支持4K甚至8K高分辨率渲染。
3.2. CUDA核心数
定义:CUDA核心是NVIDIA显卡用于并行处理计算任务的基础单元,相当于“微型处理器”。
- 核心数越多,显卡理论上并行计算能力越强。
- 但要结合架构、主频等综合看待。
例子:
- GTX 1650:896个CUDA核心,适合入门级AI推理、轻度游戏。
- RTX 3060:3584个CUDA核心,主流级别,适合中大型AI推理/训练、主流3A游戏。
- RTX 4090:16384个CUDA核心,顶级性能,适合AI大模型训练、4K/8K游戏。
3.3. 显存带宽(Memory Bandwidth)
定义:显存带宽指的是显卡和显存之间每秒能传输的数据量,单位为GB/s。
- 带宽越大,数据交换越快,尤其对大模型训练/推理、高清视频渲染等高吞吐场景很重要。
例子:
- GTX 1650:128GB/s,适合轻度AI和游戏。
- RTX 3060:360GB/s,满足大多数AI和高分辨率游戏。
- RTX 4090:1008GB/s,几乎没有带宽瓶颈,适合超大模型和高分辨率渲染。
3.4. 浮点运算能力(FLOPS)
定义:指显卡每秒能执行多少次浮点数计算,常见单位有TFLOPS(万亿次/秒)。
- FLOPS越高,AI模型训练和推理速度越快,3D渲染效率越高。
例子:
- GTX 1650:约3 TFLOPS。
- RTX 3060:13 TFLOPS。
- RTX 4090:82.6 TFLOPS。
3.5. 架构代际(如Ampere、Ada Lovelace等)
定义:显卡的“架构”是NVIDIA设计的芯片代数,不同架构优化点不同。
- 新架构通常代表更高能效、更强性能和新特性支持。
例子:
- Turing(如RTX 20系):首次引入光线追踪(RT Core)。
- Ampere(RTX 30系):大幅提升AI/渲染性能。
- Ada Lovelace(RTX 40系):性能更高、AI能力更强。
3.6. 专用单元(Tensor Core、RT Core等)
定义:新架构显卡中集成了专门加速AI和光线追踪的硬件单元。
- Tensor Core:专为AI深度学习加速,混合精度计算速度极快。
- RT Core:专为实时光线追踪渲染。
例子:
- RTX 3060及以上才有Tensor Core,可大幅提升AI推理/训练效率。
- GTX 1650无Tensor Core,AI性能较弱。
3.7. 功耗(TDP)
定义:显卡满载时最大功率,单位为瓦(W)。
- 高端显卡功耗高,需要更好的散热和电源。
- 功耗不是性能高低的唯一指标,但要考虑整机搭配。
例子:
- GTX 1650:约75W。
- RTX 3060:约170W。
- RTX 4090:约450W。
3.8. 接口/扩展性
定义:显卡的输出接口种类、支持的PCIe代数等,影响数据传输和外接显示器能力。
例子:
- PCIe 4.0带宽高于PCIe 3.0,有利于数据传输。
- HDMI 2.1、DP 1.4支持高分辨率高刷新率输出。
3.9. 驱动与生态支持
定义:是否有良好的驱动和AI/游戏软件支持。
例子:
- RTX系列支持CUDA、cuDNN、TensorRT、PyTorch等主流AI框架。
- 部分入门卡或老卡可能驱动不再更新,AI支持不佳。
3.10. 显卡各组成部分对AI对重要度
| 组成部分 | 是否重要 | 说明(对大模型AI应用的作用) |
|---|---|---|
| 显存容量 | ★★★ | 决定能否加载大模型和批量大小 |
| CUDA核心数 | ★★★ | 决定并行算力,影响训练/推理速度 |
| 显存带宽 | ★★☆ | 影响数据吞吐,关系到大模型效率 |
| 浮点性能 | ★★★ | 决定模型计算能力,训练/推理速度 |
| Tensor Core | ★★★ | 专门加速AI计算,现代大模型必需 |
| 架构代际 | ★★☆ | 新架构更高效,支持新特性 |
| 功耗 | ★☆☆ | 影响部署和能耗,但非直接决定性能 |
| 接口/扩展性 | ★☆☆ | 多卡/服务器部署时需考虑 |
| 驱动生态 | ★★★ | 影响框架兼容和开发体验 |
4. 显卡市场
目前市场上的显卡主要由 NVIDIA(英伟达)、AMD(超威半导体)、Intel(英特尔) 三大厂商主导,此外还有一些国产显卡厂商(如华为、摩尔线程)正在发展。
显卡市场总结
| 厂商 | 游戏表现 | AI 计算 | 性价比 | 适合人群 |
|---|---|---|---|---|
| NVIDIA | 🌟🌟🌟🌟🌟 | 🌟🌟🌟🌟🌟 | ❌ 贵 | 高端玩家/AI 开发者 |
| AMD | 🌟🌟🌟🌟 | 🌟🌟 | ✅ 性价比高 | 预算有限的游戏玩家 |
| Intel | 🌟🌟 | 🌟 | ✅ 便宜 | 轻度游戏/视频剪辑用户 |
| 国产显卡 | 🌟 | 🌟🌟 | ❌ 生态弱 | 政企/信创/AI 国产化需求 |
4.1. NVIDIA(英伟达)
市场地位:AI 和游戏显卡的绝对霸主,占据约 80% 独立显卡市场份额(尤其是高端市场)。
优势:CUDA 生态垄断、DLSS/AI 技术领先、专业计算卡(如 H100)统治 AI 和数据中心。
主流产品线
| 系列 | 代表型号 | 定位 | 特点 |
|---|---|---|---|
| GeForce RTX 40 系列 | RTX 4090、4080 Super | 高端游戏/AI | DLSS 3、光追最强,但价格昂贵 |
| GeForce RTX 30 系列 | RTX 3060 Ti、3080 | 主流游戏 | 性价比高,二手市场活跃 |
| RTX 5000 系列(2025) | RTX 5090(未发布) | 下一代旗舰 | Blackwell 架构,AI 性能更强 |
| 专业计算卡 | H100、B100 | AI/超算 | 用于 ChatGPT 级大模型训练 |
评价:
✅ 游戏性能顶级,AI 计算无敌,软件生态(CUDA)最强。
❌ 价格昂贵(RTX 4090 约 1.6 万+),垄断导致缺乏竞争。
4.2. AMD(超威半导体)
市场地位:NVIDIA 主要竞争对手,游戏显卡性价比高,但 AI 生态较弱。
优势:RDNA 3 架构能效比优秀,FSR 技术可对抗 DLSS。
主流产品线
| 系列 | 代表型号 | 定位 | 特点 |
|---|---|---|---|
| Radeon RX 7000 系列 | RX 7900 XTX、7800 XT | 高端游戏 | 性价比高,但光追稍弱 |
| Radeon RX 6000 系列 | RX 6800 XT | 上一代旗舰 | 二手市场性价比不错 |
| Instinct MI 系列 | MI300X | AI/计算 | 192GB HBM3,挑战 NVIDIA H100 |
评价:
✅ 游戏性价比高(RX 7900 XTX 性能接近 RTX 4080,但便宜 20%)。
❌ 光追、AI 计算(如 Stable Diffusion)不如 NVIDIA,驱动优化一般。
4.3. Intel(英特尔)
市场地位:2022 年才进入独立显卡市场,仍在追赶 NVIDIA/AMD。
优势:性价比不错,支持 XeSS 超分辨率技术。
主流产品线
| 系列 | 代表型号 | 定位 | 特点 |
|---|---|---|---|
| Arc A 系列 | Arc A770(16GB) | 中端游戏 | 1080P 高画质流畅,支持 XeSS |
| 数据中心 GPU | Ponte Vecchio | 超算/AI | 用于超级计算机 |
评价:
✅ 价格亲民(A770 16GB 约 2000 元),视频编解码能力强。
❌ 游戏兼容性一般,驱动仍需优化,高端市场缺席。
4.4. 国产显卡
市场现状:受制裁影响,仍在发展初期,主要面向 AI 和信创市场。
代表厂商与产品
| 厂商 | 代表型号 | 定位 | 表现 |
|---|---|---|---|
| 华为昇腾(Ascend) | 昇腾 910B | AI 计算 | 对标 NVIDIA A100,国内大模型训练主力 |
| 摩尔线程(MTT) | MTT S80 | 游戏/办公 | 支持 DirectX,但性能≈GTX 1050,生态弱 |
| 景嘉微(JM) | JM9 系列 | 军用/信创 | 性能较低,主要用于国产化替代 |
评价:
✅ 国产替代重要力量,昇腾在 AI 领域有一定竞争力。
❌ 游戏显卡性能落后 NVIDIA/AMD 5-10 年,生态(如 CUDA 替代)是最大瓶颈。
5. NVIDIA 显卡
高端显卡市场基本都是 NVIDIA(英伟达)的天下,主要介绍 NVIDIA 的各系列显卡吧。
5.1. 各显卡系列
NVIDIA显卡主要系列及定位
| 应用场景 | 推荐系列 | 代表型号 | 预算建议 | 说明 |
|---|---|---|---|---|
| 日常娱乐/办公 | GT/GTX | GTX 1650 | <2000元 | 入门卡,非AI主力 |
| 主流AI推理/游戏 | RTX | RTX 3060/4060 | 3000~5000元 | 能跑小/中模型 |
| 大模型推理/开发 | RTX | RTX 4090 | 12000~15000元 | 24GB显存,能跑13B模型 |
| 专业渲染/科研 | RTX A/Quadro | RTX A6000 | 35000~50000元 | 大显存、ECC |
| AI大模型训练 | A/H/Hopper | H100/H200 | 25万~40万元 | 仅企业/研究所负担得起 |
NVIDIA各系列核心参数对比表
| 系列/型号 | 架构 | CUDA核心数 | 显存类型/容量 | 显存带宽 | Tensor Core | 典型用途 | 价格区间(元/万元) |
|---|---|---|---|---|---|---|---|
| GTX 1650 | Turing | 896 | 4GB GDDR5 | 128GB/s | 无 | 入门游戏/AI学习 | 800~1200 |
| RTX 3060 | Ampere | 3584 | 12GB GDDR6 | 360GB/s | 第3代 | 主流游戏/AI推理 | 2500~3000 |
| RTX 4090 | Ada | 16384 | 24GB GDDR6X | 1008GB/s | 第4代 | 顶级游戏/AI大模型 | 12000~15000 |
| RTX A6000 | Ampere | 10752 | 48GB GDDR6 ECC | 768GB/s | 第3代 | 专业渲染/科研 | 35000~50000 |
| A100 | Ampere | 6912 | 40/80GB HBM2e | 1555GB/s | 第3代 | AI训练/推理 | 10~20万 |
| H100 | Hopper | 14592 | 80GB HBM3 | 3.35TB/s | 第4代 | AI大模型训练/推理 | 25~35万 |
| H200 | Hopper | 14592 | 141GB HBM3e | 4.8TB/s | 第4代 | AI大模型训练/推理 | 30~40万 |
1)GT/GTX系列
- 面向:普通消费者、学生、入门级用户
- 特点:无Tensor Core,价格低,适合日常娱乐和轻度AI
- 示例:GTX 1650,4GB显存,跑大模型非常吃力,只能做小模型推理和入门AI实验
2)RTX系列(消费级)
- 面向:游戏玩家、AI开发者、内容创作者
- 特点:拥有Tensor Core(AI加速)、RT Core(光线追踪),适合大部分AI推理和中小模型训练
- 示例:RTX 3060、RTX 4090,24GB显存的4090可跑Llama-13B等大模型推理/微型训练
3)Quadro/RTX A系列(专业工作站)
- 面向:工业设计、影视动画、科研
- 特点:大显存、高稳定性、ECC支持、驱动优化,价格高
- 示例:RTX A6000,48GB显存,适合科研与大型渲染任务
4)Tesla/A/H/Hopper系列(数据中心/AI服务器)
- 面向:数据中心、云计算、AI大模型训练/推理
- 特点:极高的显存、带宽、算力,专为AI大模型设计,价格极高
- 示例:A100(80GB HBM2e),H100(80GB HBM3),H200(141GB HBM3e),AI训练/推理神器
5.2. NVIDIA H系列
H系列算是 AI大模型应用的主力军了。
NVIDIA H系列(数据中心AI卡)能力与价格横向对比
| 型号 | 显存容量 | CUDA核心数 | 显存带宽 | 浮点性能(FP16/FP32) | Tensor Core | 架构 | 典型价格(万元) | 综合排序 |
|---|---|---|---|---|---|---|---|---|
| H200 | 141GB HBM3e | 14592 | 4.8TB/s | 197/67 TFLOPS | 第4代 | Hopper | 30-40 | 1 |
| H100 | 80GB HBM3 | 14592 | 3.35TB/s | 197/67 TFLOPS | 第4代 | Hopper | 25-35 | 2 |
| H800 | 80GB HBM2e | 14592 | 2.0TB/s | 155/51 TFLOPS | 第4代 | Hopper | 25-30 | 3 |
| H20 | 96GB HBM3 | 10752 | 1.5TB/s | 146/47 TFLOPS | 第4代 | Hopper | 15-20 | 4 |
注:价格为2024年市场估值,仅供参考。综合排序按AI大模型能力+显存+带宽+性价比。
H20 显卡最近2年很常见,是国内AI火热起来时最常见的显卡了。2023年10月,美国升级对华AI芯片禁令,H100/A100 被禁售,NVIDIA 为中国市场定制 H20、L20、L2 等降规版芯片。
由于美国出口管制政策,H20 是 H100 的降规版本。虽性能缩水,但仍强于大部分国产芯片(如摩尔线程)。懂王今年一度连 H20 都限制出售了,现在 H20 就算是国内能买到显卡的天花板了。
5.3. NVIDIA RTX系列
RTX 系列算是 NVIDIA 消费级显卡中的第一梯队了,能轻松拿下各类3A游戏大作。和 H系列对比,看看常见显卡的参数呢。
NVIDIA RTX系列消费级显卡能力与价格横向对比
| 型号 | 显存容量 | CUDA核心数 | 显存带宽 | 浮点性能(FP32) | Tensor Core | 架构 | 典型价格(元) | 综合排序 |
|---|---|---|---|---|---|---|---|---|
| RTX 4090 | 24GB GDDR6X | 16384 | 1008GB/s | 82.6 TFLOPS | 第4代 | Ada | 12000-15000 | 1 |
| RTX 4080 | 16GB GDDR6X | 9728 | 717GB/s | 49 TFLOPS | 第4代 | Ada | 8000-9000 | 2 |
| RTX 3090 | 24GB GDDR6X | 10496 | 936GB/s | 35.6 TFLOPS | 第3代 | Ampere | 9000-11000 | 3 |
| RTX 3080 | 10GB GDDR6X | 8704 | 760GB/s | 29.8 TFLOPS | 第3代 | Ampere | 6000-7000 | 4 |
注:价格为2024年市场主流行情。综合排序按大模型推理/训练能力+显存+性价比。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。