吐槽本地部署LLM的显卡久了,就想多了解一下显卡。

1. AI依赖显卡

AI领域与显卡(尤其是GPU)的关系极为密切,显卡的性能和架构设计直接影响了AI技术的发展速度和实际应用效果。

1.1. 为什么AI依赖显卡?

  • 并行计算能力
    AI的核心运算(如矩阵乘法、卷积等)需要处理海量数据,而GPU的数千个计算核心(如NVIDIA CUDA核心)擅长并行计算,比CPU(通常几个到几十个核心)更适合加速这类任务。
  • 高吞吐量
    训练深度学习模型需要反复调整数百万甚至数十亿参数,GPU的高内存带宽(如HBM显存)能快速传输数据,显著减少训练时间。
  • 专用硬件加速
    现代GPU(如NVIDIA的Tensor Core)针对AI运算优化,支持混合精度计算(FP16/FP32)和稀疏计算,进一步提升效率。

1.2. 显卡在AI中的关键应用场景

  • 模型训练
    训练大规模神经网络(如GPT、ResNet)需要数周甚至数月,使用多块GPU(如NVIDIA A100/H100)可将时间缩短到几天。
  • 模型推理
    部署AI应用(如人脸识别、语音助手)时,GPU能实时处理输入数据(如Tesla T4常用于云端推理)。
  • 特定任务优化

    • 计算机视觉:GPU加速卷积运算(CNN)。
    • 自然语言处理(NLP):Transformer模型依赖GPU的矩阵运算。
    • 科学计算:如AlphaFold的蛋白质结构预测。

2. AI:显卡 vs CPU

2.1. 硬件参数详细对比

1、消费级-高端 :CPU、显卡参数对比
项目Intel i7-13700KNVIDIA RTX 4090
核心数16(8P核+8E核)16384 CUDA核心
线程数24并行处理单元16384个
主频3.4~5.4 GHz基础2235MHz,Boost 2520MHz
L3缓存30MB-
内存容量32GB DDR5(可扩展)24GB GDDR6X显存
内存带宽~90GB/s(DDR5-5600)1TB/s(1000GB/s)
浮点运算性能~1.5 TFLOPS(双精度)82.6 TFLOPS(FP32单精度)
架构特点少核高主频,通用型大量并行核,专为张量运算优化
价格约2500元人民币约1.2万元人民币
2、消费级-普通: CPU、显卡参数对比
项目i5-12400GTX 1650集成显卡(Iris Xe)
核心数6核12线程896 CUDA核心96 EU
主频2.5~4.4GHz1485MHz400~1350MHz
内存/显存16GB DDR44GB GDDR5与主内存共享
内存带宽~25GB/s128GB/s~20~30GB/s
浮点算力~0.6 TFLOPS3 TFLOPS~0.5 TFLOPS
价格900元1000元

2.2. 参数对比对实际AI场景的影响

  1. 核心数与并行能力
  • CPU:16核24线程

    • 适合多任务、通用计算、逻辑分支多的任务。
    • 面对深度学习大规模矩阵运算时,并行度远低于GPU。
  • GPU:16384 CUDA核心

    • 专为并行矩阵/张量计算设计,适合神经网络的前向/反向传播。
    • 大模型训练/推理时,可将运算任务切分到上万核心同时执行,速度极快。
  1. 内存/显存带宽与容量
  • CPU内存:带宽90GB/s,容量32GB(可扩展)

    • 足够数据预处理、小模型推理,但难以承载大模型训练和高并发推理。
  • GPU显存:带宽1000GB/s,容量24GB

    • 显存带宽是CPU内存的10倍以上,支持大batch并行训练、推理,加载大模型时不易成为瓶颈。
    • 24GB显存能直接载入BERT-large、Llama-13B等大模型。
  1. 浮点运算性能(TFLOPS)
  • CPU约1.5 TFLOPS(双精度)

    • 单位时间内浮点计算能力较弱。
  • GPU高达82.6 TFLOPS(单精度)

    • AI任务主要依赖单精度/混合精度,GPU算力远超CPU,训练/推理效率高出一个数量级。

2.3. 实际场景详细对比

  1. 大模型训练(如BERT、Stable Diffusion)
  • CPU

    • 16核并行度有限,1.5TFLOPS浮点性能,90GB/s带宽。
    • 训练速度极慢,显著受内存带宽和多核调度影响。
  • GPU

    • 16384核,82.6TFLOPS,1000GB/s带宽,专为大规模矩阵运算设计。
    • 训练速度快几十倍到百倍,可实现分布式/多卡训练。
  • 结论:GPU训练大模型效率远超CPU,是唯一可行选择。
  1. 大模型推理/生成(如ChatGPT、Stable Diffusion)
  • CPU

    • 单次推理只能用有限核数,带宽受限。
    • Llama-7B、Stable Diffusion等模型推理慢,显存不足时需频繁调度数据,导致延迟更高。
  • GPU

    • 可同时推理多个请求,显存充足,数据高速交换。
    • 单次推理速度快,支持高并发在线服务。
  • 结论:GPU推理速度、并发能力和大模型兼容性全面碾压CPU。
  1. 小模型推理/文本分类/情感分析
  • CPU

    • 多核可并发处理,内存容量足,推理延迟几十毫秒,适合轻量模型。
  • GPU

    • 批量推理速度更快,但小模型单次推理优势不明显。
  • 结论:CPU可胜任,GPU在高并发或批量场景下更优。
示例
场景关键参数CPU(i7-13700K)GPU(RTX 4090)
大模型训练核心/带宽/算力16核/90GB/s/1.5TFLOPS16384核/1000GB/s/82.6TFLOPS
效率慢,几天~数周快,数小时~一天
大模型推理/生成显存/带宽/并行32GB/90GB/s/24线程24GB/1000GB/s/16384线程
效率单请求慢、并发弱单请求快、高并发
小模型推理内存/并发足够,几十毫秒/条更快,适合批量/高并发

3. 显卡的组成

显卡(Graphics Card,又称GPU,Graphics Processing Unit)是计算机中负责图像处理和并行计算的核心硬件,尤其在游戏、AI、科学计算等领域至关重要。

显卡组成部分
特征说明示例(低/中/高端)对AI大模型影响
显存容量存放数据/模型4GB/8GB/24GB决定能否加载大模型
CUDA核心数并行计算能力896/3584/16384决定算力上限
显存带宽数据吞吐速度128GB/s/360GB/s/1000GB/s影响训练推理效率
浮点性能计算速度3TFLOPS/13TFLOPS/82.6TFLOPS影响AI/GPU任务速度
架构代际设计新旧、特性Turing/Ampere/Ada Lovelace新架构更高效
专用单元AI/光追硬件有/无Tensor Core有则AI速度大幅提升
功耗最大耗电75W/170W/450W需配合电源散热
接口PCIe/视频输出PCIe 3.0/4.0/HDMI/DP影响扩展能力
驱动生态软件支持新卡支持更好影响AI开发体验

下面详细介绍各个组成部分。

3.1. 显存(VRAM)

定义:显存就是显卡上的专用内存,用于存储显卡正在处理的数据、纹理、神经网络参数等。

  • 容量越大,能加载更大的AI模型、更高分辨率的图片或视频、更复杂的游戏场景。
  • 对于AI大模型,显存容量是能否运行、训练大模型的硬性门槛。

例子:

  • 4GB显存:仅能运行小型模型,如小型图片、视频、AI模型(如MobileNet、DistilBERT)。
  • 8GB显存:可运行主流游戏中等画质,AI能跑如Stable Diffusion等中小模型。
  • 24GB显存(如RTX 4090):可以加载和推理13B参数的LLM(如Llama-13B),并行训练大模型,支持4K甚至8K高分辨率渲染。

3.2. CUDA核心数

定义:CUDA核心是NVIDIA显卡用于并行处理计算任务的基础单元,相当于“微型处理器”。

  • 核心数越多,显卡理论上并行计算能力越强。
  • 但要结合架构、主频等综合看待。

例子:

  • GTX 1650:896个CUDA核心,适合入门级AI推理、轻度游戏。
  • RTX 3060:3584个CUDA核心,主流级别,适合中大型AI推理/训练、主流3A游戏。
  • RTX 4090:16384个CUDA核心,顶级性能,适合AI大模型训练、4K/8K游戏。

3.3. 显存带宽(Memory Bandwidth)

定义:显存带宽指的是显卡和显存之间每秒能传输的数据量,单位为GB/s。

  • 带宽越大,数据交换越快,尤其对大模型训练/推理、高清视频渲染等高吞吐场景很重要。

例子:

  • GTX 1650:128GB/s,适合轻度AI和游戏。
  • RTX 3060:360GB/s,满足大多数AI和高分辨率游戏。
  • RTX 4090:1008GB/s,几乎没有带宽瓶颈,适合超大模型和高分辨率渲染。

3.4. 浮点运算能力(FLOPS)

定义:指显卡每秒能执行多少次浮点数计算,常见单位有TFLOPS(万亿次/秒)。

  • FLOPS越高,AI模型训练和推理速度越快,3D渲染效率越高。

例子:

  • GTX 1650:约3 TFLOPS。
  • RTX 3060:13 TFLOPS。
  • RTX 4090:82.6 TFLOPS。

3.5. 架构代际(如Ampere、Ada Lovelace等)

定义:显卡的“架构”是NVIDIA设计的芯片代数,不同架构优化点不同。

  • 新架构通常代表更高能效、更强性能和新特性支持。

例子:

  • Turing(如RTX 20系):首次引入光线追踪(RT Core)。
  • Ampere(RTX 30系):大幅提升AI/渲染性能。
  • Ada Lovelace(RTX 40系):性能更高、AI能力更强。

3.6. 专用单元(Tensor Core、RT Core等)

定义:新架构显卡中集成了专门加速AI和光线追踪的硬件单元。

  • Tensor Core:专为AI深度学习加速,混合精度计算速度极快。
  • RT Core:专为实时光线追踪渲染。

例子:

  • RTX 3060及以上才有Tensor Core,可大幅提升AI推理/训练效率。
  • GTX 1650无Tensor Core,AI性能较弱。

3.7. 功耗(TDP)

定义:显卡满载时最大功率,单位为瓦(W)。

  • 高端显卡功耗高,需要更好的散热和电源。
  • 功耗不是性能高低的唯一指标,但要考虑整机搭配。

例子:

  • GTX 1650:约75W。
  • RTX 3060:约170W。
  • RTX 4090:约450W。

3.8. 接口/扩展性

定义:显卡的输出接口种类、支持的PCIe代数等,影响数据传输和外接显示器能力。

例子:

  • PCIe 4.0带宽高于PCIe 3.0,有利于数据传输。
  • HDMI 2.1、DP 1.4支持高分辨率高刷新率输出。

3.9. 驱动与生态支持

定义:是否有良好的驱动和AI/游戏软件支持。

例子:

  • RTX系列支持CUDA、cuDNN、TensorRT、PyTorch等主流AI框架。
  • 部分入门卡或老卡可能驱动不再更新,AI支持不佳。

3.10. 显卡各组成部分对AI对重要度

组成部分是否重要说明(对大模型AI应用的作用)
显存容量★★★决定能否加载大模型和批量大小
CUDA核心数★★★决定并行算力,影响训练/推理速度
显存带宽★★☆影响数据吞吐,关系到大模型效率
浮点性能★★★决定模型计算能力,训练/推理速度
Tensor Core★★★专门加速AI计算,现代大模型必需
架构代际★★☆新架构更高效,支持新特性
功耗★☆☆影响部署和能耗,但非直接决定性能
接口/扩展性★☆☆多卡/服务器部署时需考虑
驱动生态★★★影响框架兼容和开发体验

4. 显卡市场

目前市场上的显卡主要由 NVIDIA(英伟达)、AMD(超威半导体)、Intel(英特尔) 三大厂商主导,此外还有一些国产显卡厂商(如华为、摩尔线程)正在发展。

显卡市场总结
厂商游戏表现AI 计算性价比适合人群
NVIDIA🌟🌟🌟🌟🌟🌟🌟🌟🌟🌟❌ 贵高端玩家/AI 开发者
AMD🌟🌟🌟🌟🌟🌟✅ 性价比高预算有限的游戏玩家
Intel🌟🌟🌟✅ 便宜轻度游戏/视频剪辑用户
国产显卡🌟🌟🌟❌ 生态弱政企/信创/AI 国产化需求

4.1. NVIDIA(英伟达)

市场地位:AI 和游戏显卡的绝对霸主,占据约 80% 独立显卡市场份额(尤其是高端市场)。
优势:CUDA 生态垄断、DLSS/AI 技术领先、专业计算卡(如 H100)统治 AI 和数据中心。

主流产品线
系列代表型号定位特点
GeForce RTX 40 系列RTX 4090、4080 Super高端游戏/AIDLSS 3、光追最强,但价格昂贵
GeForce RTX 30 系列RTX 3060 Ti、3080主流游戏性价比高,二手市场活跃
RTX 5000 系列(2025)RTX 5090(未发布)下一代旗舰Blackwell 架构,AI 性能更强
专业计算卡H100、B100AI/超算用于 ChatGPT 级大模型训练

评价
✅ 游戏性能顶级,AI 计算无敌,软件生态(CUDA)最强。
❌ 价格昂贵(RTX 4090 约 1.6 万+),垄断导致缺乏竞争。

4.2. AMD(超威半导体)

市场地位:NVIDIA 主要竞争对手,游戏显卡性价比高,但 AI 生态较弱。
优势:RDNA 3 架构能效比优秀,FSR 技术可对抗 DLSS。

主流产品线
系列代表型号定位特点
Radeon RX 7000 系列RX 7900 XTX、7800 XT高端游戏性价比高,但光追稍弱
Radeon RX 6000 系列RX 6800 XT上一代旗舰二手市场性价比不错
Instinct MI 系列MI300XAI/计算192GB HBM3,挑战 NVIDIA H100

评价
✅ 游戏性价比高(RX 7900 XTX 性能接近 RTX 4080,但便宜 20%)。
❌ 光追、AI 计算(如 Stable Diffusion)不如 NVIDIA,驱动优化一般。

4.3. Intel(英特尔)

市场地位:2022 年才进入独立显卡市场,仍在追赶 NVIDIA/AMD。
优势:性价比不错,支持 XeSS 超分辨率技术。

主流产品线
系列代表型号定位特点
Arc A 系列Arc A770(16GB)中端游戏1080P 高画质流畅,支持 XeSS
数据中心 GPUPonte Vecchio超算/AI用于超级计算机

评价
✅ 价格亲民(A770 16GB 约 2000 元),视频编解码能力强。
❌ 游戏兼容性一般,驱动仍需优化,高端市场缺席。

4.4. 国产显卡

市场现状:受制裁影响,仍在发展初期,主要面向 AI 和信创市场。

代表厂商与产品
厂商代表型号定位表现
华为昇腾(Ascend)昇腾 910BAI 计算对标 NVIDIA A100,国内大模型训练主力
摩尔线程(MTT)MTT S80游戏/办公支持 DirectX,但性能≈GTX 1050,生态弱
景嘉微(JM)JM9 系列军用/信创性能较低,主要用于国产化替代

评价
✅ 国产替代重要力量,昇腾在 AI 领域有一定竞争力。
❌ 游戏显卡性能落后 NVIDIA/AMD 5-10 年,生态(如 CUDA 替代)是最大瓶颈。

5. NVIDIA 显卡

高端显卡市场基本都是 NVIDIA(英伟达)的天下,主要介绍 NVIDIA 的各系列显卡吧。

5.1. 各显卡系列

NVIDIA显卡主要系列及定位
应用场景推荐系列代表型号预算建议说明
日常娱乐/办公GT/GTXGTX 1650<2000元入门卡,非AI主力
主流AI推理/游戏RTXRTX 3060/40603000~5000元能跑小/中模型
大模型推理/开发RTXRTX 409012000~15000元24GB显存,能跑13B模型
专业渲染/科研RTX A/QuadroRTX A600035000~50000元大显存、ECC
AI大模型训练A/H/HopperH100/H20025万~40万元仅企业/研究所负担得起
NVIDIA各系列核心参数对比表
系列/型号架构CUDA核心数显存类型/容量显存带宽Tensor Core典型用途价格区间(元/万元)
GTX 1650Turing8964GB GDDR5128GB/s入门游戏/AI学习800~1200
RTX 3060Ampere358412GB GDDR6360GB/s第3代主流游戏/AI推理2500~3000
RTX 4090Ada1638424GB GDDR6X1008GB/s第4代顶级游戏/AI大模型12000~15000
RTX A6000Ampere1075248GB GDDR6 ECC768GB/s第3代专业渲染/科研35000~50000
A100Ampere691240/80GB HBM2e1555GB/s第3代AI训练/推理10~20万
H100Hopper1459280GB HBM33.35TB/s第4代AI大模型训练/推理25~35万
H200Hopper14592141GB HBM3e4.8TB/s第4代AI大模型训练/推理30~40万
1)GT/GTX系列
  • 面向:普通消费者、学生、入门级用户
  • 特点:无Tensor Core,价格低,适合日常娱乐和轻度AI
  • 示例:GTX 1650,4GB显存,跑大模型非常吃力,只能做小模型推理和入门AI实验
2)RTX系列(消费级)
  • 面向:游戏玩家、AI开发者、内容创作者
  • 特点:拥有Tensor Core(AI加速)、RT Core(光线追踪),适合大部分AI推理和中小模型训练
  • 示例:RTX 3060、RTX 4090,24GB显存的4090可跑Llama-13B等大模型推理/微型训练
3)Quadro/RTX A系列(专业工作站)
  • 面向:工业设计、影视动画、科研
  • 特点:大显存、高稳定性、ECC支持、驱动优化,价格高
  • 示例:RTX A6000,48GB显存,适合科研与大型渲染任务
4)Tesla/A/H/Hopper系列(数据中心/AI服务器)
  • 面向:数据中心、云计算、AI大模型训练/推理
  • 特点:极高的显存、带宽、算力,专为AI大模型设计,价格极高
  • 示例:A100(80GB HBM2e),H100(80GB HBM3),H200(141GB HBM3e),AI训练/推理神器

5.2. NVIDIA H系列

H系列算是 AI大模型应用的主力军了。

NVIDIA H系列(数据中心AI卡)能力与价格横向对比
型号显存容量CUDA核心数显存带宽浮点性能(FP16/FP32)Tensor Core架构典型价格(万元)综合排序
H200141GB HBM3e145924.8TB/s197/67 TFLOPS第4代Hopper30-401
H10080GB HBM3145923.35TB/s197/67 TFLOPS第4代Hopper25-352
H80080GB HBM2e145922.0TB/s155/51 TFLOPS第4代Hopper25-303
H2096GB HBM3107521.5TB/s146/47 TFLOPS第4代Hopper15-204

:价格为2024年市场估值,仅供参考。综合排序按AI大模型能力+显存+带宽+性价比。

H20 显卡最近2年很常见,是国内AI火热起来时最常见的显卡了。2023年10月,美国升级对华AI芯片禁令,H100/A100 被禁售,NVIDIA 为中国市场定制 H20、L20、L2 等降规版芯片。

由于美国出口管制政策,H20 是 H100 的降规版本。虽性能缩水,但仍强于大部分国产芯片(如摩尔线程)。懂王今年一度连 H20 都限制出售了,现在 H20 就算是国内能买到显卡的天花板了。

5.3. NVIDIA RTX系列

RTX 系列算是 NVIDIA 消费级显卡中的第一梯队了,能轻松拿下各类3A游戏大作。和 H系列对比,看看常见显卡的参数呢。

NVIDIA RTX系列消费级显卡能力与价格横向对比
型号显存容量CUDA核心数显存带宽浮点性能(FP32)Tensor Core架构典型价格(元)综合排序
RTX 409024GB GDDR6X163841008GB/s82.6 TFLOPS第4代Ada12000-150001
RTX 408016GB GDDR6X9728717GB/s49 TFLOPS第4代Ada8000-90002
RTX 309024GB GDDR6X10496936GB/s35.6 TFLOPS第3代Ampere9000-110003
RTX 308010GB GDDR6X8704760GB/s29.8 TFLOPS第3代Ampere6000-70004

:价格为2024年市场主流行情。综合排序按大模型推理/训练能力+显存+性价比。


KerryWu
679 声望171 粉丝

保持饥饿