我们一开始买 AI 设备,第一眼看的是算力,会想需要多少 TFLOPS?多少 TOPS?GPU 核心多不多?NPU 强不强?
但真正用来跑本地大模型时,你很快会发现:算力不是唯一答案,甚至很多时候不是第一答案。
- 有的机器纸面算力很高,但模型装不进去。
- 有的机器勉强能装进去,但生成速度很慢。
- 有的机器看起来参数一般,实际跑 7B、14B 模型却很舒服。
- 还有的设备明明没有独立显卡,却能跑一些消费级显卡装不下的大模型。
问题就出在三个经常被混在一起的词上:显存、内存、算力。
显存和内存,听起来就差一个字。算力又经常被厂商放在宣传页最显眼的位置。于是很多人买设备时容易陷入一个误区:
只看谁算力大,忽略模型到底装不装得下,也忽略数据搬运跟不跟得上。
这篇文章用一个后厨的比喻,把这三个概念一次讲清楚。看完你就会明白:
AI 设备不是单纯看谁算力大,而是看容量、带宽、算力是否匹配。
一、显存和内存:同一种东西,两种性格
先说一个容易被忽略的事实:显存和内存,物理上是同一类东西——都是 DRAM 存储芯片,都是用来临时存放数据的。
但它们服务的对象不同。
内存 RAM,主要服务 CPU。
电脑系统、浏览器、微信、Word、Python、数据库、剪辑软件、开发工具,大部分普通程序运行时都要占用内存。
CPU 的工作特点是:任务杂、跳跃性强、经常处理零散请求。一会儿处理键盘输入, 一会儿调度网络请求, 一会儿打开一个网页, 一会儿计算一个 Excel 表格。
所以内存更看重的是:响应快、延迟低、系统调度灵活。
你可以把内存理解为:
CPU 面前的一张大办公桌。
办公桌越大,能同时摊开的文件越多。内存越大,电脑就越能多任务,打开大量网页、软件、工程文件时也更不容易卡。
显存 VRAM,主要服务 GPU。
GPU 的工作方式和 CPU 不一样。CPU 更像少数几个能力全面的员工,什么活都能处理,但同时处理的数量有限。GPU 更像一整排流水线工人,每个人做的事情相对单一,但可以同时处理海量重复计算。
比如:
- 同时处理几百万个像素;
- 同时渲染大量纹理;
- 同时计算神经网络里一大批矩阵乘法;
- 同时处理模型权重和中间张量。
GPU 干活时,需要一次搬运很大的数据量。所以显存更看重的是:高带宽、大吞吐、离 GPU 足够近。
你可以把显存理解为:
GPU 旁边的高速专用工作台。
工作台越大,模型、贴图、视频帧、中间计算结果就越能直接放在 GPU 身边。工作台的数据通道越宽,GPU 就越不容易“等数据”。
所以显存和内存的区别,不只是名字不同,而是设计取向不同。

| 对比项 | 内存 RAM | 显存 VRAM |
|---|---|---|
| 主要服务对象 | CPU | GPU |
| 典型用途 | 系统、软件、多任务 | 图形、视频、AI 推理、AI 训练 |
| 核心取向 | 低延迟、灵活调度 | 高带宽、大吞吐 |
| 物理位置 | 主板内存或统一封装内存 | 显卡上的专用高速内存 |
| 不够时的表现 | 系统卡顿、频繁换页 | 模型装不下、任务报错、速度骤降 |
一句话:
内存决定电脑整体能不能顺畅运行;显存决定 GPU 任务能不能装下并高效运行。
二、把电脑想象成一个后厨
为了更容易理解,可以把一台跑 AI 的机器想象成一个后厨。
这个后厨里有几样关键东西。
算力,是厨师的手速。
厨师切菜快不快、翻锅快不快、同时能处理多少锅菜,对应的就是芯片的计算能力。放到硬件参数里,就是 FLOPS、TFLOPS、TOPS 这些指标。
显存,是灶台旁边的备菜台。
厨师真正下锅时,最需要的是伸手就能拿到食材。模型权重、中间计算结果、KV Cache、图像数据,都要尽量摆在这个备菜台上。
备菜台有两个重要指标:
- 面积:对应显存容量;
- 传菜速度:对应显存带宽。
显存容量不够,食材摆不下。
显存带宽不够,食材送不上来。
内存,是后厨里的仓库。
上一节说内存是 CPU 的办公桌,那是 CPU 的视角。换到 GPU 的视角,内存就成了仓库:东西放得下,但不在灶台边上。
仓库空间可以很大,但它离灶台更远。食材放在仓库里不是不能用,而是拿取成本更高。如果 GPU 每做一步都要从内存里搬数据,速度就会明显下降。
硬盘,是城外冷库。
硬盘容量更大,但速度更慢。它适合长期存储文件、模型、数据集,不适合作为 GPU 实时计算的工作区。

这个比喻可以解释很多现象。
- 为什么显存不够,模型可能直接跑不了?
因为模型权重、KV Cache 和运行开销没有足够空间摆上备菜台。
- 为什么“显存不够,用内存凑”会很慢?
因为厨师每做一步都要去仓库搬食材,中间通道再宽,也比不上灶台旁边直接拿。
- 为什么顶级 AI GPU 要堆 HBM?
因为大模型不是只需要厨师手快,还需要食材源源不断送到手边。HBM 的价值就在于提供极高的显存带宽。
三、三个参数,三种角色
理解了后厨,就可以把显存、内存、算力的关系压缩成一句话:
容量决定能不能跑,带宽决定日常快不快,算力决定长输入和高并发顶不顶得住。
这句话比“显卡越强越好”更接近真实情况。
1. 容量是门槛:装不下,一切免谈
跑本地大模型,第一件事不是看算力,而是看模型能不能装进去。
模型运行时主要占用几类空间:
- 模型权重;
- KV Cache;
- 上下文缓存;
- 推理框架开销;
- 系统和其他程序占用。
很多人只看模型文件大小,以为 20GB 的模型放进 24GB 显存就一定没问题。实际并不是这样。
因为模型运行时还会额外占用空间。尤其是上下文长度越长,KV Cache 占用越大。你把上下文从 4K 拉到 32K,不只是“多放了一些文字”,而是模型需要保存更多中间状态。
所以经常会出现这种情况:
模型能加载,但一拉长上下文就爆显存。
这也是为什么本地大模型选型时,显存或统一内存容量是第一道门槛。
7B、8B 模型相对容易跑。
14B 模型开始明显吃资源。
32B 模型对显存和内存就有更高要求。
70B 模型即使量化,也不是普通消费级设备可以轻松处理的。
容量不够时,算力再强也没意义。
这就像厨师再厉害,备菜台摆不下食材,也没法开工。
2. 带宽决定日常速度:大模型推理经常是“搬运密集型”
很多人以为大模型生成慢,是因为“算不过来”。这只说对了一半。
对大模型推理来说,尤其是日常聊天、写作、问答这种逐字生成场景,瓶颈经常不是纯计算,而是数据搬运。
大模型生成回答,大致分两个阶段:
- Prefill:读入你的问题和上下文;
- Decode:一个 token 一个 token 地生成回答。

在 Decode 阶段,模型每生成一个 token,都要访问大量模型权重。对稠密模型来说,绝大部分权重都要参与计算。这时 GPU 很多时候不是“不会算”,而是“等数据送过来”。
所以显存带宽非常重要。
你可以粗略理解为:
每秒生成 token 的速度,很大程度上取决于模型每一步要搬多少数据,以及显存带宽能多快把数据送到 GPU。
这也是为什么一些纸面算力很高的设备,跑大模型未必特别快。因为算力高只是说明厨师手速快,但如果传菜通道太窄,厨师也会等米下锅。
MoE 模型在这里有一个优势。
MoE 模型总参数量可能很大,但每生成一个 token 时,只激活其中一部分专家。换句话说,它的总菜谱很厚,但每道菜真正用到的食材没有那么多。
所以在带宽受限的设备上,MoE 模型有时会比同等总参数量的稠密模型更友好。
3. 算力决定上限:长 prompt 和高并发时才轮到它主场
那算力到底重要不重要?——当然重要。
只是它重要的场景,不完全等同于很多人想象中的“生成每个字都只看算力”。
在大模型推理里,算力最明显发挥作用的阶段,是 Prefill。
也就是模型读入你的问题、长文档、代码仓库、PDF 内容的阶段。
如果你只是问一句:
帮我写一段朋友圈文案。
这时输入很短,Prefill 压力不大。
但如果你扔进去的是:
- 一篇 2 万字文章;
- 一份几十页 PDF;
- 一个长代码文件;
- 一大段会议纪要;
- 多轮复杂上下文;
这时候模型要先“读题”。输入 token 越多,Prefill 阶段越重。算力弱的机器,就会出现明显的首字延迟。
也就是:
回答一旦开始生成,速度还可以;
但第一个字出来之前,要等很久。
这就是算力在长上下文场景里的作用。
所以更准确的说法是:
- 显存 / 内存容量:决定模型能不能装下;
- 显存 / 内存带宽:决定日常生成快不快;
- 算力:决定长输入处理、高并发、复杂计算场景顶不顶得住。
四、Mac 的统一内存:把仓库和备菜台部分打通了
在Mac中会出现这样的情况:
Mac 没有独立显存,为什么还能跑本地大模型?
这是因为 Apple Silicon 使用的是统一内存架构。
传统 PC 里,CPU 用系统内存,GPU 用独立显存。两边是分开的。数据经常需要在内存和显存之间复制。
Apple Silicon 的思路不一样。CPU、GPU、NPU 共享同一块统一内存池。你可以把它理解为:
后厨仓库和备菜台之间的隔墙被打掉了,变成了一个更大的共享工作区。
这带来了一个非常现实的好处:容量更灵活。
传统消费级独立显卡,显存容量通常是 8GB、12GB、16GB、24GB。再往上就进入专业卡、数据中心卡或者多卡方案。
而 Mac 可以提供 32GB、64GB、96GB、128GB 甚至更高规格的统一内存。对于本地大模型来说,这意味着一些消费级显卡装不下的量化模型,Mac 反而有机会装进去。
这里特别需要关注的是:
Mac 的统一内存不等于 NVIDIA 显卡的独立显存。
统一内存确实能被 GPU 分配使用,但系统、应用、推理框架、缓存都会占用一部分空间,不是标称 64GB 就能完整拿来当 64GB 显存。
同时,统一内存的带宽也要具体看芯片型号。它通常明显强于普通 DDR 内存,但和高端 NVIDIA GPU 的 GDDR6X、HBM 相比,仍然有差距。
所以 Mac 跑本地大模型的特点可以这样理解:
| 维度 | Mac 统一内存的表现 |
|---|---|
| 容量 | 优势明显,适合装较大的量化模型 |
| 带宽 | 比普通内存强,但不等同于高端 HBM |
| 算力 | 日常推理够用,但和高端 NVIDIA GPU 有差距 |
| 生态 | MLX 体验越来越好,但 CUDA 生态仍然更强 |
| 适合场景 | 本地写作、总结、轻量代码、个人知识库 |
| 不适合场景 | 大规模训练、高并发服务、极限推理性能 |
Mac 的优势是“能装得下”和“日常够用”,不是在所有 AI 场景下都比独立显卡更快。
如果你主要是个人使用,跑 7B、14B、部分 32B 量化模型,Mac 的统一内存很有价值。
但如果你要训练模型、做高并发推理、追求极限 token 速度,NVIDIA 大显存显卡仍然是主流方案。
五、买 AI 设备,先看这三个问题
看懂显存、内存和算力之后,买设备时就不要只盯着“多少 TFLOPS”了。
更实用的判断顺序是三个问题。
第一:模型装不装得下?
这是容量问题。
跑本地大模型时,先看显存或统一内存够不够。模型权重、KV Cache、上下文长度、运行框架都会占空间。
容量不够,结果通常有几种:
- 模型无法加载;
- 一拉长上下文就报错;
- 只能换更低量化版本;
- 只能把部分计算放到 CPU;
- 速度慢到不想用。
所以买设备时,第一步不是问“这台机器算力多强”,而是问:
我要跑的模型,它装得下吗?
大致可以这样判断:
| 需求 | 更应该关注什么 |
|---|---|
| 跑 7B / 8B 模型 | 16GB 内存或 8GB 显存起步 |
| 跑 14B 模型 | 24GB 内存或 12GB+ 显存更稳 |
| 跑 32B 模型 | 32GB 以上统一内存,或 24GB 显存更合适 |
| 跑 70B 量化模型 | 64GB+ 统一内存、多卡或专业大显存方案更现实 |
| 训练模型 | 优先大显存 NVIDIA GPU |
这不是绝对标准,因为不同模型结构、量化格式、上下文长度都会影响占用。但作为普通用户的第一轮判断,已经够用。
第二:数据搬得快不快?
这是带宽问题。
模型装得下,只说明你过了第一关。接下来要看它跑起来快不快。
大模型生成文字时,经常需要反复读取大量权重和中间数据。显存带宽越高,数据越能及时送到 GPU,生成速度通常越稳。
所以你会看到:
- 同样是 24GB 显存,不同显卡速度差距明显;
- 同样能跑 32B 模型,有的机器流畅,有的机器拖沓;
- 同样参数规模,MoE 模型在某些设备上体验更好。
原因之一就是带宽不同。
如果你主要做本地聊天、写作、改稿、总结、问答,带宽对体验的影响非常直接。
这时不要只看“模型能不能加载”,还要看:
它每秒能生成多少 token?
长对话会不会越来越慢?
上下文拉长后还能不能保持可用速度?
第三:长输入处理得快不快?
这是算力问题。
算力最容易体现在几个场景:
- 读取长文档;
- 分析代码仓库;
- 总结几十页 PDF;
- 多用户并发推理;
- 大 batch 推理;
- 模型训练或微调。
如果你经常让模型处理长资料,就不能只看显存容量。因为模型读入大量上下文时,Prefill 阶段会明显吃算力。
这时候算力弱的机器会出现一种典型体验:
模型不是不能回答,而是第一个字出来之前等得很久。
所以,我们可以记住这个顺序:
先看容量,决定能不能跑;
再看带宽,决定日常快不快;
最后看算力,决定长输入和高并发顶不顶得住。
这个顺序比单纯看宣传页上的算力数字更可靠。
六、不同使用场景,该优先看什么?
把上面的逻辑落到实际选择,可以整理成一张表。
| 使用场景 | 第一优先级 | 第二优先级 | 容易被什么误导 |
|---|---|---|---|
| 普通办公 | 内存容量 | SSD 速度 | 迷信独显 |
| AI 绘图 | 显存容量 | GPU 算力 | 只看核心数 |
| 本地大模型 7B / 8B | 内存 / 显存容量 | 推理框架优化 | 以为所有设备都一样快 |
| 本地大模型 14B | 显存 / 统一内存 | 带宽 | 只看模型文件大小 |
| 本地大模型 32B+ | 容量 | 带宽 | 低估 KV Cache 占用 |
| 长文档总结 | 算力 + 带宽 | 上下文容量 | 只看模型参数量 |
| 模型训练 / 微调 | 显存容量 | CUDA / Tensor Core 生态 | 用消费级设备硬扛 |
| 多用户部署 | 显存容量 + 算力 | 带宽和并发优化 | 只看单用户速度 |
如果你只是个人使用,本地跑模型写文章、做总结、改代码、做轻量知识库,核心不是追求最强算力,而是让容量、带宽和模型规模匹配。
如果你的目标是稳定生产力,优先级应该是:
- 先确定你常用多大模型;
- 再确定上下文长度需求;
- 再看设备能不能完整承载;
- 最后再比较生成速度和首字延迟。
这比直接问“买哪台最强”更有效。
七、三者关系
| 概念 | 后厨角色 | 关键指标 | 决定什么 |
|---|---|---|---|
| 内存 RAM | 仓库 / 大办公桌 | 容量、延迟、带宽 | 系统流畅度、多任务能力、部分模型承载能力 |
| 显存 VRAM | 灶台旁边的备菜台 | 容量、带宽 | GPU 任务能不能装下、生成速度快不快 |
| 算力 FLOPS / TOPS | 厨师手速 | FP16、BF16、INT8、INT4 等计算能力 | 长输入处理、高并发、训练和复杂计算能力 |
| 带宽 | 传菜速度 | GB/s、TB/s | 数据能不能及时喂给计算单元 |
| 硬盘 SSD | 冷库 | 容量、读写速度 | 长期存储模型和文件,不适合实时计算 |
下次再看到一张设备参数表,上面写着:
- XX GB 显存;
- XX GB 内存;
- XX TB/s 带宽;
- XX TFLOPS 算力;
可以先在心里问三个问题:
第一:容量够不够?
不够,模型装不下,后面都不用看。
第二:带宽大不大?
它很大程度上决定日常生成体验。
第三:算力强不强?
它决定长文档、复杂输入、高并发和训练任务能不能顶住。
所以,显存、内存、算力不是谁替代谁的关系,而是分工不同。
显存 / 内存决定你能不能把模型摆上桌;
带宽决定数据能不能及时送到手边;
算力决定厨师真正开工后能做到多快。
买 AI 设备,最怕只看一个数字。 真正应该看的,是这三件事是否匹配。
本文是「术语解构」系列的一篇。这个系列的目标是:把 AI 基础设施领域的黑话,一个一个翻译成人话。