我们一开始买 AI 设备,第一眼看的是算力,会想需要多少 TFLOPS?多少 TOPS?GPU 核心多不多?NPU 强不强?

但真正用来跑本地大模型时,你很快会发现:算力不是唯一答案,甚至很多时候不是第一答案。

  • 有的机器纸面算力很高,但模型装不进去。
  • 有的机器勉强能装进去,但生成速度很慢。
  • 有的机器看起来参数一般,实际跑 7B、14B 模型却很舒服。
  • 还有的设备明明没有独立显卡,却能跑一些消费级显卡装不下的大模型。

问题就出在三个经常被混在一起的词上:显存、内存、算力。

显存和内存,听起来就差一个字。算力又经常被厂商放在宣传页最显眼的位置。于是很多人买设备时容易陷入一个误区:

只看谁算力大,忽略模型到底装不装得下,也忽略数据搬运跟不跟得上。

这篇文章用一个后厨的比喻,把这三个概念一次讲清楚。看完你就会明白:

AI 设备不是单纯看谁算力大,而是看容量、带宽、算力是否匹配。


一、显存和内存:同一种东西,两种性格

先说一个容易被忽略的事实:显存和内存,物理上是同一类东西——都是 DRAM 存储芯片,都是用来临时存放数据的。

但它们服务的对象不同。

内存 RAM,主要服务 CPU。

电脑系统、浏览器、微信、Word、Python、数据库、剪辑软件、开发工具,大部分普通程序运行时都要占用内存。

CPU 的工作特点是:任务杂、跳跃性强、经常处理零散请求。一会儿处理键盘输入, 一会儿调度网络请求, 一会儿打开一个网页, 一会儿计算一个 Excel 表格。

所以内存更看重的是:响应快、延迟低、系统调度灵活。

你可以把内存理解为:

CPU 面前的一张大办公桌。

办公桌越大,能同时摊开的文件越多。内存越大,电脑就越能多任务,打开大量网页、软件、工程文件时也更不容易卡。


显存 VRAM,主要服务 GPU。

GPU 的工作方式和 CPU 不一样。CPU 更像少数几个能力全面的员工,什么活都能处理,但同时处理的数量有限。GPU 更像一整排流水线工人,每个人做的事情相对单一,但可以同时处理海量重复计算。

比如:

  • 同时处理几百万个像素;
  • 同时渲染大量纹理;
  • 同时计算神经网络里一大批矩阵乘法;
  • 同时处理模型权重和中间张量。

GPU 干活时,需要一次搬运很大的数据量。所以显存更看重的是:高带宽、大吞吐、离 GPU 足够近。

你可以把显存理解为:

GPU 旁边的高速专用工作台。

工作台越大,模型、贴图、视频帧、中间计算结果就越能直接放在 GPU 身边。工作台的数据通道越宽,GPU 就越不容易“等数据”。

所以显存和内存的区别,不只是名字不同,而是设计取向不同。

显存和内存的区别
显存和内存的区别
对比项内存 RAM显存 VRAM
主要服务对象CPUGPU
典型用途系统、软件、多任务图形、视频、AI 推理、AI 训练
核心取向低延迟、灵活调度高带宽、大吞吐
物理位置主板内存或统一封装内存显卡上的专用高速内存
不够时的表现系统卡顿、频繁换页模型装不下、任务报错、速度骤降

一句话:

内存决定电脑整体能不能顺畅运行;显存决定 GPU 任务能不能装下并高效运行。


二、把电脑想象成一个后厨

为了更容易理解,可以把一台跑 AI 的机器想象成一个后厨。

这个后厨里有几样关键东西。

算力,是厨师的手速。

厨师切菜快不快、翻锅快不快、同时能处理多少锅菜,对应的就是芯片的计算能力。放到硬件参数里,就是 FLOPS、TFLOPS、TOPS 这些指标。

显存,是灶台旁边的备菜台。

厨师真正下锅时,最需要的是伸手就能拿到食材。模型权重、中间计算结果、KV Cache、图像数据,都要尽量摆在这个备菜台上。

备菜台有两个重要指标:

  • 面积:对应显存容量;
  • 传菜速度:对应显存带宽。

显存容量不够,食材摆不下。
显存带宽不够,食材送不上来。

内存,是后厨里的仓库。

上一节说内存是 CPU 的办公桌,那是 CPU 的视角。换到 GPU 的视角,内存就成了仓库:东西放得下,但不在灶台边上。

仓库空间可以很大,但它离灶台更远。食材放在仓库里不是不能用,而是拿取成本更高。如果 GPU 每做一步都要从内存里搬数据,速度就会明显下降。

硬盘,是城外冷库。

硬盘容量更大,但速度更慢。它适合长期存储文件、模型、数据集,不适合作为 GPU 实时计算的工作区。

用后厨比喻 AI 硬件
用后厨比喻 AI 硬件

这个比喻可以解释很多现象。

  1. 为什么显存不够,模型可能直接跑不了?

因为模型权重、KV Cache 和运行开销没有足够空间摆上备菜台。

  1. 为什么“显存不够,用内存凑”会很慢?

因为厨师每做一步都要去仓库搬食材,中间通道再宽,也比不上灶台旁边直接拿。

  1. 为什么顶级 AI GPU 要堆 HBM?

因为大模型不是只需要厨师手快,还需要食材源源不断送到手边。HBM 的价值就在于提供极高的显存带宽。

三、三个参数,三种角色

理解了后厨,就可以把显存、内存、算力的关系压缩成一句话:

容量决定能不能跑,带宽决定日常快不快,算力决定长输入和高并发顶不顶得住。

这句话比“显卡越强越好”更接近真实情况。

1. 容量是门槛:装不下,一切免谈

跑本地大模型,第一件事不是看算力,而是看模型能不能装进去。

模型运行时主要占用几类空间:

  • 模型权重;
  • KV Cache;
  • 上下文缓存;
  • 推理框架开销;
  • 系统和其他程序占用。

很多人只看模型文件大小,以为 20GB 的模型放进 24GB 显存就一定没问题。实际并不是这样。

因为模型运行时还会额外占用空间。尤其是上下文长度越长,KV Cache 占用越大。你把上下文从 4K 拉到 32K,不只是“多放了一些文字”,而是模型需要保存更多中间状态。

所以经常会出现这种情况:

模型能加载,但一拉长上下文就爆显存

这也是为什么本地大模型选型时,显存或统一内存容量是第一道门槛。

7B、8B 模型相对容易跑。

14B 模型开始明显吃资源。

32B 模型对显存和内存就有更高要求。

70B 模型即使量化,也不是普通消费级设备可以轻松处理的。

容量不够时,算力再强也没意义。

这就像厨师再厉害,备菜台摆不下食材,也没法开工。

2. 带宽决定日常速度:大模型推理经常是“搬运密集型”

很多人以为大模型生成慢,是因为“算不过来”。这只说对了一半。

对大模型推理来说,尤其是日常聊天、写作、问答这种逐字生成场景,瓶颈经常不是纯计算,而是数据搬运。

大模型生成回答,大致分两个阶段:

  • Prefill:读入你的问题和上下文;
  • Decode:一个 token 一个 token 地生成回答。
大模型推理的两个阶段
大模型推理的两个阶段

在 Decode 阶段,模型每生成一个 token,都要访问大量模型权重。对稠密模型来说,绝大部分权重都要参与计算。这时 GPU 很多时候不是“不会算”,而是“等数据送过来”。

所以显存带宽非常重要。

你可以粗略理解为:

每秒生成 token 的速度,很大程度上取决于模型每一步要搬多少数据,以及显存带宽能多快把数据送到 GPU。

这也是为什么一些纸面算力很高的设备,跑大模型未必特别快。因为算力高只是说明厨师手速快,但如果传菜通道太窄,厨师也会等米下锅。

MoE 模型在这里有一个优势。

MoE 模型总参数量可能很大,但每生成一个 token 时,只激活其中一部分专家。换句话说,它的总菜谱很厚,但每道菜真正用到的食材没有那么多。

所以在带宽受限的设备上,MoE 模型有时会比同等总参数量的稠密模型更友好。

3. 算力决定上限:长 prompt 和高并发时才轮到它主场

那算力到底重要不重要?——当然重要。

只是它重要的场景,不完全等同于很多人想象中的“生成每个字都只看算力”。

在大模型推理里,算力最明显发挥作用的阶段,是 Prefill

也就是模型读入你的问题、长文档、代码仓库、PDF 内容的阶段。

如果你只是问一句:

帮我写一段朋友圈文案。

这时输入很短,Prefill 压力不大。

但如果你扔进去的是:

  • 一篇 2 万字文章;
  • 一份几十页 PDF;
  • 一个长代码文件;
  • 一大段会议纪要;
  • 多轮复杂上下文;

这时候模型要先“读题”。输入 token 越多,Prefill 阶段越重。算力弱的机器,就会出现明显的首字延迟。

也就是:

回答一旦开始生成,速度还可以;
但第一个字出来之前,要等很久。

这就是算力在长上下文场景里的作用。

所以更准确的说法是:

  • 显存 / 内存容量:决定模型能不能装下;
  • 显存 / 内存带宽:决定日常生成快不快;
  • 算力:决定长输入处理、高并发、复杂计算场景顶不顶得住。

四、Mac 的统一内存:把仓库和备菜台部分打通了

在Mac中会出现这样的情况:

Mac 没有独立显存,为什么还能跑本地大模型?

这是因为 Apple Silicon 使用的是统一内存架构。

传统 PC 里,CPU 用系统内存,GPU 用独立显存。两边是分开的。数据经常需要在内存和显存之间复制。

Apple Silicon 的思路不一样。CPU、GPU、NPU 共享同一块统一内存池。你可以把它理解为:

后厨仓库和备菜台之间的隔墙被打掉了,变成了一个更大的共享工作区。

这带来了一个非常现实的好处:容量更灵活。

传统消费级独立显卡,显存容量通常是 8GB、12GB、16GB、24GB。再往上就进入专业卡、数据中心卡或者多卡方案。

而 Mac 可以提供 32GB、64GB、96GB、128GB 甚至更高规格的统一内存。对于本地大模型来说,这意味着一些消费级显卡装不下的量化模型,Mac 反而有机会装进去。

这里特别需要关注的是:

Mac 的统一内存不等于 NVIDIA 显卡的独立显存。

统一内存确实能被 GPU 分配使用,但系统、应用、推理框架、缓存都会占用一部分空间,不是标称 64GB 就能完整拿来当 64GB 显存。

同时,统一内存的带宽也要具体看芯片型号。它通常明显强于普通 DDR 内存,但和高端 NVIDIA GPU 的 GDDR6X、HBM 相比,仍然有差距。

所以 Mac 跑本地大模型的特点可以这样理解:

维度Mac 统一内存的表现
容量优势明显,适合装较大的量化模型
带宽比普通内存强,但不等同于高端 HBM
算力日常推理够用,但和高端 NVIDIA GPU 有差距
生态MLX 体验越来越好,但 CUDA 生态仍然更强
适合场景本地写作、总结、轻量代码、个人知识库
不适合场景大规模训练、高并发服务、极限推理性能

Mac 的优势是“能装得下”和“日常够用”,不是在所有 AI 场景下都比独立显卡更快。

如果你主要是个人使用,跑 7B、14B、部分 32B 量化模型,Mac 的统一内存很有价值。

但如果你要训练模型、做高并发推理、追求极限 token 速度,NVIDIA 大显存显卡仍然是主流方案。

五、买 AI 设备,先看这三个问题

看懂显存、内存和算力之后,买设备时就不要只盯着“多少 TFLOPS”了。

更实用的判断顺序是三个问题。

第一:模型装不装得下?

这是容量问题。

跑本地大模型时,先看显存或统一内存够不够。模型权重、KV Cache、上下文长度、运行框架都会占空间。

容量不够,结果通常有几种:

  • 模型无法加载;
  • 一拉长上下文就报错;
  • 只能换更低量化版本;
  • 只能把部分计算放到 CPU;
  • 速度慢到不想用。

所以买设备时,第一步不是问“这台机器算力多强”,而是问:

我要跑的模型,它装得下吗?

大致可以这样判断:

需求更应该关注什么
跑 7B / 8B 模型16GB 内存或 8GB 显存起步
跑 14B 模型24GB 内存或 12GB+ 显存更稳
跑 32B 模型32GB 以上统一内存,或 24GB 显存更合适
跑 70B 量化模型64GB+ 统一内存、多卡或专业大显存方案更现实
训练模型优先大显存 NVIDIA GPU

这不是绝对标准,因为不同模型结构、量化格式、上下文长度都会影响占用。但作为普通用户的第一轮判断,已经够用。

第二:数据搬得快不快?

这是带宽问题。

模型装得下,只说明你过了第一关。接下来要看它跑起来快不快。

大模型生成文字时,经常需要反复读取大量权重和中间数据。显存带宽越高,数据越能及时送到 GPU,生成速度通常越稳。

所以你会看到:

  • 同样是 24GB 显存,不同显卡速度差距明显;
  • 同样能跑 32B 模型,有的机器流畅,有的机器拖沓;
  • 同样参数规模,MoE 模型在某些设备上体验更好。

原因之一就是带宽不同。

如果你主要做本地聊天、写作、改稿、总结、问答,带宽对体验的影响非常直接

这时不要只看“模型能不能加载”,还要看:

它每秒能生成多少 token?
长对话会不会越来越慢?
上下文拉长后还能不能保持可用速度?

第三:长输入处理得快不快?

这是算力问题。

算力最容易体现在几个场景:

  • 读取长文档;
  • 分析代码仓库;
  • 总结几十页 PDF;
  • 多用户并发推理;
  • 大 batch 推理;
  • 模型训练或微调。

如果你经常让模型处理长资料,就不能只看显存容量。因为模型读入大量上下文时,Prefill 阶段会明显吃算力。

这时候算力弱的机器会出现一种典型体验:

模型不是不能回答,而是第一个字出来之前等得很久。

所以,我们可以记住这个顺序:

先看容量,决定能不能跑;
再看带宽,决定日常快不快;
最后看算力,决定长输入和高并发顶不顶得住。

这个顺序比单纯看宣传页上的算力数字更可靠。

六、不同使用场景,该优先看什么?

把上面的逻辑落到实际选择,可以整理成一张表。

使用场景第一优先级第二优先级容易被什么误导
普通办公内存容量SSD 速度迷信独显
AI 绘图显存容量GPU 算力只看核心数
本地大模型 7B / 8B内存 / 显存容量推理框架优化以为所有设备都一样快
本地大模型 14B显存 / 统一内存带宽只看模型文件大小
本地大模型 32B+容量带宽低估 KV Cache 占用
长文档总结算力 + 带宽上下文容量只看模型参数量
模型训练 / 微调显存容量CUDA / Tensor Core 生态用消费级设备硬扛
多用户部署显存容量 + 算力带宽和并发优化只看单用户速度

如果你只是个人使用,本地跑模型写文章、做总结、改代码、做轻量知识库,核心不是追求最强算力,而是让容量、带宽和模型规模匹配。

如果你的目标是稳定生产力,优先级应该是:

  1. 先确定你常用多大模型;
  2. 再确定上下文长度需求;
  3. 再看设备能不能完整承载;
  4. 最后再比较生成速度和首字延迟。

这比直接问“买哪台最强”更有效。

七、三者关系

概念后厨角色关键指标决定什么
内存 RAM仓库 / 大办公桌容量、延迟、带宽系统流畅度、多任务能力、部分模型承载能力
显存 VRAM灶台旁边的备菜台容量、带宽GPU 任务能不能装下、生成速度快不快
算力 FLOPS / TOPS厨师手速FP16、BF16、INT8、INT4 等计算能力长输入处理、高并发、训练和复杂计算能力
带宽传菜速度GB/s、TB/s数据能不能及时喂给计算单元
硬盘 SSD冷库容量、读写速度长期存储模型和文件,不适合实时计算

下次再看到一张设备参数表,上面写着:

  • XX GB 显存;
  • XX GB 内存;
  • XX TB/s 带宽;
  • XX TFLOPS 算力;

可以先在心里问三个问题:

第一:容量够不够?
不够,模型装不下,后面都不用看。

第二:带宽大不大?
它很大程度上决定日常生成体验。

第三:算力强不强?
它决定长文档、复杂输入、高并发和训练任务能不能顶住。

所以,显存、内存、算力不是谁替代谁的关系,而是分工不同。

显存 / 内存决定你能不能把模型摆上桌;

带宽决定数据能不能及时送到手边;

算力决定厨师真正开工后能做到多快。

买 AI 设备,最怕只看一个数字。 真正应该看的,是这三件事是否匹配。


本文是「术语解构」系列的一篇。这个系列的目标是:把 AI 基础设施领域的黑话,一个一个翻译成人话。