上一篇聊了 1P 算力到底有多大,这一篇换个更具体的问法:算力听起来很大,但它到底能干什么?这个问题继续往下走,就会变成一个更具体的问题——如果我手里有一张算力卡,让它连续工作一小时的话,到底能干多少活?
- 能写多少篇文章?
- 能回答多少次问题?
- 能支撑多少人同时使用 AI 助手?
- 能不能撑起一个企业内部的智能体系统?
直接换一种更容易理解的方式:把算力换算成 AI 的实际产能。

1. 算力很抽象,不如换成工作量
我们平时看到算力卡参数,一张卡 300 TFLOPS,另一张卡 1000 TFLOPS,听起来差了好几倍,这个差距到底意味着什么?或者更直白的问题应该是:它一小时能完成多少 AI 工作?
比如:
- 一小时能生成多少文字?
- 一小时能写多少篇文章?
- 一小时能回答多少次问题?
- 一小时能服务多少个用户?
- 一小时能处理多少份材料?
这才是算力真正落地之后的样子。
所以,讨论不同算力卡一小时能干多少活,不能只看“这张卡有多强”,而要看它在一个具体 AI 场景里能产出多少东西。
2. 先设定一个统一场景
要比较不同算力卡,必须先设定一个统一场景,否则没法比。
同样一张卡,跑 7B 模型、35B 模型、70B 模型,工作量完全不同,而换做不同的业务逻辑,比如图片生成、视频生成、模型训练、大模型推理,消耗也就完全不同。
选一个足够考验算力、也比较贴近日常 AI 应用的场景:运行一个 70B 级别大模型,连续一小时对外提供文本生成服务。
这个场景可以对应很多实际工作,比如写文章、写代码、做摘要、回答问题、做客服、写方案、做资料分析、给企业内部知识库提供问答服务,我们不讨论一张卡理论上有多强,而看它在大模型推理场景下一小时最多能生成多少 token。
为什么选 70B?——因为 70B 是一个比较好的参照物。
- 7B、14B 模型更像轻量级工具,适合简单问答、分类、摘要、本地助手。
- 35B 已经开始进入比较强的生产力模型区间。
- 70B 则是一个分水岭:模型足够大,负载足够重,也更接近严肃的大模型推理场景。
所以本文里的“一小时能干多少活”,本质上是在问:一张算力卡连续跑 70B 大模型,一小时能生成多少 token?
3. token 是什么?
AI 生成文本不是按“字”算,也不是按“篇”算,而是按 token 算。
token 可以简单理解成:AI 处理文本的基本颗粒。
中文里,一个 token 可能接近一个字,也可能是一个词的一部分;而在英文里,一个 token 可能是一个单词,也可能是单词的一部分。不需要把 token 理解得太复杂,对普通读者来说,只要知道:token 是 AI 生成内容的计量单位。
比如:
- 一次简短回答,可能是几十到几百 token;
- 一次完整问答,可能是 500 到 1500 token;
- 一篇中等长度公众号初稿,可能是 3000 到 6000 token;
- 一次长篇分析,可能上万 token。
所以,我们可以把“算力卡一小时能干多少活”换成一个更可量化的问题:不同算力卡,一小时能生成多少 token?
铺垫了以上内容后,这个问题就可以比较了。
4. 一个 token 多少钱?——先算成本
问:35B 模型生成的 1 个 token,和 70B 模型生成的 1 个 token,是一样的吗?
答:数量上都是 1 个 token,但 70B 那个 token 背后的计算量,大约是 35B 的 2 倍。
35B 模型生成 1 个 token,70B 模型也生成 1 个 token,数量上都是 1 个 token,但它们背后的计算量不一样。
大模型生成 1 个 token,粗略可以按这个公式估算:
生成 1 个 token 的计算量 ≈ 2 × 模型参数量
所以:
| 模型规模 | 生成 1 个 token 的粗略计算量 |
|---|---|
| 7B | 约 140 亿次浮点计算 |
| 14B | 约 280 亿次浮点计算 |
| 35B | 约 700 亿次浮点计算 |
| 70B | 约 1400 亿次浮点计算 |
也就是说:70B 模型生成 1 个 token,理论计算量大约是 35B 的 2 倍,是 7B 的 10 倍。
所以,不能简单说:“这张卡一小时能生成多少 token”,更准确的说法应该是——这张卡一小时能生成多少个某规模模型的 token。
比如:
- 一小时生成 1000 万个 7B token;
- 一小时生成 400 万个 35B token;
- 一小时生成 200 万个 70B token。
这三句话代表的工作负载完全不同。
这里先只算“贵不贵”,也就是每个 token 要花多少计算量。至于“值不值”——同样 1000 个 token,不同模型的含金量差多少——我们留到后面再说。
5. 不同算力卡一小时能生成多少 token?
下面做一个简化估算。先说明口径:
| 项目 | 设定 |
|---|---|
| 模型规模 | 70B |
| 精度 | FP16 / BF16 口径 |
| 任务类型 | 连续文本生成 |
| 有效利用率 | 按理论算力的 25% 折算 |
| 统计指标 | 每小时生成 token 数 |
| 单次长回答 | 1500 token |
为什么要按 25% 有效利用率估算?
因为显卡标称算力是理论峰值,不等于真实推理吞吐。真实推理会受到很多因素影响:
- 显存容量;
- 显存带宽;
- KV Cache;
- batch size;
- 上下文长度;
- 推理框架;
- 量化方式;
- 多用户并发。
所以这里不是按理论峰值吹牛,而是按一个偏保守的工程估算来理解。
NVIDIA 官方规格显示,H200 SXM 的 FP16/BF16 Tensor Core 峰值为 1,979 TFLOPS(含稀疏),显存为 141GB,显存带宽为 4.8TB/s;这里做 dense 口径估算时,按约一半即 989 TFLOPS 计算。 AMD 官方页面显示,MI300X 面向生成式 AI 和 HPC 工作负载,配备 192GB 大容量 HBM 显存;公开资料中 MI300X 常见 FP16/BF16 dense 口径约为 1305 TFLOPS。 NVIDIA Blackwell 官方数据表显示,B200 的 FP16/BF16 张量算力约 4.5 PFLOPS(含稀疏),换算成 dense 口径约 2250 TFLOPS;要注意,常被引用的 8 卡 HGX B200“32 PFLOPS”是 FP8 口径,不是 FP16/BF16,两者不能混用。
按照这个口径,可以得到下面这张表:
| 算力卡 | 大致 FP16/BF16 算力口径 | 估算一小时生成 70B token | 约等于多少个 1500-token 长回答 |
|---|---|---|---|
| RTX 4090 | 约 330 TFLOPS | 约 212 万 token | 约 1400 次 |
| NVIDIA L40S | 约 366 TFLOPS | 约 236 万 token | 约 1570 次 |
| NVIDIA A100 80GB | 约 312 TFLOPS | 约 201 万 token | 约 1330 次 |
| NVIDIA H100 SXM | 约 989 TFLOPS | 约 636 万 token | 约 4240 次 |
| NVIDIA H200 SXM | 约 989 TFLOPS | 约 636 万 token | 约 4240 次 |
| AMD MI300X | 约 1305 TFLOPS | 约 839 万 token | 约 5590 次 |
| AMD MI325X | 约 1307 TFLOPS | 约 840 万 token | 约 5600 次 |
| NVIDIA B200 | 约 2250 TFLOPS(dense) | 约 1446 万 token | 约 9640 次 |

这张表的重点不是精确到个位数,而是帮助建立数量级概念。
也就是说:一张高端算力卡,一小时不是写几篇文章,而是生成几百万到上千万 token。
还要补充很重要的一点:这是一张**“按算力折算”的理想上限表**。真实的单流自回归解码,瓶颈往往不在算力,而在显存带宽。所以表里 H100 和 H200 算力相同、数字也相同,但实际推理中,H200 凭借更大显存和更高带宽,吞吐通常会明显高于 H100,MI300X、MI325X 同理。这张表用来建立数量级直觉没问题,但不要把它当成实测排名。
6. 换成更容易理解的工作量
token 数还是有点抽象,我们可以继续换算成人能理解的工作量。
假设一次 AI 输出是:
一篇 1500 token 左右的长回答。
这个长度大概相当于:
- 一次比较完整的 AI 问答;
- 一段较详细的技术解释;
- 一篇短文章的主体内容;
- 一次较完整的材料摘要;
- 一段比较长的代码说明。
按这个长度,上面那张表最后一列就是答案:从 RTX 4090 的约 1400 次,到 B200 的约 9640 次。
如果换成客服场景,假设一次客服回答平均 500 token,那么一小时大致是:
| 算力卡 | 一小时大约完成多少次客服回答 |
|---|---|
| RTX 4090 | 约 4200 次 |
| L40S | 约 4700 次 |
| A100 | 约 4000 次 |
| H100 | 约 12700 次 |
| H200 | 约 12700 次 |
| MI300X | 约 16800 次 |
| MI325X | 约 16800 次 |
| B200 | 约 28900 次 |
这样就比较直观了。
一张 H100 不是“比普通显卡快一点”,而是可以在一小时内完成上万次普通 AI 问答。
一张 B200 级别的卡,如果用在高并发文本推理场景里,一小时可以生成上千万级别的 70B token。
如果是 8 卡服务器,理论上还可以继续放大。当然,实际不能简单乘以 8,因为还要看并行效率、网络通信、推理框架和调度策略。
7. 不是所有卡都能舒服跑 70B
这里要加一个很重要的反直觉结论:
算力卡能不能干活,不只看 TFLOPS,还要看显存。
因为 70B 模型如果用 FP16/BF16,光模型权重大约就需要:
70B × 2 byte ≈ 140GB 显存
这还没有算:
- KV Cache;
- 推理框架开销;
- batch;
- 上下文长度;
- 并发用户。
所以很多卡虽然算力很强,但单卡未必能舒服地跑 70B FP16/BF16。
| 算力卡 | 单卡跑 70B FP16/BF16 是否舒服 | 原因 |
|---|---|---|
| RTX 4090 24GB | 不现实 | 显存不够,只能量化或多卡 |
| L40S 48GB | 不现实 | 更适合中小模型 |
| A100 80GB | 不够舒服 | 可跑量化 70B,FP16 需多卡 |
| H100 80GB | 不够舒服 | 算力强,但显存不足 |
| H200 141GB | 接近临界 | 权重能放下,但余量紧张 |
| MI300X 192GB | 比较舒服 | 大显存适合 70B 推理 |
| MI325X 256GB | 很舒服 | 长上下文和高并发余量更大 |
| B200 180GB | 比较舒服 | 算力和显存都强 |

H200 的关键变化不是 FP16/BF16 算力比 H100 暴涨,而是显存提升到 141GB、带宽提升到 4.8TB/s,这对大模型推理尤其重要。 MI300X 这类卡的优势也很明显:大显存、高带宽,更适合大模型推理、长上下文和高并发场景。
这就解释了一个常见误解:
H100 很强,但 H100 80GB 单卡并不等于可以随便跑 70B FP16。
算力决定“跑得快不快”。 显存决定“装不装得下”。 带宽决定“高并发、长上下文时稳不稳”。
对大模型来说,装不下,算力再强也没用。
8. 这个 token 值不值?——再算价值
前面说 70B 的 token 更贵。但更贵,不等于更值。
同样是 1000 个 token,不同模型生成出来,质量可能完全不同:
- 7B 模型生成 1000 token;
- 35B 模型生成 1000 token;
- 70B 模型生成 1000 token;
- ChatGPT 生成 1000 token;
- Claude 生成 1000 token;
- DeepSeek 生成 1000 token;
- GLM 生成 1000 token。
它们数量上都是 1000 token,但内容价值不在一个层级。
70B 的 token 通常来自更大规模参数、更复杂的概率判断,在复杂推理、长文组织、代码生成、专业分析场景里,往往更有价值。但是,如果只是简单客服、批量摘要、文本分类、短文改写,就不一定非要用最强模型。
这就像同样写 1000 个字,小学生写、编辑写、专家写,数量一样,但背后的质量和成本不一样。
所以真正的成本不是每 100 万 token 多少钱,而是每 100 万个“有效 token”多少钱。
什么叫有效 token?
就是它能不能真正解决问题。
- 一段回答写了 3000 token,但全是套话,没法用,那它的有效 token 很少。
- 另一段回答只有 800 token,但结构清楚、判断准确、可以直接采用,那它的有效 token 反而更多。
所以,算力最终不是为了生产更多字符,而是为了生产更多有效结果。
把影响“有效产出”的因素拆开看,大致有这么几层:
| 维度 | 决定什么 | 典型问题 |
|---|---|---|
| 算力 | 生成速度 | 一小时能吐多少 token |
| 显存 | 能不能装下模型 | 能不能跑 70B、长上下文、高并发 |
| 带宽 | 推理效率 | 多用户并发时会不会卡 |
| 模型规模 | token 成本 | 35B 和 70B 的 token 消耗不同 |
| 模型质量 | token 价值 | 生成内容能不能直接用 |
| 价格 | 性价比 | 每块钱能买到多少有效产出 |
所以讨论“一小时能干多少活”,至少有三种算法,一种比一种更贴近业务。
(1). 只看理论算力
TFLOPS 越高,一小时能生成的 token 越多。
这是最粗糙的算法。它容易误导,因为它忽略了显存、带宽和工程效率。
(2). 看 token 吞吐
一张卡一小时能生成多少个 70B token?多少个 35B token?多少个 7B token?
这个更准确。同一张卡跑 35B,理论 token 吞吐大约是跑 70B 的两倍;跑 7B,大约是十倍。
(3). 看有效工作量
一小时能完成多少篇可用文章?多少条客服问题?多少次代码修改?服务多少个真实用户?
这才是最接近业务的算法。因为 token 多,不一定代表工作做得好:有些模型写得快,但废话多、返工多;有些模型更贵,但一次输出就能用;有些任务不需要最聪明的模型,只需要足够便宜、足够稳定、能批量处理。所以真正应该比较的是单位时间内产生了多少有效结果。
9. 算力不是参数游戏,而是 AI 生产力的底座
所以,不同算力卡一小时能干多少活,不能简单看广告里的峰值算力。
更准确的理解应该是:
- 算力决定它吐 token 的速度;
- 显存决定它能不能装下大模型;
- 带宽决定它在并发和长上下文里能不能跑稳;
- 模型规模决定每个 token 的计算成本;
- 模型质量决定每个 token 有没有价值。

如果把 AI 看成一条内容、代码、问答和知识处理的生产线,那么一张高端算力卡一小时不是在写几篇文章,而是在生产几百万到上千万 token。
但最终真正有价值的,不是 token 数量本身,而是有效 token。
能被采用的回答,能减少人工返工的代码,能真正解决问题的分析,才是算力最后变成生产力的地方。
所以,回到最开始的问题“不同算力卡一小时能干多少活?”,表面答案是“一小时能生成几百万到上千万 token”,更准确的答案是“一小时能生产多少有效 AI 结果”。
这才是算力从参数变成生产力的关键。