上一篇聊了 1P 算力到底有多大,这一篇换个更具体的问法:算力听起来很大,但它到底能干什么?这个问题继续往下走,就会变成一个更具体的问题——如果我手里有一张算力卡,让它连续工作一小时的话,到底能干多少活?

  • 能写多少篇文章?
  • 能回答多少次问题?
  • 能支撑多少人同时使用 AI 助手?
  • 能不能撑起一个企业内部的智能体系统?

直接换一种更容易理解的方式:把算力换算成 AI 的实际产能。

不同算力卡一小时能干多少活
不同算力卡一小时能干多少活

1. 算力很抽象,不如换成工作量

我们平时看到算力卡参数,一张卡 300 TFLOPS,另一张卡 1000 TFLOPS,听起来差了好几倍,这个差距到底意味着什么?或者更直白的问题应该是:它一小时能完成多少 AI 工作?

比如:

  • 一小时能生成多少文字?
  • 一小时能写多少篇文章?
  • 一小时能回答多少次问题?
  • 一小时能服务多少个用户?
  • 一小时能处理多少份材料?

这才是算力真正落地之后的样子。

所以,讨论不同算力卡一小时能干多少活,不能只看“这张卡有多强”,而要看它在一个具体 AI 场景里能产出多少东西。


2. 先设定一个统一场景

要比较不同算力卡,必须先设定一个统一场景,否则没法比。

同样一张卡,跑 7B 模型、35B 模型、70B 模型,工作量完全不同,而换做不同的业务逻辑,比如图片生成、视频生成、模型训练、大模型推理,消耗也就完全不同。

选一个足够考验算力、也比较贴近日常 AI 应用的场景:运行一个 70B 级别大模型,连续一小时对外提供文本生成服务。

这个场景可以对应很多实际工作,比如写文章、写代码、做摘要、回答问题、做客服、写方案、做资料分析、给企业内部知识库提供问答服务,我们不讨论一张卡理论上有多强,而看它在大模型推理场景下一小时最多能生成多少 token。

为什么选 70B?——因为 70B 是一个比较好的参照物。

  • 7B、14B 模型更像轻量级工具,适合简单问答、分类、摘要、本地助手。
  • 35B 已经开始进入比较强的生产力模型区间。
  • 70B 则是一个分水岭:模型足够大,负载足够重,也更接近严肃的大模型推理场景。

所以本文里的“一小时能干多少活”,本质上是在问:一张算力卡连续跑 70B 大模型,一小时能生成多少 token?


3. token 是什么?

AI 生成文本不是按“字”算,也不是按“篇”算,而是按 token 算。

token 可以简单理解成:AI 处理文本的基本颗粒。

中文里,一个 token 可能接近一个字,也可能是一个词的一部分;而在英文里,一个 token 可能是一个单词,也可能是单词的一部分。不需要把 token 理解得太复杂,对普通读者来说,只要知道:token 是 AI 生成内容的计量单位。

比如:

  • 一次简短回答,可能是几十到几百 token;
  • 一次完整问答,可能是 500 到 1500 token;
  • 一篇中等长度公众号初稿,可能是 3000 到 6000 token;
  • 一次长篇分析,可能上万 token。

所以,我们可以把“算力卡一小时能干多少活”换成一个更可量化的问题:不同算力卡,一小时能生成多少 token?

铺垫了以上内容后,这个问题就可以比较了。


4. 一个 token 多少钱?——先算成本

:35B 模型生成的 1 个 token,和 70B 模型生成的 1 个 token,是一样的吗?

:数量上都是 1 个 token,但 70B 那个 token 背后的计算量,大约是 35B 的 2 倍。

35B 模型生成 1 个 token,70B 模型也生成 1 个 token,数量上都是 1 个 token,但它们背后的计算量不一样。

大模型生成 1 个 token,粗略可以按这个公式估算:

生成 1 个 token 的计算量 ≈ 2 × 模型参数量

所以:

模型规模生成 1 个 token 的粗略计算量
7B约 140 亿次浮点计算
14B约 280 亿次浮点计算
35B约 700 亿次浮点计算
70B约 1400 亿次浮点计算

也就是说:70B 模型生成 1 个 token,理论计算量大约是 35B 的 2 倍,是 7B 的 10 倍。

所以,不能简单说:“这张卡一小时能生成多少 token”,更准确的说法应该是——这张卡一小时能生成多少个某规模模型的 token。

比如:

  • 一小时生成 1000 万个 7B token;
  • 一小时生成 400 万个 35B token;
  • 一小时生成 200 万个 70B token。

这三句话代表的工作负载完全不同。

这里先只算“贵不贵”,也就是每个 token 要花多少计算量。至于“值不值”——同样 1000 个 token,不同模型的含金量差多少——我们留到后面再说。


5. 不同算力卡一小时能生成多少 token?

下面做一个简化估算。先说明口径:

项目设定
模型规模70B
精度FP16 / BF16 口径
任务类型连续文本生成
有效利用率按理论算力的 25% 折算
统计指标每小时生成 token 数
单次长回答1500 token

为什么要按 25% 有效利用率估算?

因为显卡标称算力是理论峰值,不等于真实推理吞吐。真实推理会受到很多因素影响:

  • 显存容量;
  • 显存带宽;
  • KV Cache;
  • batch size;
  • 上下文长度;
  • 推理框架;
  • 量化方式;
  • 多用户并发。

所以这里不是按理论峰值吹牛,而是按一个偏保守的工程估算来理解。

NVIDIA 官方规格显示,H200 SXM 的 FP16/BF16 Tensor Core 峰值为 1,979 TFLOPS(含稀疏),显存为 141GB,显存带宽为 4.8TB/s;这里做 dense 口径估算时,按约一半即 989 TFLOPS 计算。 AMD 官方页面显示,MI300X 面向生成式 AI 和 HPC 工作负载,配备 192GB 大容量 HBM 显存;公开资料中 MI300X 常见 FP16/BF16 dense 口径约为 1305 TFLOPS。 NVIDIA Blackwell 官方数据表显示,B200 的 FP16/BF16 张量算力约 4.5 PFLOPS(含稀疏),换算成 dense 口径约 2250 TFLOPS;要注意,常被引用的 8 卡 HGX B200“32 PFLOPS”是 FP8 口径,不是 FP16/BF16,两者不能混用。

按照这个口径,可以得到下面这张表:

算力卡大致 FP16/BF16 算力口径估算一小时生成 70B token约等于多少个 1500-token 长回答
RTX 4090约 330 TFLOPS约 212 万 token约 1400 次
NVIDIA L40S约 366 TFLOPS约 236 万 token约 1570 次
NVIDIA A100 80GB约 312 TFLOPS约 201 万 token约 1330 次
NVIDIA H100 SXM约 989 TFLOPS约 636 万 token约 4240 次
NVIDIA H200 SXM约 989 TFLOPS约 636 万 token约 4240 次
AMD MI300X约 1305 TFLOPS约 839 万 token约 5590 次
AMD MI325X约 1307 TFLOPS约 840 万 token约 5600 次
NVIDIA B200约 2250 TFLOPS(dense)约 1446 万 token约 9640 次

不同算力卡连续跑 70B 模型一小时的 token 产出对比柱状图⁠
不同算力卡连续跑 70B 模型一小时的 token 产出对比柱状图⁠

这张表的重点不是精确到个位数,而是帮助建立数量级概念。

也就是说:一张高端算力卡,一小时不是写几篇文章,而是生成几百万到上千万 token。

还要补充很重要的一点:这是一张**“按算力折算”的理想上限表**。真实的单流自回归解码,瓶颈往往不在算力,而在显存带宽。所以表里 H100 和 H200 算力相同、数字也相同,但实际推理中,H200 凭借更大显存和更高带宽,吞吐通常会明显高于 H100,MI300X、MI325X 同理。这张表用来建立数量级直觉没问题,但不要把它当成实测排名。


6. 换成更容易理解的工作量

token 数还是有点抽象,我们可以继续换算成人能理解的工作量。

假设一次 AI 输出是:

一篇 1500 token 左右的长回答。

这个长度大概相当于:

  • 一次比较完整的 AI 问答;
  • 一段较详细的技术解释;
  • 一篇短文章的主体内容;
  • 一次较完整的材料摘要;
  • 一段比较长的代码说明。

按这个长度,上面那张表最后一列就是答案:从 RTX 4090 的约 1400 次,到 B200 的约 9640 次。

如果换成客服场景,假设一次客服回答平均 500 token,那么一小时大致是:

算力卡一小时大约完成多少次客服回答
RTX 4090约 4200 次
L40S约 4700 次
A100约 4000 次
H100约 12700 次
H200约 12700 次
MI300X约 16800 次
MI325X约 16800 次
B200约 28900 次

这样就比较直观了。

  • 一张 H100 不是“比普通显卡快一点”,而是可以在一小时内完成上万次普通 AI 问答。

  • 一张 B200 级别的卡,如果用在高并发文本推理场景里,一小时可以生成上千万级别的 70B token。

如果是 8 卡服务器,理论上还可以继续放大。当然,实际不能简单乘以 8,因为还要看并行效率、网络通信、推理框架和调度策略。


7. 不是所有卡都能舒服跑 70B

这里要加一个很重要的反直觉结论:

算力卡能不能干活,不只看 TFLOPS,还要看显存。

因为 70B 模型如果用 FP16/BF16,光模型权重大约就需要:

70B × 2 byte ≈ 140GB 显存

这还没有算:

  • KV Cache;
  • 推理框架开销;
  • batch;
  • 上下文长度;
  • 并发用户。

所以很多卡虽然算力很强,但单卡未必能舒服地跑 70B FP16/BF16。

算力卡单卡跑 70B FP16/BF16 是否舒服原因
RTX 4090 24GB不现实显存不够,只能量化或多卡
L40S 48GB不现实更适合中小模型
A100 80GB不够舒服可跑量化 70B,FP16 需多卡
H100 80GB不够舒服算力强,但显存不足
H200 141GB接近临界权重能放下,但余量紧张
MI300X 192GB比较舒服大显存适合 70B 推理
MI325X 256GB很舒服长上下文和高并发余量更大
B200 180GB比较舒服算力和显存都强
算力 vs 显存散点图:算力看速度,显存看装不装得下,140GB 是 70B FP16 的门槛⁠
算力 vs 显存散点图:算力看速度,显存看装不装得下,140GB 是 70B FP16 的门槛⁠

H200 的关键变化不是 FP16/BF16 算力比 H100 暴涨,而是显存提升到 141GB、带宽提升到 4.8TB/s,这对大模型推理尤其重要。 MI300X 这类卡的优势也很明显:大显存、高带宽,更适合大模型推理、长上下文和高并发场景。

这就解释了一个常见误解:

H100 很强,但 H100 80GB 单卡并不等于可以随便跑 70B FP16。

算力决定“跑得快不快”。 显存决定“装不装得下”。 带宽决定“高并发、长上下文时稳不稳”。

对大模型来说,装不下,算力再强也没用。


8. 这个 token 值不值?——再算价值

前面说 70B 的 token 更贵。但更贵,不等于更值

同样是 1000 个 token,不同模型生成出来,质量可能完全不同:

  • 7B 模型生成 1000 token;
  • 35B 模型生成 1000 token;
  • 70B 模型生成 1000 token;
  • ChatGPT 生成 1000 token;
  • Claude 生成 1000 token;
  • DeepSeek 生成 1000 token;
  • GLM 生成 1000 token。

它们数量上都是 1000 token,但内容价值不在一个层级。

70B 的 token 通常来自更大规模参数、更复杂的概率判断,在复杂推理、长文组织、代码生成、专业分析场景里,往往更有价值。但是,如果只是简单客服、批量摘要、文本分类、短文改写,就不一定非要用最强模型。

这就像同样写 1000 个字,小学生写、编辑写、专家写,数量一样,但背后的质量和成本不一样。

所以真正的成本不是每 100 万 token 多少钱,而是每 100 万个“有效 token”多少钱。

什么叫有效 token?

就是它能不能真正解决问题。

  • 一段回答写了 3000 token,但全是套话,没法用,那它的有效 token 很少。
  • 另一段回答只有 800 token,但结构清楚、判断准确、可以直接采用,那它的有效 token 反而更多。

所以,算力最终不是为了生产更多字符,而是为了生产更多有效结果。

把影响“有效产出”的因素拆开看,大致有这么几层:

维度决定什么典型问题
算力生成速度一小时能吐多少 token
显存能不能装下模型能不能跑 70B、长上下文、高并发
带宽推理效率多用户并发时会不会卡
模型规模token 成本35B 和 70B 的 token 消耗不同
模型质量token 价值生成内容能不能直接用
价格性价比每块钱能买到多少有效产出

所以讨论“一小时能干多少活”,至少有三种算法,一种比一种更贴近业务。

(1). 只看理论算力

TFLOPS 越高,一小时能生成的 token 越多。

这是最粗糙的算法。它容易误导,因为它忽略了显存、带宽和工程效率。

(2). 看 token 吞吐

一张卡一小时能生成多少个 70B token?多少个 35B token?多少个 7B token?

这个更准确。同一张卡跑 35B,理论 token 吞吐大约是跑 70B 的两倍;跑 7B,大约是十倍。

(3). 看有效工作量

一小时能完成多少篇可用文章?多少条客服问题?多少次代码修改?服务多少个真实用户?

这才是最接近业务的算法。因为 token 多,不一定代表工作做得好:有些模型写得快,但废话多、返工多;有些模型更贵,但一次输出就能用;有些任务不需要最聪明的模型,只需要足够便宜、足够稳定、能批量处理。所以真正应该比较的是单位时间内产生了多少有效结果。


9. 算力不是参数游戏,而是 AI 生产力的底座

所以,不同算力卡一小时能干多少活,不能简单看广告里的峰值算力。

更准确的理解应该是:

  • 算力决定它吐 token 的速度;
  • 显存决定它能不能装下大模型;
  • 带宽决定它在并发和长上下文里能不能跑稳;
  • 模型规模决定每个 token 的计算成本;
  • 模型质量决定每个 token 有没有价值。
算力如何变成 AI 生产力:算力→token 吞吐→工作量→有效 token 的四层换算⁠
算力如何变成 AI 生产力:算力→token 吞吐→工作量→有效 token 的四层换算⁠

如果把 AI 看成一条内容、代码、问答和知识处理的生产线,那么一张高端算力卡一小时不是在写几篇文章,而是在生产几百万到上千万 token。

但最终真正有价值的,不是 token 数量本身,而是有效 token。

能被采用的回答,能减少人工返工的代码,能真正解决问题的分析,才是算力最后变成生产力的地方。

所以,回到最开始的问题“不同算力卡一小时能干多少活?”,表面答案是“一小时能生成几百万到上千万 token”,更准确的答案是“一小时能生产多少有效 AI 结果”。

这才是算力从参数变成生产力的关键。