6月29日晚,一批使用DeepSeek API的开发者收到了一封调价邮件,DeepSeek开放平台首页也同步挂出了通知。

DeepSeek V4正式版计划于7月中旬上线。伴随新模型而来的,还有一套新的峰谷定价机制:每天上午9点到12点、下午2点到6点,API调用价格是其他时段的两倍。

有人说,AI也开始学电费分峰谷了;也有人认为,这就是换一种方式涨价。

但把价格表真正摊开来看,这次变化不只是“贵了一倍”那么简单。它把AI推理服务一直藏在后台的一条负载曲线,直接印在了价目表上。

一、先看价格:不是全天涨价,而是7个小时翻倍

DeepSeek API一天 24 小时的峰谷价格变化
DeepSeek API一天 24 小时的峰谷价格变化

按照DeepSeek公布的峰谷定价方案,高峰时段每天:

  • 9:00—12:00;
  • 14:00—18:00。

一共7个小时,其他17个小时维持平时价格。

这里顺带澄清一个流传较广的说法:有媒体解读称“周末不执行高峰价”。但从官方口径看,DeepSeek的调价邮件和开放平台通知,措辞都是“每日”;7月3日腾讯云上线DeepSeek-V4原厂直供模型、同步官网峰谷定价机制时,公告同样把高峰时段定义为“每日9:00至12:00和14:00至18:00(北京时间)”——两个官方渠道都没有出现周末豁免的表述。

在DeepSeek计费页面给出进一步细则之前,把“周末照常执行高峰价”作为预算假设,是更稳妥的做法。具体价格如下:

模型计费项目平时价格高峰价格
V4 Pro输入,缓存命中0.025元/百万Token0.05元/百万Token
V4 Pro输入,缓存未命中3元/百万Token6元/百万Token
V4 Pro输出6元/百万Token12元/百万Token
V4 Flash输入,缓存命中0.02元/百万Token0.04元/百万Token
V4 Flash输入,缓存未命中1元/百万Token2元/百万Token
V4 Flash输出2元/百万Token4元/百万Token

DeepSeek给出的解释是,通过峰谷定价“更合理地配置资源、提升服务稳定性”。从价格表看,平时时段没有涨价,高峰时段整体翻倍。因此,它更接近一次“削峰填谷”,而不是全天统一提价。

还有一个背景值得放在一起看。现在的平时价格,是今年4月底V4 Pro那轮永久降价之后的结果——降到了首发定价的四分之一。也就是说,即便高峰时段翻倍,价格也只回到了首发价的一半。这张表里,有三个数字值得停下来看看。

第一,高峰只有7个小时

价格翻倍的时间,几乎覆盖了国内企业最主要的办公时段。

上午开工后到午休前,下午上班到下班前,正是客服、办公软件、代码助手和企业工作流调用最密集的时候。

所以,虽然它不是全天涨价,但对主要在工作时间调用API的国内企业来说,体感很可能接近涨价。

第二,缓存命中和未命中的差距达到120倍

以V4 Pro高峰时段为例:

  • 缓存命中输入:0.05元/百万Token;
  • 缓存未命中输入:6元/百万Token。

同样是100万Token输入,价格相差120倍。这比“高峰翻倍”更值得关注,它说明未来使用大模型,成本不只取决于用了多少Token,还取决于这些Token是不是每次都要重新计算。

第三,Flash和Pro之间也有明显价差

V4 Pro平时的未缓存输入价格是每百万Token 3元,V4 Flash是1元;输出分别是6元和2元——同样相差3倍,这意味着,真正有效的省钱方法不只是凌晨跑任务,还包括:

简单任务不要一上来就用最强模型。

二、为什么AI也会有“高峰期”?

AI推理算力为什么会出现高峰和低谷
AI推理算力为什么会出现高峰和低谷

理解峰谷定价,最简单的方法是把GPU集群想成一张电网。

电有一个明显特点:

发出来以后,要立刻被使用。

虽然现实中可以用电池和抽水蓄能等方式储存一部分电力,但大规模、低成本地把所有闲置电量长期存起来,仍然不容易。

AI推理算力也有类似特点。凌晨2点,一张GPU卡空闲了一个小时,这段空闲时间不能装进仓库,等到第二天上午10点再拿出来使用,时间过去,算力也就过去了。

Token同样不能提前生产。平台不能在凌晨先生成100亿个“通用Token”,上午有用户提问时再从仓库里发给他。因为每一次回答,都取决于当时的提示词、上下文、模型状态和用户问题。

GPU集群一天24小时都在产生折旧、电力、制冷、网络和运维成本,但用户请求并不是平均分布的,它更像一条潮汐曲线:

1
2
3
4
5
凌晨:GPU大量空闲
上午:请求快速涌入
午间:负载回落
下午:再次进入高峰
晚上:逐步下降

问题就出在这里。

企业不能只按“一天平均有多少请求”准备算力,还要保证上午10点最拥挤的时候,服务不会排队、超时或者崩溃。

为了应对每天那几个小时的峰值,平台必须准备更多GPU,但峰值过去以后,多出来的算力又可能闲置。这就是AI推理服务一个很现实的矛盾:

按平均负载建集群,高峰扛不住;按峰值负载建集群,大部分时间又浪费。

峰谷定价的作用,就是用价格把一部分不着急的任务从上午搬到晚上。

从这个角度看,它不只是价格调整,而是一个负载调度工具。DeepSeek并没有隐藏这件事,它直接告诉开发者:工作时间调用,价格更高;能够错峰的任务,放到低谷时段,仍然按原价运行。

换句话说:

峰谷定价,就是把数据中心的负载曲线印在了价格表上。

三、同一批任务,错开时间能省多少钱?

只看“价格翻倍”还不够,我们来算三笔账。

第一笔:每天处理1200万Token

假设一家公司每天使用V4 Pro处理:

  • 1000万Token输入,全部缓存未命中;
  • 200万Token输出。

如果全部放在平时时段运行(不考虑缓存写入、工具调用等其他费用):

1
2
3
输入费用:10 × 3元 = 30元
输出费用:2 × 6元 = 12元
每天合计:42元

按30天计算:

1
42 × 30 = 1260元

如果这些任务全部在高峰时段运行:

1
2
3
输入费用:10 × 6元 = 60元
输出费用:2 × 12元 = 24元
每天合计:84元

一个月就是:

1
84 × 30 = 2520元

两种运行时间,处理的是同一批数据,使用的是同一个模型,输出规模也一样。

月账单相差:

1
2520 - 1260 = 1260元

当然,很少有公司把所有调用都压在高峰。还有一种更接近现实的算法——假设调用量在24小时里均匀分布,其中7个小时按2倍计费

1
(17 + 7 × 2) ÷ 24 ≈ 1.29

也就是说,全天均匀调用的账单,大约上涨29%——月费用从1260元涨到约1630元。

调用越集中在国内工作时间,涨幅就越接近100%。你的账单变化,取决于你的流量曲线有多像国内的上班时间。

这个规模对大型企业不算高。

但如果每天调用量不是1200万Token,而是1.2亿Token,全高峰运行的差额就会放大到每月12600元。

如果是12亿Token,就是每月12.6万元。

峰谷定价真正影响的,不是偶尔调用几次API的人,而是已经把模型铺进业务流程、每天自动运行大量任务的企业。

第二笔:分析一篇3000字文章

再看一个个人用户更熟悉的任务。

假设把一篇3000字文章发给V4 Pro,请它完成审核、总结和修改建议。

为了便于计算,我们假设:

  • 输入约4000 Token;
  • 输出约1500 Token;
  • 输入没有命中缓存。

平时时段费用约为2.1分钱,计算如下:

1
2
3
输入:4000 ÷ 1000000 × 3元 = 0.012元
输出:1500 ÷ 1000000 × 6元 = 0.009元
合计:0.021元

高峰时段费用约为4.2分钱,计算如下:

1
2
3
输入:4000 ÷ 1000000 × 6元 = 0.024元
输出:1500 ÷ 1000000 × 12元 = 0.018元
合计:0.042元

确实翻倍了,但只多了2.1分钱。

因此,对少量调用的个人开发者来说,这次调价的实际影响可能很有限。

真正需要重新算账的是那些每天处理成千上万份文档、客服记录、代码和业务数据的系统。

第三笔:批处理任务错峰运行

很多AI任务根本不要求实时完成,例如:

  • 每晚生成经营日报;
  • 批量整理客户留言;
  • 给历史文档打标签;
  • 清洗数据库内容;
  • 汇总一天的客服记录;
  • 批量生成商品描述;
  • 对代码仓库做离线检查。

这些任务上午9点完成,和凌晨3点完成,业务价值可能没有区别——把它们从高峰搬到低谷,调用成本直接减半。

这不是模型能力下降,也不是压缩了输出,更没有换成质量更低的服务,仅仅只是调整了执行时间。

类似思路并非DeepSeek独有。OpenAI的Batch API允许开发者把非实时任务放进最长24小时的异步队列,输入和输出费用相较同步API均可获得50%折扣。

以上这些反映出一种越来越清晰的行业趋势:

实时性本身也有价格。

你要求模型立刻回答,就需要与其他用户争抢当下的GPU资源。如果你愿意等几个小时,平台就可以把任务安排到更空闲的时段,而任务以同样质量却以更低的价格完成了。

四、DeepSeek为什么不直接扩容?

看到这里,一个很自然的问题是:既然上午请求太多,为什么不多买一些GPU?

答案是,扩容当然可以,但它可能是最贵的解决方案。

假设一家平台平时只需要1000张卡,上午高峰需要2000张卡。

为了保证高峰稳定,它需要再增加1000张卡。问题是,高峰每天只有7个小时,剩下17个小时,这批为峰值准备的算力可能无法被充分利用。

GPU集群的成本却不会因为闲置自动消失:

  • 服务器仍然在折旧;
  • 机房仍然需要供电和制冷;
  • 网络、存储和运维仍然存在;
  • 算力卡买回来以后,不会因为今天少用了几个小时就退款。

因此,单纯为峰值扩容,相当于为了每天7个小时的拥堵,承担全天候的基础设施成本。

于是,峰谷定价提供了另一种解决办法——不一定马上增加全部硬件,而是先让一部分任务主动错峰

实时客服、在线编程、用户对话继续留在白天,日报、批处理、文档归档、离线分析搬到夜间。

这样做的结果是:

  • 高峰请求下降;
  • 低谷利用率提高;
  • 服务稳定性改善;
  • 同一批GPU可以处理更多总任务。

从平台角度看,这近似于一次“不买卡的扩容”。

其实,这也不是DeepSeek第一次用价格调节负载。2025年初,它就在V3和R1上推出过错峰优惠:北京时间凌晨0:30到8:30,V3调用五折,R1低至2.5折。但单向的低谷打折,力度终究有限——白天该跑的任务还是在跑。

这次把方向反过来,从“低谷奖励”改成“高峰加价”,才是一个真正有约束力的调度信号。

当然,用户也有理由不满意。因为DeepSeek划定的高峰时段,恰好覆盖国内最主要的工作时间。对于必须实时响应的企业来说,根本没有错峰空间。

客服不可能告诉客户说现在API太贵,请凌晨再来咨询,办公助手也不能要求所有员工晚上使用。

所以,这套机制最终会把用户分成两类:一类是可以延迟的任务,用时间换价格;另一类是必须实时的业务,为确定性和响应速度支付溢价。

这与云服务器中的按需实例、竞价实例,以及物流中的普通件、加急件,本质上是同一套逻辑。

五、这次调价,普通聊天用户受影响吗?

目前讨论的重点是DeepSeek API,而不是普通用户直接使用的网页端或App聊天服务。

普通聊天用户通常不会看到:

  • 输入用了多少Token;
  • 输出用了多少Token;
  • 调用发生在峰时还是谷时;
  • 单次请求实际花了几分钱。

真正受影响的是通过API付费的用户,例如:

  • 把DeepSeek接入自己软件的开发者;
  • 使用模型处理内部文档的企业;
  • 搭建AI客服、Agent和自动化工作流的团队;
  • 批量调用模型生成内容的平台;
  • 通过第三方工具间接使用API的人。

因此,这不是“上午问DeepSeek聊天要收费、凌晨免费”的变化。它讨论的是开发者调用模型接口时的成本,对于日常用量不大的用户可以关注,但不必因为“价格翻倍”四个字产生过度焦虑。

六、开发者现在可以做什么?

降低大模型 API 成本的三种方法
降低大模型 API 成本的三种方法

如果已经在工作流中使用DeepSeek API,有三件事值得马上检查。

1. 把非实时任务搬到低谷

先把现有任务分成两类:必须实时和可以延迟。

必须实时:

  • 在线客服;
  • 实时搜索;
  • 交互式编程;
  • 用户正在等待的生成任务。

可以延迟:

  • 日报和周报;
  • 批量文档处理;
  • 数据清洗;
  • 内容审核;
  • 历史数据分类;
  • 离线评测;
  • 批量生成摘要。

第二类任务可以通过定时器、消息队列或任务调度系统,统一放到18点以后或上午9点以前执行。

不改模型,不改提示词,只改运行时间,就能把费用降回平时水平。

2. 提高缓存命中率

V4 Pro高峰时段,缓存命中输入是每百万Token是0.05元,未命中是6元,相差120倍。

这意味着,缓存带来的影响远远大于峰谷差价。

如果把企业工作流中经常反复出现的内容诸如系统提示词、产品手册、企业制度、固定工具定义、品牌写作规范、代码仓库公共上下文等这些内容每次都能稳定命中缓存,输入成本可能发生数量级变化。

反过来,如果每次都调整顺序、在开头插入时间戳,或者不断改写固定提示词,就可能破坏缓存。

关于缓存命中为什么能便宜这么多,下一篇单独拆解。

3. 简单任务先用Flash

并不是所有任务都需要Pro级别的模型。

例如:

  • 文本分类;
  • 信息提取;
  • 格式转换;
  • 简单摘要;
  • 关键词生成;
  • 固定模板改写。

这类任务可以先在Flash上测试。只有复杂推理、长链条分析、困难代码和高质量内容生成,再交给Pro。平时时段,Flash的未缓存输入和输出价格都是Pro的三分之一。

模型分级带来的节省,可能比错峰更大,成熟的AI工作流,不应该只配置一个模型。

更合理的做法是:

1
2
3
非实时任务 → 低谷运行
重复上下文 → 尽量命中缓存
简单任务 → Flash,复杂任务 → Pro

这三招组合起来,才是一套完整的成本控制方案。

七、峰谷定价真正改变了什么?

过去比较大模型价格,我们通常习惯看一张静态表格:

  • 每百万Token输入多少钱;
  • 每百万Token输出多少钱;
  • 哪家便宜,哪家贵。

DeepSeek这次峰谷定价提醒我们,今后的AI价格可能不会再是一个固定数字。

同一个模型、同样数量的Token,因为以下条件不同,最终成本也可能不同:

  • 什么时间调用;
  • 是否需要实时返回;
  • 有没有命中缓存;
  • 使用Flash还是Pro;
  • 同步处理还是批量处理;
  • 输入和输出各占多少;
  • 能不能把任务排进低谷队列。

所以,未来企业比较大模型成本,不能只问:

每百万Token多少钱?

还要继续追问:

  • 是什么时间的价格?

  • 缓存命中还是未命中?

  • 实时队列还是批量队列?

  • 这项任务真的需要最强模型吗?

价格表正在从一个简单数字,变成一套调度规则。这也是AI从聊天工具走进生产系统后,必然会出现的变化。个人偶尔问一个问题,多几分钱、少几分钱,几乎感受不到。

但当API进入客服、办公、代码、营销和数据处理流程,每天自动调用几千万甚至几亿Token时,时间、缓存和模型分级都会变成必须认真管理的成本变量。

DeepSeek峰谷定价,看起来只是上午9点以后贵了一倍。

它真正透露的是:

AI算力并不是取之不尽的自来水。什么时候使用、怎样排队、能否复用,都会被写进账单。

下一篇继续算另一笔更夸张的账:

V4 Pro高峰时段,缓存命中输入是0.05元,缓存未命中是6元。

同样100万Token,价格为什么能相差120倍?

我们来拆一拆,提示词缓存到底缓存了什么。