6月29日晚,一批使用DeepSeek API的开发者收到了一封调价邮件,DeepSeek开放平台首页也同步挂出了通知。
DeepSeek V4正式版计划于7月中旬上线。伴随新模型而来的,还有一套新的峰谷定价机制:每天上午9点到12点、下午2点到6点,API调用价格是其他时段的两倍。
有人说,AI也开始学电费分峰谷了;也有人认为,这就是换一种方式涨价。
但把价格表真正摊开来看,这次变化不只是“贵了一倍”那么简单。它把AI推理服务一直藏在后台的一条负载曲线,直接印在了价目表上。
一、先看价格:不是全天涨价,而是7个小时翻倍

按照DeepSeek公布的峰谷定价方案,高峰时段每天:
- 9:00—12:00;
- 14:00—18:00。
一共7个小时,其他17个小时维持平时价格。
这里顺带澄清一个流传较广的说法:有媒体解读称“周末不执行高峰价”。但从官方口径看,DeepSeek的调价邮件和开放平台通知,措辞都是“每日”;7月3日腾讯云上线DeepSeek-V4原厂直供模型、同步官网峰谷定价机制时,公告同样把高峰时段定义为“每日9:00至12:00和14:00至18:00(北京时间)”——两个官方渠道都没有出现周末豁免的表述。
在DeepSeek计费页面给出进一步细则之前,把“周末照常执行高峰价”作为预算假设,是更稳妥的做法。具体价格如下:
| 模型 | 计费项目 | 平时价格 | 高峰价格 |
|---|---|---|---|
| V4 Pro | 输入,缓存命中 | 0.025元/百万Token | 0.05元/百万Token |
| V4 Pro | 输入,缓存未命中 | 3元/百万Token | 6元/百万Token |
| V4 Pro | 输出 | 6元/百万Token | 12元/百万Token |
| V4 Flash | 输入,缓存命中 | 0.02元/百万Token | 0.04元/百万Token |
| V4 Flash | 输入,缓存未命中 | 1元/百万Token | 2元/百万Token |
| V4 Flash | 输出 | 2元/百万Token | 4元/百万Token |
DeepSeek给出的解释是,通过峰谷定价“更合理地配置资源、提升服务稳定性”。从价格表看,平时时段没有涨价,高峰时段整体翻倍。因此,它更接近一次“削峰填谷”,而不是全天统一提价。
还有一个背景值得放在一起看。现在的平时价格,是今年4月底V4 Pro那轮永久降价之后的结果——降到了首发定价的四分之一。也就是说,即便高峰时段翻倍,价格也只回到了首发价的一半。这张表里,有三个数字值得停下来看看。
第一,高峰只有7个小时
价格翻倍的时间,几乎覆盖了国内企业最主要的办公时段。
上午开工后到午休前,下午上班到下班前,正是客服、办公软件、代码助手和企业工作流调用最密集的时候。
所以,虽然它不是全天涨价,但对主要在工作时间调用API的国内企业来说,体感很可能接近涨价。
第二,缓存命中和未命中的差距达到120倍
以V4 Pro高峰时段为例:
- 缓存命中输入:0.05元/百万Token;
- 缓存未命中输入:6元/百万Token。
同样是100万Token输入,价格相差120倍。这比“高峰翻倍”更值得关注,它说明未来使用大模型,成本不只取决于用了多少Token,还取决于这些Token是不是每次都要重新计算。
第三,Flash和Pro之间也有明显价差
V4 Pro平时的未缓存输入价格是每百万Token 3元,V4 Flash是1元;输出分别是6元和2元——同样相差3倍,这意味着,真正有效的省钱方法不只是凌晨跑任务,还包括:
简单任务不要一上来就用最强模型。
二、为什么AI也会有“高峰期”?

理解峰谷定价,最简单的方法是把GPU集群想成一张电网。
电有一个明显特点:
发出来以后,要立刻被使用。
虽然现实中可以用电池和抽水蓄能等方式储存一部分电力,但大规模、低成本地把所有闲置电量长期存起来,仍然不容易。
AI推理算力也有类似特点。凌晨2点,一张GPU卡空闲了一个小时,这段空闲时间不能装进仓库,等到第二天上午10点再拿出来使用,时间过去,算力也就过去了。
Token同样不能提前生产。平台不能在凌晨先生成100亿个“通用Token”,上午有用户提问时再从仓库里发给他。因为每一次回答,都取决于当时的提示词、上下文、模型状态和用户问题。
GPU集群一天24小时都在产生折旧、电力、制冷、网络和运维成本,但用户请求并不是平均分布的,它更像一条潮汐曲线:
| |
问题就出在这里。
企业不能只按“一天平均有多少请求”准备算力,还要保证上午10点最拥挤的时候,服务不会排队、超时或者崩溃。
为了应对每天那几个小时的峰值,平台必须准备更多GPU,但峰值过去以后,多出来的算力又可能闲置。这就是AI推理服务一个很现实的矛盾:
按平均负载建集群,高峰扛不住;按峰值负载建集群,大部分时间又浪费。
峰谷定价的作用,就是用价格把一部分不着急的任务从上午搬到晚上。
从这个角度看,它不只是价格调整,而是一个负载调度工具。DeepSeek并没有隐藏这件事,它直接告诉开发者:工作时间调用,价格更高;能够错峰的任务,放到低谷时段,仍然按原价运行。
换句话说:
峰谷定价,就是把数据中心的负载曲线印在了价格表上。
三、同一批任务,错开时间能省多少钱?
只看“价格翻倍”还不够,我们来算三笔账。
第一笔:每天处理1200万Token
假设一家公司每天使用V4 Pro处理:
- 1000万Token输入,全部缓存未命中;
- 200万Token输出。
如果全部放在平时时段运行(不考虑缓存写入、工具调用等其他费用):
| |
按30天计算:
| |
如果这些任务全部在高峰时段运行:
| |
一个月就是:
| |
两种运行时间,处理的是同一批数据,使用的是同一个模型,输出规模也一样。
月账单相差:
| |
当然,很少有公司把所有调用都压在高峰。还有一种更接近现实的算法——假设调用量在24小时里均匀分布,其中7个小时按2倍计费:
| |
也就是说,全天均匀调用的账单,大约上涨29%——月费用从1260元涨到约1630元。
调用越集中在国内工作时间,涨幅就越接近100%。你的账单变化,取决于你的流量曲线有多像国内的上班时间。
这个规模对大型企业不算高。
但如果每天调用量不是1200万Token,而是1.2亿Token,全高峰运行的差额就会放大到每月12600元。
如果是12亿Token,就是每月12.6万元。
峰谷定价真正影响的,不是偶尔调用几次API的人,而是已经把模型铺进业务流程、每天自动运行大量任务的企业。
第二笔:分析一篇3000字文章
再看一个个人用户更熟悉的任务。
假设把一篇3000字文章发给V4 Pro,请它完成审核、总结和修改建议。
为了便于计算,我们假设:
- 输入约4000 Token;
- 输出约1500 Token;
- 输入没有命中缓存。
平时时段费用约为2.1分钱,计算如下:
| |
高峰时段费用约为4.2分钱,计算如下:
| |
确实翻倍了,但只多了2.1分钱。
因此,对少量调用的个人开发者来说,这次调价的实际影响可能很有限。
真正需要重新算账的是那些每天处理成千上万份文档、客服记录、代码和业务数据的系统。
第三笔:批处理任务错峰运行
很多AI任务根本不要求实时完成,例如:
- 每晚生成经营日报;
- 批量整理客户留言;
- 给历史文档打标签;
- 清洗数据库内容;
- 汇总一天的客服记录;
- 批量生成商品描述;
- 对代码仓库做离线检查。
这些任务上午9点完成,和凌晨3点完成,业务价值可能没有区别——把它们从高峰搬到低谷,调用成本直接减半。
这不是模型能力下降,也不是压缩了输出,更没有换成质量更低的服务,仅仅只是调整了执行时间。
类似思路并非DeepSeek独有。OpenAI的Batch API允许开发者把非实时任务放进最长24小时的异步队列,输入和输出费用相较同步API均可获得50%折扣。
以上这些反映出一种越来越清晰的行业趋势:
实时性本身也有价格。
你要求模型立刻回答,就需要与其他用户争抢当下的GPU资源。如果你愿意等几个小时,平台就可以把任务安排到更空闲的时段,而任务以同样质量却以更低的价格完成了。
四、DeepSeek为什么不直接扩容?
看到这里,一个很自然的问题是:既然上午请求太多,为什么不多买一些GPU?
答案是,扩容当然可以,但它可能是最贵的解决方案。
假设一家平台平时只需要1000张卡,上午高峰需要2000张卡。
为了保证高峰稳定,它需要再增加1000张卡。问题是,高峰每天只有7个小时,剩下17个小时,这批为峰值准备的算力可能无法被充分利用。
GPU集群的成本却不会因为闲置自动消失:
- 服务器仍然在折旧;
- 机房仍然需要供电和制冷;
- 网络、存储和运维仍然存在;
- 算力卡买回来以后,不会因为今天少用了几个小时就退款。
因此,单纯为峰值扩容,相当于为了每天7个小时的拥堵,承担全天候的基础设施成本。
于是,峰谷定价提供了另一种解决办法——不一定马上增加全部硬件,而是先让一部分任务主动错峰。
实时客服、在线编程、用户对话继续留在白天,日报、批处理、文档归档、离线分析搬到夜间。
这样做的结果是:
- 高峰请求下降;
- 低谷利用率提高;
- 服务稳定性改善;
- 同一批GPU可以处理更多总任务。
从平台角度看,这近似于一次“不买卡的扩容”。
其实,这也不是DeepSeek第一次用价格调节负载。2025年初,它就在V3和R1上推出过错峰优惠:北京时间凌晨0:30到8:30,V3调用五折,R1低至2.5折。但单向的低谷打折,力度终究有限——白天该跑的任务还是在跑。
这次把方向反过来,从“低谷奖励”改成“高峰加价”,才是一个真正有约束力的调度信号。
当然,用户也有理由不满意。因为DeepSeek划定的高峰时段,恰好覆盖国内最主要的工作时间。对于必须实时响应的企业来说,根本没有错峰空间。
客服不可能告诉客户说现在API太贵,请凌晨再来咨询,办公助手也不能要求所有员工晚上使用。
所以,这套机制最终会把用户分成两类:一类是可以延迟的任务,用时间换价格;另一类是必须实时的业务,为确定性和响应速度支付溢价。
这与云服务器中的按需实例、竞价实例,以及物流中的普通件、加急件,本质上是同一套逻辑。
五、这次调价,普通聊天用户受影响吗?
目前讨论的重点是DeepSeek API,而不是普通用户直接使用的网页端或App聊天服务。
普通聊天用户通常不会看到:
- 输入用了多少Token;
- 输出用了多少Token;
- 调用发生在峰时还是谷时;
- 单次请求实际花了几分钱。
真正受影响的是通过API付费的用户,例如:
- 把DeepSeek接入自己软件的开发者;
- 使用模型处理内部文档的企业;
- 搭建AI客服、Agent和自动化工作流的团队;
- 批量调用模型生成内容的平台;
- 通过第三方工具间接使用API的人。
因此,这不是“上午问DeepSeek聊天要收费、凌晨免费”的变化。它讨论的是开发者调用模型接口时的成本,对于日常用量不大的用户可以关注,但不必因为“价格翻倍”四个字产生过度焦虑。
六、开发者现在可以做什么?

如果已经在工作流中使用DeepSeek API,有三件事值得马上检查。
1. 把非实时任务搬到低谷
先把现有任务分成两类:必须实时和可以延迟。
必须实时:
- 在线客服;
- 实时搜索;
- 交互式编程;
- 用户正在等待的生成任务。
可以延迟:
- 日报和周报;
- 批量文档处理;
- 数据清洗;
- 内容审核;
- 历史数据分类;
- 离线评测;
- 批量生成摘要。
第二类任务可以通过定时器、消息队列或任务调度系统,统一放到18点以后或上午9点以前执行。
不改模型,不改提示词,只改运行时间,就能把费用降回平时水平。
2. 提高缓存命中率
V4 Pro高峰时段,缓存命中输入是每百万Token是0.05元,未命中是6元,相差120倍。
这意味着,缓存带来的影响远远大于峰谷差价。
如果把企业工作流中经常反复出现的内容诸如系统提示词、产品手册、企业制度、固定工具定义、品牌写作规范、代码仓库公共上下文等这些内容每次都能稳定命中缓存,输入成本可能发生数量级变化。
反过来,如果每次都调整顺序、在开头插入时间戳,或者不断改写固定提示词,就可能破坏缓存。
关于缓存命中为什么能便宜这么多,下一篇单独拆解。
3. 简单任务先用Flash
并不是所有任务都需要Pro级别的模型。
例如:
- 文本分类;
- 信息提取;
- 格式转换;
- 简单摘要;
- 关键词生成;
- 固定模板改写。
这类任务可以先在Flash上测试。只有复杂推理、长链条分析、困难代码和高质量内容生成,再交给Pro。平时时段,Flash的未缓存输入和输出价格都是Pro的三分之一。
模型分级带来的节省,可能比错峰更大,成熟的AI工作流,不应该只配置一个模型。
更合理的做法是:
| |
这三招组合起来,才是一套完整的成本控制方案。
七、峰谷定价真正改变了什么?
过去比较大模型价格,我们通常习惯看一张静态表格:
- 每百万Token输入多少钱;
- 每百万Token输出多少钱;
- 哪家便宜,哪家贵。
DeepSeek这次峰谷定价提醒我们,今后的AI价格可能不会再是一个固定数字。
同一个模型、同样数量的Token,因为以下条件不同,最终成本也可能不同:
- 什么时间调用;
- 是否需要实时返回;
- 有没有命中缓存;
- 使用Flash还是Pro;
- 同步处理还是批量处理;
- 输入和输出各占多少;
- 能不能把任务排进低谷队列。
所以,未来企业比较大模型成本,不能只问:
每百万Token多少钱?
还要继续追问:
是什么时间的价格?
缓存命中还是未命中?
实时队列还是批量队列?
这项任务真的需要最强模型吗?
价格表正在从一个简单数字,变成一套调度规则。这也是AI从聊天工具走进生产系统后,必然会出现的变化。个人偶尔问一个问题,多几分钱、少几分钱,几乎感受不到。
但当API进入客服、办公、代码、营销和数据处理流程,每天自动调用几千万甚至几亿Token时,时间、缓存和模型分级都会变成必须认真管理的成本变量。
DeepSeek峰谷定价,看起来只是上午9点以后贵了一倍。
它真正透露的是:
AI算力并不是取之不尽的自来水。什么时候使用、怎样排队、能否复用,都会被写进账单。
下一篇继续算另一笔更夸张的账:
V4 Pro高峰时段,缓存命中输入是0.05元,缓存未命中是6元。
同样100万Token,价格为什么能相差120倍?
我们来拆一拆,提示词缓存到底缓存了什么。