价格数据核对时间:2026年7月下旬。文中价格以官方定价页为准,第三方转述的地方我会单独标注。

一开始我以为这篇会写成“模型又便宜了几倍”。真把几家官方价格页翻完,结论反而没那么顺口:最强的那几档没有一路降价,有的主力模型输入价还在往上走。便宜得更明显的,是平时真正拿来写代码、跑客服、做摘要、批量处理文档的那一层。

不是所有模型都便宜了,是能干活的中间档位在往下沉。

过去一年,价格变化最集中的地方不在旗舰档,而在主力档、性价比档、缓存命中和批处理。也就是说,模型厂商没有简单把“最强模型”打折甩卖,而是把更便宜的入口拆得越来越细。

一、先看两张价格表

看价格表之前先统一口径:美元/百万token,输入/输出,不混人民币,不混包月订阅。表里优先用官方API列表价;如果是第三方聚合平台或媒体口径,会在后面单独说明。选型也定一条规则:每家只放它当前最常被开发者拿来干活的那一档,不拿旗舰去对标别家的性价比档,也不拿性价比档去对标别家的旗舰档。

表1:主力档,一年对比

厂商一年前(2025年7月)现在(2026年7月)变化
AnthropicClaude Sonnet 4,$3 / $15Claude Sonnet 5,首发价$2 / $10(8月31日后回到$3 / $15)优惠期名义上降了约三分之一,但新tokenizer会让同样文本切出更多token,官方口径约多30%,实际省钱幅度要打折扣
OpenAIGPT-4.1,$2 / $8GPT-5.6 Terra,$2.5 / $15输入涨25%,输出涨近一倍
GoogleGemini 2.5 Pro,$1.25 / $10Gemini 3.1 Pro,$2 / $12按当前价格算,输入涨60%
DeepSeekDeepSeek V3,$0.27 / $1.10DeepSeek V4-Pro,$0.435 / $0.87输入涨61%,输出降21%,两头打平

表2:性价比档,一年对比

厂商一年前现在变化
OpenAIGPT-4o mini,$0.15 / $0.60同一型号仍在售,价格没动过两年持平
GoogleGemini 2.5 Flash-Lite,$0.10 / $0.40Gemini 3.1 Flash-Lite,$0.25 / $1.50涨150%~275%
DeepSeek一直是$0.14 / $0.28还是$0.14 / $0.28两年零变化
阿里Qwen Plus,约$0.26 / $0.78(第三方聚合平台低价口径)Qwen3.7 Plus,$0.40 / $1.60(官方国际区,256K以内)官方Plus档位抬高,但不同地域和渠道价差很大
模型价格没有一起下降,真正变化的是价格结构
模型价格没有一起下降,真正变化的是价格结构

“性价比档”这个名字听起来该一路走低,但表2里Gemini Flash-Lite反而是涨幅最大的一行。阿里的情况也要小心看,官方国际区、国内区、香港/美国节点、第三方聚合平台的价格并不完全一样,不能只拿最低渠道价当成全网统一价。

二、别只看标价,真实账单通常由四件事决定

同一张价格表,放两家公司账上,感受能完全不一样,问题往往不在标价本身。

先说最容易被忽略的一点:多数模型的输出token比输入token贵好几倍,推理模型的思考token通常也按输出或生成侧计费。表面看输入价降了,真正烧钱的经常是长回答、长推理链,还有Agent那种一口气调好几轮工具的任务。

几家都在推提示词缓存,命中价通常能比未命中低一个数量级。DeepSeek V4-Pro官方价格里,缓存命中输入是$0.003625/百万token,缓存未命中输入是$0.435/百万token,高峰时段两者正好差120倍。固定的系统提示词、长文档、代码仓库上下文,如果每次都按新内容重新塞进去,就是在主动多付钱。跟缓存类似的还有批处理,报告生成、批量打标、离线摘要这类不用秒回的活,OpenAI的Batch API和Anthropic的Message Batches都能把实时调用价打到约五折。

便宜模型先判断任务类型,简单的直接答,复杂的才升级给贵模型。《2块钱vs1300块钱》那篇算过一笔经济账,全量走旗舰模型的话月成本就要上万美元,改路由后费用能降到十分之一,质量几乎没太明显的损失。降价潮真正改变的不是某个具体型号模型的标价,而是旗舰模型从“默认入口”变成了“最后兜底”。

真实AI账单不是由模型标价单独决定
真实AI账单不是由模型标价单独决定

三、降价背后的推理成本曲线:往下压的和往上顶的

推理成本主要卡在GPU、显存带宽、并发和输出长度这几个变量上,过去一年这几个变量在往两个相反的方向同时发力。

先说往下压的这头,MoE架构让每个token只激活一部分参数,蒸馏把大模型的能力迁移到小模型上,量化、KV Cache优化、投机解码、连续批处理(continuous batching)继续往吞吐量里挤空间。缓存命中率的提升尤其关键,靠的是软件工程,而不需要多买一张卡。训练成本还在涨,但推理成本正在被产品化地拆开。模型厂商没有把省下来的钱都体现在旗舰产品单价上,而是塞进了mini、flash、lite、batch、cache这些入口里。表1和表2为什么走向相反,原因也在这里:旗舰档更像利润池和能力展示窗口,日常档位才是拿来抢开发者入口的地方。

再看往上顶的这头。HBM供给周期大约在24到36个月,产能扩张慢,又容易被大客户长协锁住,这是硬约束。更直接的信号是国内云厂商今年3月到4月的一轮涨价。3月11日,腾讯云调整智能体开发平台部分模型计费策略,以Tencent HY2.0 Instruct为例,输入价格从每千token0.0008元涨到0.004505元,涨幅约463%。3月18日,阿里云和百度智能云同日宣布上调AI算力、存储等产品价格,阿里云部分算力卡最高涨34%,百度AI算力相关产品上调约5%到30%。这些不是模型API单价普涨,但它说明底层算力和存储成本并没有跟着“token单价下降”同步变轻。

更隐蔽的一层是Agent场景把单次任务的token消耗放大了。国家数据局披露过一组数:2024年初,中国日均token调用量大约为1000亿;到2026年3月,已经超过140万亿,两年多涨了1000多倍。落到具体案例上更直观。米哈游《崩坏》系列AI NPC & Gameplay技术团队负责人郑银河在2026阿里云峰会上分享过一次内部教训:有工程师测试多智能体协作,几十个Agent没有设置token消耗上限,连续跑了13个小时,账单烧到200万元人民币。Uber那边也有类似压力,COO Andrew Macdonald今年5月公开说,公司越来越难把AI token消耗和用户能感知的产品产出直接对应起来,内部开始反思所谓tokenmaxxing。两件事各自发生,但指向同一个问题:单价降得再快,也扛不住调用量更快地涨。

算力供给端还有一条线要单独拎出来说。DeepSeek V4-Pro当前的并发限制明显低于V4-Flash,官方价格页也把两档模型分成不同吞吐入口。至于昇腾950系列下半年放量后会不会带来进一步降价,现在还只能按供应端观察点处理。它和我们之前拆910C vs H100那篇能接上,但不能写成已经落地的官方降价承诺。

AI推理成本被两股力量同时拉扯
AI推理成本被两股力量同时拉扯

四、为什么你体感上还是觉得没便宜

模型厂家单价降了,作为消费者的我们感受却没变便宜,仔细琢磨了一下,大概是这几层原因叠在一起。

先是调用次数变多了。以前一次问答就是一次调用,现在一条任务链路里要搜索、改写、检查、调用工具、再总结,跑好几次模型很正常。

上下文也跟着变长了。以前几千token够用,现在动不动把几十页文档、整段日志、整个代码仓库塞进去。输入单价确实降了,但输入量涨得更快。

再往深里想,可能任务本身也变贵了。客服问答便宜,但让Agent替你跑一整套流程就贵;摘要便宜,但自动写代码、自动修bug就贵。便宜的是token,不一定是你真正要做的那件事。

所以“通用Token在探底、企业AI总支出反而在涨”这种听起来矛盾的说法,其实一点都不矛盾,因为单价和总账单本来就不是一回事。

五、未来半年价格预判

Sonnet 5的$2/$10优惠价8月31日到期,9月1日恢复标准价$3/$15,这个已经公布了,不算预测。DeepSeek V4-Pro后续是否继续下调,要看高端算力供给和官方调价节奏;昇腾950系列放量是一个值得跟的变量,但现在还不能把它写成确定会降多少。

剩下的就是猜了。主力档还会继续往下探,$0.5到$2输入、$2到$10输出这个区间会越来越挤,各家都会把常用的日常负载往这里推。旗舰档大概率不会跟着大幅降价,会继续靠可靠性、长任务、复杂代码和工具链收溢价。过去一年Opus 4.8到Opus 5这条线,价格都在$5/$25附近,这就是一个现成信号。计费颗粒度会越切越细,缓存价、长上下文溢价、推理强度档、工具调用费,会变成账单里比模型单价更重要的部分。国内这轮算力涨价如果在四季度松动,前提也不是“模型厂商想降价”,而是供需缺口真的收窄。现在证据还不够,只能当观察点。

写在最后

这一年真正变了的,不是哪个型号的模型降了百分之多少,是整个价格结构。以前问“该用哪个最强模型”,现在更像在排一张调度表:哪些任务用便宜模型,哪些等批处理,哪些上下文必须命中缓存,哪些才值得升级到旗舰档。

会调度模型,才真正吃到降价红利
会调度模型,才真正吃到降价红利

这一年AI到底便宜了多少,得看你怎么算。按单次聊天算的话,便宜了一截。按完整工作流算,就要看你有没有把模型当成一组可以调度的资源了。不会调度,降价照样可能换来更大的账单;会调度的话,过去一年已经足够把不少AI功能从演示项目推到日常生产里。

价格表的保质期还是一个季度左右。8月31日Sonnet 5恢复标准价、下半年950系列是否顺利放量,这两件事三个月内都会有新信号,够触发下一次更新。关注我,价格再有大变动,我会接着往下写。


本文属于价格追踪系列,上一篇:《用AI工具,为什么有人花2块,有人花1300块?》。文中美元价格优先采用官方API列表价,不含企业协议折扣;阿里旧版Qwen Plus低价为第三方聚合平台口径,已在表中标注;人民币价格来自对应云厂商公告或媒体转述,未按统一汇率折算。

参考资料

  • Anthropic:《Introducing Claude Sonnet 5》与Claude Platform Pricing,Sonnet 5首发价、9月1日后标准价及新tokenizer说明。
  • OpenAI:《GPT-5.6: Frontier intelligence that scales with your ambition》与GPT-5.6 Terra模型价格页,GPT-5.6 Sol/Terra/Luna定价及缓存规则。
  • Google AI for Developers:Gemini API Pricing与Gemini 3 Developer Guide,Gemini 2.5 Pro、Gemini 3.1 Pro Preview、Gemini 2.5/3.1 Flash-Lite价格。
  • DeepSeek API Docs:Models & Pricing,DeepSeek V4-Flash/V4-Pro缓存命中、缓存未命中、输出价格及并发限制。
  • Alibaba Cloud Model Studio:Model inference pricing,Qwen3.7 Plus国际区和分层定价。
  • 腾讯云公告《智能体开发平台关于部分模型启动正式收费及价格调整的公告》,2026年3月11日。
  • 每日经济新闻《最高涨34%!阿里云、百度智能云同时宣布:涨价》,2026年3月18日。
  • 新华社《我国日均Token的调用量三个月增长超40% 目前已超140万亿》,2026年3月24日。
  • 游戏葡萄《米哈游崩坏IP实战分享:为探索AI,曾一晚烧掉200万?》,2026年5月22日。
  • Indian Express / Tom’s Hardware对Uber COO Andrew Macdonald关于tokenmaxxing与AI支出的报道,2026年5月。