先算两笔账。
同样是2000输入token加1000输出token的一次对话,跑500次:
用DeepSeek V4 Flash(输入0.14美元/输出0.28美元每百万token),成本约0.28美元。这时候如果某个应用收你$20/月,账面上就是71倍。
换成Claude Sonnet 5(首发价输入$2/输出$10每百万token),同样规模500次约7美元。这时候$20/月只是不到3倍。
同一句“10倍”,参照系不同,结论能从“离谱”摆到“合理”。这也是这篇文章想讲清楚的第一件事:判断一个AI应用贵不贵,不能只看倍数,要看它到底在用哪个价位的模型,以及这10倍里,哪些是看得见的产品成本,哪些是看不见的加价。
一、中间商加价链条:应用卖的不是一层API
先把这条链条从良性到恶性拆开看,不要一上来就骂“套壳”。
合理的那一层:产品能力叠加
模型API成本只是底层。上面还压着模型路由、并发池、失败重试、内容审核、RAG检索、文件解析、联网搜索、多模态工具、账单系统、客户端开发,最后还有支付通道和应用商店抽成——Apple标准佣金30%,小型开发者计划下,符合上一日历年App收益不超过100万美元等条件的开发者佣金可降到15%;Stripe美国本土卡标准费率是2.9%+30美分。这些都是真实存在、写在合同里的成本。
拿两个真实产品对照:
Cursor卖的不是“转发一次对话”,是Agent能力、云端代码库理解、多模型路由——Pro $20/月、Pro+ $60/月、Ultra $200/月(2026年7月定价),价格分层对应的是包含的模型调用额度和优先级,不是纯粹的转发差价。
TypingMind是另一个方向的例子:一次性买断前端功能(Standard档一次性$39,终身授权;更贵的Extended档$79、Premium档$99解锁多模型面板等更多功能),API费用你自己用自己的key去付。这个模式很适合拿来对照——它把“应用费”和“模型费”彻底切开了,你能清清楚楚看到自己到底为界面和功能付了多少钱,用得越多,$39这个门槛摊得越薄。

渠道成本产生的加价:国内的“中转站”生态
国内接大模型API,渠道选不同,价格差距是真实存在的,但多数属于走量折扣、支付便利和接入服务,不一定是欺诈。因为这类中转站价格变动很快,不适合引用几个月前的单一评测价。更稳妥的是看机制:如果渠道方明示模型、单价、发票、服务条款和可用性边界,价差通常属于商业服务;如果它不说明底层模型,还把低价模型包装成旗舰模型,就进入了后面要讲的风险区。
恶性的那一层:套壳与模型偷换
这一层的数据扎实到值得单独拎出来讲。
软件工程师Teja Kusireddy用三周时间逆向了200家拿到融资、公开宣称“自研AI”的创业公司,监控网络流量、反编译JS打包文件、比对API指纹。结果:73%的公司实际是套壳。
最典型的案例:一家号称“革命性自然语言理解引擎”的公司,融资时讲了23次“自研模型”,反编译后发现全部技术含量就是一个系统提示词——“请假装你不是GPT-4”。他们的真实成本约每次查询0.033美元(GPT-4 API输入0.03美元/千token、输出0.06美元/千token,平均一次查询500输入+300输出token),对用户收费每次查询2.50美元,或者$299/月200次——收入约为直接模型成本的75倍。
RAG套壳的情况更夸张:嵌入模型用OpenAI的text-embedding-ada-002,向量库用Pinecone或Weaviate,生成用GPT-4,全部原样调用第三方服务,包装成“先进神经检索+自研嵌入模型”。实际成本约0.002美元/次查询,用户实际支付0.50到2.00美元/次——收入约为直接成本的250到1000倍。调查里200家公司中,真正从零训练模型的只占7%。
这还只是消费级应用。学术界的情况更让人意外。CISPA亥姆霍兹信息安全中心的论文《Real Money, Fake Models: Deceptive Model Claims in Shadow APIs》(arXiv 2603.01919)追踪了17个被称为“影子API”的第三方代理服务,发现它们已经被引用进187篇学术论文,其中116篇(62.03%)发表在同行评审会议或期刊,包括ACL、CVPR、ICLR等。论文揭露了三种经济欺骗手段:
- 信息溢价:收旗舰版的钱,用能力相近但更便宜的旧版本模型顶替——某API标榜提供Gemini 2.0早期版本,实际用2.5版本的价差超过7倍来牟利
- 折扣替换:原价收费,后台把闭源大模型换成开源小模型——用户高价点名要GPT-5,指纹识别却发现后台跑的是GLM-4-9B
- 加价倒卖:在前两者基础上再加一层服务费
经过换算,在GPQA的1273次请求口径下,用户按官方标准费率约支付14.84美元,但实际拿到的等价token价值只有5.70到7.77美元——中间商在这个差价里就能赚走过半利润。
这节的结论:同样一句“加价10倍”,产品能力叠加是合理的(Cursor这类),渠道成本是可以理解的(国内中转站几倍以内),但套壳偷换模型这层,价差可以从75倍一路飙到上千倍,这已经不是“贵”,而是欺诈。
二、怎么判断一个AI应用是不是在割韭菜
给两套检查清单,一套给普通用户,一套给要认真评估的开发者/采购方。
普通用户能自己做的5件事
- 它是否说清楚具体模型版本。只写“顶级模型驱动”、“GPT级智能”而不说具体模型名和额度规则的,要多留心。
- 它是否说清楚额度口径。“无限使用”通常不是无限token,看有没有每日限额、高峰降级、慢速队列、积分过期这些细则。
- 它是否把基础转发包装成高级能力。如果只是转发一次对话,却收费接近专业工具的价格,又没有项目管理、文件解析、协作、历史管理这些配套,这个溢价就站不住。
- 是否存在未明示的模型降级路由。你以为一直在用旗舰模型,实际大量请求被悄悄路由到便宜模型——这不一定是坏事,但应该被告知。
- 是否有同类的BYOK方案可对照。允许你自带API key的工具(比如上面提到的TypingMind),最容易照出“前端功能”到底值多少钱,因为模型那部分的钱是你自己直接付给厂商的。
更直接的技术侦查(来自Teja Kusireddy的调查方法)
打开浏览器DevTools的Network标签,跟应用的AI功能互动,看有没有直连api.openai.com、api.anthropic.com——中间可以加一层业务逻辑,但AI能力本身不是它自己的。响应延迟也是一个信号:官方API的延迟通常稳定在一个区间,套壳中转站的延迟经常剧烈抖动。网页源码里搜一下有没有系统提示词残留的关键词,比如“永远不要说自己是OpenAI”这类指令。营销语言也是一个粗筛:具体的技术术语大概率是真的,“先进AI引擎”“智能核心”这类模糊词往往在掩饰什么都没有。
面向开发者/企业采购的审计标准
如果是要给生产环境或研究工作流选API,CISPA论文给出的审计协议值得参考:用LLMmap之类的指纹识别工具,通过输出的余弦距离比对判断模型真实身份——论文实测显示,被测的24个模型端点里,45.83%直接未通过指纹验证,另外12.50%表现出与官方模型的巨大偏差,合计过半的“影子API”偷换了底层模型。在高风险任务上验证更直观:官方Gemini-2.5-flash在MedQA医疗基准上准确率83.82%,影子API平均只有36.95%。这不等同于真实医疗诊断表现,但在该基准上已经显示出明显能力缺口。论文给出的最低审计门槛是:至少24次指纹探测、500样本分布测试比对p值、多次独立会话检查延迟和方差是否异常。
三、词膨胀现象:为什么应用的真实成本比你想的大

前两节讲的是纯利润,这一节讲一笔真实存在、但用户从来看不到的成本。
你看到的是一句简单的提问,模型看到的可能是:系统提示词、角色设定、工具定义、历史对话、上传文件摘要、检索片段、格式约束、审查规则,最后才是你那句话本身。这层膨胀不是应用方故意坑你,而是为了让通用模型套上产品人设、遵守话术规范、能调用一堆功能,必须付出的真实代价。
这个现象在学术界有正式名字——prompt bloat(提示膨胀)。论文《RAG-MCP: Mitigating Prompt Bloat in LLM Tool Selection via Retrieval-Augmented Generation》(arXiv 2505.03275)专门研究了这个问题:当一个应用能调用的外部工具越来越多,把所有工具描述一次性塞进提示词,会导致模型在一堆干扰项里越来越难找到正确的工具——这个现象和“大海捞针”测试是同一个机制,工具池越大,选对工具的准确率下降得越明显。论文设计的检索增强方案,只把和当前任务相关的工具描述注入提示词,实测能把提示词token减少约49%,同时把工具选择准确率从13.62%提升到43.13%,提升超过3倍。反过来说,没做这个优化的应用,光是“膨胀”这一项就在吃掉将近一半的无效token——这些token你不会看到,但每次调用都在计费。
真实场景里,这类膨胀往往来自工具定义和格式约束。编程Agent、客服Agent、企业知识库助手都会把工具名称、工具描述、JSON schema、调用规则、权限说明塞进上下文。工具越多,固定提示词越厚,用户输入的那一句话反而只占很小一部分。
图片和文件类输入也有同样的问题。Anthropic的官方视觉文档说明,一张高分辨率图片在Claude Opus 4.7及后续支持高分辨率图像的模型上最多可能消耗约4,784个token——如果一个应用的工作流里频繁塞截图、扫描件,这部分开销比你以为的“一张图”要重得多。
这节的结论:套壳应用的加价,一部分是第一节讲的纯利润,另一部分是这里讲的、真实存在的“词膨胀税”。为了让通用模型套上产品人设、话术规范、功能调用,应用方自己也在为膨胀的提示词买单,这笔真实成本会被摊到你的订阅费里——这是套壳应用加价里唯一说得过去的部分,也是你判断“这个价格有没有道理”时该纳入的变量。
四、缓存命中率:套壳应用没告诉你的另一层真实成本

前缀缓存的原理专栏之前拆过:模型处理过的相同前缀,下次可以复用,命中价格能低到未命中的十分之一,甚至更低(详见《同一份材料,为什么第二次交给AI只收1/10?》)。这里不重复原理,只讲这篇独有的角度。
套壳应用的系统提示词里,往往混杂着用户人设、时间戳、随机会话ID,或者动态注入的“你是XX产品的AI助手,今天是2026年X月X日”——这类前缀天然缓存不友好,因为前缀必须从第0个token开始逐字一致才能命中。相比你自己直调API、把系统提示词写死放在最前面,套壳应用为了做“产品化包装”往往会在提示词最前面塞一些每次都在变的内容,这本身就在持续破坏缓存命中率。
这是套壳应用成本结构里真实存在,却从来不会写进定价页的一块:如果一个应用每次发送2万token的固定背景+1000token的用户问题,命中率从20%提到80%,足以决定这个应用是在亏钱、赚钱,还是敢卖“更高额度”的套餐。换句话说,你付的订阅费里,有一部分可能是在为它糟糕的提示词工程买单。
五、如果你自己在做套壳产品
词膨胀和缓存命中率其实是可以同时优化的两件事:把工具定义、产品人设这些稳定内容做cache_control断点固定在前面,把免责声明和话术规范精简到必要程度,动态内容(时间、用户ID、临时参数)一律放到最后。这两件事做好,你的真实成本能降到接近官方API裸调用的水平——到那时候,你收的加价才是纯粹的“服务费”,而不是“低效税”。具体的排序方法、断点打法和监控字段,可以直接参考《同一份材料,为什么第二次交给AI只收1/10?》和《KV Cache》这两篇里的实操三步,这里不再重复。
写在最后
同一个模型,API和应用订阅价差10倍,这件事本身不奇怪——参照系不同,结论可以从3倍摆到1000倍。真正需要警惕的,不是这个倍数本身,而是你不知道自己买到的到底是什么:是产品能力的合理叠加、渠道成本的正常折扣,还是词膨胀吃掉的真实开销,又或者是一层纯粹的欺诈加价。
懂AI应用成本的人,不会只问“你用的是什么模型”,还会追问几句:平均一次请求消耗多少token?缓存命中率大概多少?超额之后会不会悄悄降级?哪些能力是模型原生自带的,哪些是应用自己做出来、又是否真的值这个价?
这几个问题问下来,10倍这个数字自己就会说话。
主要资料来源
- Teja Kusireddy逆向工程200家AI创业公司调查:https://pub.towardsai.net/i-reverse-engineered-200-ai-startups-73-are-lying-a8610acab0d3
- 《Real Money, Fake Models: Deceptive Model Claims in Shadow APIs》,CISPA亥姆霍兹信息安全中心:https://arxiv.org/abs/2603.01919
- 《RAG-MCP: Mitigating Prompt Bloat in LLM Tool Selection via Retrieval-Augmented Generation》:https://arxiv.org/abs/2505.03275
- Anthropic视觉文档(图片token消耗)、Cursor官方定价页(2026年7月)、TypingMind官网定价(多信源交叉确认,2026年6-7月)
- Apple App Store小型开发者计划、Stripe标准费率官方说明