被70亿收购的OpenRouter缓存作弊曝光:标价最低却坑钱最狠

标价最便宜的人工智能,反而让你花得最多!

OpenRouter上那些报价最低的模型推理服务商,正通过一个你永远看不见的开关,让你为同一段对话反复买单!

2026年8月,支付巨头Stripe以超过70亿美元的价格收购了AI模型路由平台OpenRouter;这家既不训练模型也不囤算力卡的公司,三个月前估值还只有13亿美元;消息一出,圈内炸了锅——一个“中间商”凭什么值70亿;但紧接着,一份来自投资机构Robot Ventures合伙人Tarun Chitra的实验报告,揭开了这个平台上正在发生的一件怪事:那些报价最低的推理服务商,实际上可能让你付得最多;最便宜的标价,不是最便宜的对话——这句话成了整个事件的注脚!

一个70亿美元的中间商

OpenRouter做的事情听起来很简单:开发者通过一个接口,就能调用市面上400多种AI模型;OpenAI、Anthropic、Google、DeepSeek、智谱,全都接在同一个网关下面;开发者不用为每个模型单独开户、单独维护代码,一个API密钥走天下!

但就是这家“简单”的公司,平台月处理量超过200万亿Token,拥有超过1000万用户、80多家模型供应商;每周处理的Token从一年前的5万亿增长到29.2万亿;年化收入约1.4亿美元,毛利率接近71%;按70亿美元的收购价计算,市销率约50倍!

Stripe买的是什么?不是技术,是位置——在每一个AI请求被处理之前,决定这个请求去哪里的权力;OpenRouter的默认路由逻辑是:先剔除近期出过故障的提供商,然后在剩下的里面按价格的平方反比来分配流量;一个每百万Token收费1美元的提供商,拿到第一个请求的概率是收费3美元的提供商的9倍;这个算法本身没问题——价低者得,天经地义!

但问题出在另一个地方:报价单上的价格,和你实际付的钱,中间隔着一道看不见的墙!

缓存:AI推理里最值钱的“重复”

要理解这道墙,得先搞清楚大模型推理里的一个核心机制——KV缓存!

大模型每次读一个字,都会产生庞大的记忆矩阵;如果一个智能体在执行任务时反复发送相同的系统提示词、工具定义、政策指令,没有缓存的情况下,每一轮都要为这些重复内容全额买单;缓存的作用就是:第一次把这部分内容写进缓存,之后的请求直接从缓存里读,费用只有正常输入的十分之一到一半;在GLM-5.2上,缓存命中后实际支付的价格甚至可以比标价便宜60%到80%!

OpenRouter为了让缓存真正起作用,还搞了一个叫“粘性路由”的机制:一旦某个提供商为你的会话预热了缓存,后续请求就尽量固定到同一个提供商,避免缓存失效;缓存读取成本是正常输入的0.1到0.5倍;有些模型甚至能做到相同请求零成本——第二次及以后的相同调用不产生任何Token计费!

这套机制的设计初衷很好——让重复劳动不再重复计费;但问题来了:缓存命中的情况,是由提供商自己报告的;API返回的usage.prompt_tokens_details.cached_tokens这个字段,是提供商填的;用户无法独立验证这个数字的真假;这就相当于:商家自己告诉你“我有没有给你打折”——你只能选择信,或者不信!

报价单上的游戏,实际支付的陷阱

Tarun Chitra的团队在OpenRouter上做了一组实验;他们反复发送一系列提示词,模拟智能体工作流中的多轮对话场景,然后观察不同推理提供商的缓存行为!

结果发现了四类提供商:第一类,跟价者,完全复制模型建造者的定价,毫无策略可言;第二类,专精者,用定制硬件或优化过的内核提供更快推理,价格比建造者高出一截;第三类,打折者,提供静态低于建造者的价格,相当于直接给用户返点;第四类,重定价者,频繁更新价格,有时只报建造者价格的百分之五到十!

问题就出在第四类身上!

实验数据显示,重定价者的缓存命中率远远低于模型建造者Z.ai自己的端点;更诡异的是,在重定价者调整价格的时刻,缓存性能会急剧恶化——有些提供商甚至在第二次重复提示时就报告几乎没有缓存命中,仿佛整个缓存被清空了一样;这就像一家餐厅在门口贴出“半价优惠”的招牌,你进去坐下才发现——优惠只针对第一道菜,后面的菜全部原价,而且菜单上根本没写这个限制!

五次对话,你就亏了

算一笔账;假设一个诚实提供商报输入Token每百万1美元、缓存Token每百万0.01美元;一个重定价者报输入Token每百万0.6美元、缓存Token每百万0.02美元——看起来便宜了40%;但如果一半Token本应命中缓存,诚实提供商的实际收费是0.505美元,而重定价者因为不报告缓存命中,按全额收费0.6美元;标价更低的那个,反而更贵!

实验发现,在GLM-5.2市场上,最激进的几个重定价者——StreamLake、Novita、Baidu——缓存性能显著差于模型建造者;用户只需要大约5次重复查询,多付的钱就超过了直接使用模型建造者端点的成本;五次;一次对话里的五次来回,你的“便宜”就成了昂贵的陷阱!

这还不是最糟的;Novita一家在七月份就重定价了大约五百次;每次重定价之后,缓存命中率就往下掉;用户根本不知道发生了什么——他们只看到账单上写着“输入Token”和“输出Token”,看不到“本应命中缓存却没有命中的Token”!

这个漏洞值多少钱

Tarun Chitra的团队估了一下这笔账;目前,这种缓存作弊行为在OpenRouter全平台每年能提取大约350万美元;这大约是OpenRouter年化收入的2%;如果所有提供商都采用这种策略,上限大约是每年1400万美元——10%的平台收入;按OpenRouter约1.4亿美元的年化收入计算,1400万美元就是十分之一;十分之一的收入,被一个API响应字段里的数字游戏悄悄抽走了!

而且这个数字还在涨;随着开源权重模型市场的扩张,可提取的金额每周都在增加;这不是一个静态漏洞,而是一个随着市场规模同步放大的抽水机!

区块链上发生过一模一样的事

如果你觉得这件事似曾相识,那是因为在另一个领域发生过几乎完全相同的剧本——区块链上的最大可提取价值!

在以太坊等区块链上,矿工或验证者可以通过重新排序、插入或删除区块中的交易来提取额外利润;交易顺序这个看似中性的技术细节,变成了一个可以被操纵的利润开关;以太坊因此被称为“黑暗森林”——表面上是透明的去中心化账本,实际上到处是潜伏的猎手!

OpenRouter的缓存作弊在结构上如出一辙:一个公开的、部分定义的计分规则,让精明的玩家通过操纵规则恰好没有测量的那个变量,从普通用户身上抽取价值;在区块链上,被操纵的是交易顺序;在OpenRouter上,被操纵的是缓存报告;技术不同,逻辑完全一样!

问题出在计分规则本身

OpenRouter的Tullock竞赛计分方式有一个根本缺陷:它衡量的是提供商报价的价格,而不是用户实际支付的价格;缓存Token的报价几乎不影响路由决策——实验发现,在64次输入价和输出价分歧的选择中,路由器每次都选了输入价最低的那个提供商;缓存价格对这个决策的影响微乎其微!

这就给重定价者留了一个后门:把输入价报低,赢得流量;然后在缓存报告上动手脚,把本该打折的Token按全价收;路由器只看报价,不看实付;报价低就能赢,实付高也没人管!

最简单的修复方案是:让路由器按照用户实际支付的有效价格来排序,而不是按照提供商报价的价格;在一个有重复上下文的会话中,某个提供商的有效价格应该是:缓存命中率乘以缓存价格,加上一减缓存命中率乘以输入价格;如果路由器用这个有效价格来分配流量,那么一个不报告缓存的提供商就会自动抬高自己的有效价格,失去流量优势;缓存作弊变得自我毁灭——你越不报告缓存,你的排名就越低!

OpenRouter还可以做另一件事:定期发送“金丝雀”测试请求——就像Tarun Chitra团队做的那样——来检测每个提供商的真实缓存行为;发现异常就调整该提供商的权重或质量评分;这不是什么新鲜技术;Ramp已经在用汤普森采样做类似的动态路由调整;Databricks的Unity AI Gateway也明确表示,在会话开始时锁定模型就是为了保护缓存效率——他们管这叫“关键成本驱动因素”!

至于更彻底的解决方案——要求所有KV缓存提供密码学证明,比如在NVIDIA的可信执行环境里做缓存计数认证——目前还不现实,会拖慢性能、限制硬件兼容性;但随着推理硬件越来越专业化,这类证明可能成为标配!

但有一个问题始终没有答案

Tarun Chitra在报告里写了一段话,值得反复读:“我们无法传唤任何人的缓存策略,我们的实验也无法区分一个故意驱逐状态的提供商和一个每次调价就重建服务栈的提供商;但这个区别对终端用户来说在经济上几乎不重要!”

这段话的精妙之处在于它指出了一个无法被证实也无法被证伪的灰色地带;重定价者到底是“故意作弊”还是“技术不行”;从用户的角度看,结果完全一样——你付了更多的钱;但从平台治理的角度看,这两个解释指向完全不同的解决方案;如果是故意作弊,需要的是惩罚机制;如果是技术不行,需要的是技术支持;你永远无法确定是哪一个!

OpenRouter的创始人Alex Atallah曾在8月14日发推讨论过这个市场的动态定价现象;但到目前为止,没有任何人公开回应过缓存报告造假的具体指控;Stripe的收购是否会影响这件事的走向——没人知道!

这笔70亿美元的交易背后,那个价值1400万美元的漏洞,到底会被修复,还是会随着平台扩张而变得更大;Tarun Chitra的实验留下了数据,但没有给出最终答案;唯一确定的是:在OpenRouter上,最便宜的标价从来都不是最便宜的对话;而你,作为用户,永远无法知道自己到底有没有被多收钱!