Claude API省钱实操手册:提示缓存、反模式清理、effort校准,三步省下45%!

花更少的钱让Claude干更多的活:Anthropic官方降本三板斧,把API账单砍掉一半!

把大模型当成吞金兽的日子,该结束了!

Anthropic官方刚刚放出了一套组合拳,教你如何在不牺牲性能的前提下,把Claude的API账单砍掉一大截。从提示缓存命中率的最大化,到移除那些专门拖累最新模型的“反模式”指令,再到精准调节Claude的工作强度(effort)——这三个动作做下来,成本降幅可达45%甚至更高,而模型表现反而可能提升。



2026年9月,Anthropic在官方博客和X平台同步发布了一组针对Claude Platform的成本优化指南。这不是那种“少用点”的废话,而是一套可操作的技术方案:通过调整提示缓存策略、清理过时指令、校准工作强度这三个杠杆,在维持甚至提升模型表现的同时大幅削减开支。官方在四个公开基准测试上的验证结果是:成本分别下降了58%、73%、52%和55%。更狠的是,在客户支持场景的实验中,仅靠清理提示词中的“反模式”,就在成本降低14.6%的同时让准确率提升了5.3%。

这意味着什么?意味着你之前可能一直在多花钱、办坏事。

你以为在帮它,其实在害它:提示词里的“反模式”正在偷你的钱

先问一个问题:你给Claude写的系统提示词,是不是还留着“请反复核对你的回答”、“务必极其详尽”、“用分步骤的方式思考”这类话?

如果是,恭喜你,你正在被收“智商税”。

Anthropic的研究团队发现了一个残酷的事实:很多开发者给Claude写的提示词,其实是在用旧模型的“药方”治新模型的“病”。那些针对老版本模型弱点打补丁的指令,放到Opus 5、Fable 5.1这些新一代模型上,不仅多余,还会反向伤害性能。

举个具体的例子。在客户支持场景的实验中,研究人员故意在提示词里埋了六种常见的“反模式”:一个已经过时的思考预算设置、一对互相矛盾的退款规则、一个手动指定的草稿板流程、一句“请验证两次”、一句“务必极其详尽”,外加一个强制性的六步操作流程。

结果是什么?

当这些带“毒”的提示词从Opus 4.8迁移到Opus 5时,模型的成本不降反升、准确率反而下滑。“验证两次”这个指令导致Claude在每次退款操作中都重复查询订单信息——多花了一倍的钱干同一件事。“务必极其详尽”则让Claude启动了数十次不必要的知识库搜索,把简单问题复杂化。

最离谱的是“手动草稿板”这个设定。Opus 5本身就有内置的推理机制,你非要它在外面再套一层手动思考流程,结果两个推理系统“打架”——Claude把本该执行的工具调用写进了自己的内部推理里,然后就忘了执行。钱花了、活没干。

这就怪了:你明明是想帮它做得更好,结果却让它变得更蠢、更贵。

Anthropic官方把这套反模式检测做成了一个叫prompt-audit的命令,集成在Claude Code的claude-api skill里。你只需要在Claude Code里运行/claude-api prompt-audit,它就会扫描你工作目录里的所有提示词、技能描述和工具定义,把那些过时的指令、矛盾的规则、多余的验证步骤一个一个揪出来。

官方在客户支持基准测试上的数据是:运行一次审计、移除所有反模式之后,成本平均下降14.6%,准确率平均提升5.3%。不是省钱降性能,是又省钱又提性能。

缓存不是可选项,是必选项:90%的折扣你拿到了吗?

如果说清理提示词是“省钱”,那用好提示缓存就是在“捡钱”。

先解释一下Claude的处理流程。每次你发一个请求,Claude要先把你的提示词处理成一个内部工作状态,这个步骤叫“预填充”(prefill)。提示缓存干的事就是把处理完的这个状态存下来——当后续请求以相同前缀开始时,Claude直接读缓存,不再重新计算一遍。

缓存读取的价格是多少?在Claude Fable 5.1和Mythos 5.1上,每百万token只收0.25美元,是标准输入价格的0.025倍。其他模型的缓存读取则是标准价格的0.1倍,也就是打一折。相比之下,Fable 5的标准输入价格是每百万token 10美元。

算一笔账:一个3000 token的系统提示词,在一个200次调用的会话中。不开缓存:200乘以3000乘以每百万token 3美元,等于1.80美元。开了缓存:一次写入(3.75美元每百万token,约0.011美元)加上199次读取(0.30美元每百万token,约0.179美元),总共0.19美元。节省了将近90%。

但缓存有个致命弱点:它要求前缀必须“字节级精确”——也就是说,任何微小的变化都会导致缓存失效。

这就是为什么很多人的缓存命中率始终上不去。你在系统提示词里加了一个时间戳、一个动态ID,或者工具定义的顺序每次都不一样,缓存就炸了。你换个模型、调一下effort设置,缓存又炸了。

Anthropic给了一套实操建议。

第一,把稳定的东西放前面。工具定义和系统提示词放在最前面,动态变化的对话内容放在后面。

第二,把不常用的工具标记为defer_loading。这些工具不会进入缓存前缀,只有在Claude通过工具搜索主动查找时才会被追加到对话中——缓存得以保留。

第三,系统提示词更新用消息形式,不要直接编辑系统提示词。某些Claude模型允许你在对话中间以消息形式追加系统指令,而不是修改系统提示词本身——这样缓存就不会被破坏。

第四,预暖缓存。在会话开始时就发一个max_tokens: 0的请求,带上明确的缓存断点,用和正式流量相同的effort设置。这个请求会把提示词处理完并写入缓存,但不生成任何输出。等用户真正开始提问时,缓存已经是热的了。

第五,注意缓存的TTL。默认是5分钟,从请求开始计时。如果你的智能体在工具调用或子请求上卡了超过5分钟,父级的缓存就过期了。这种情况下可以考虑在前缀上设置1小时的TTL。

还有一个小技巧:在对话压缩(compaction)的时候切换模型或effort设置。因为压缩本身就会重写大量缓存内容,反正缓存已经要失效了,不如趁这个机会把模型或effort也换了——不额外增加成本。

大力不一定出奇迹:让Claude该用力时用力、该省力时省力

“effort”这个参数告诉Claude“该花多大力气干活”。低effort时Claude快速得出结论;高effort时它会仔细斟酌、反复验证、探索多种方案再回答。

很多人的直觉是:effort越高越好。错了。

Anthropic在FrontierCode Diamond这个最难的50道编程题上做了测试。Claude Fable 5在低effort下每道题花费5.35美元、得分11.5%;在最高effort下每道题花费19.00美元、得分30.9%。得分提高了2.7倍,但成本增加了3.5倍——这个边际收益值不值,得看你的场景。

更极端的例子是Humanity's Last Exam。Claude Fable 5.1在低effort下每道题约0.30美元、得分约53%;在最高effort下每道题约2.23美元、得分约61%。最后那一档effort的提升只加了大约半个百分点的分数,却多花了46%的钱——而这个增幅还在基准测试的正常波动范围内。

翻译成人话:你多花的钱可能根本没有任何可测量的收益。

那怎么找到最优的effort设置?Anthropic的建议是:在你的特定任务上做一次effort扫描测试。如果成本-性能曲线在某个effort以上变得平坦,说明继续提高effort已经没有意义了——任务本身不需要那么多“思考”。

更反直觉的是:用更强的模型跑低effort,可能比用弱模型跑高effort更便宜、效果更好。

Anthropic在CursorBench 3.2上的测试显示,Claude Fable 5.1在低effort下的表现,匹配了Fable 5在高effort下的水平,而成本只有后者的三分之一。两个因素叠加:低effort下每道题干的活更少,加上Fable 5.1的缓存读取价格是每百万token 0.25美元、而Fable 5是1.00美元。就算按Fable 5的价格算,Fable 5.1在低effort下也能便宜大约40%。

让Claude自己帮你省钱:三个自动化命令就够了

Anthropic把以上所有优化手段打包成了三个Claude Code命令,全部集成在claude-api skill里。

第一个是/claude-api prompt-audit。当你迁移到最新的Claude模型时,用它扫描现有提示词,移除那些拖累新模型的反模式。

第二个是/claude-api cost-optimize。当你需要一份完整的成本审计报告时用它。它会分析你的token花在哪了——从组织层的用量报告里读、从API响应的usage对象里读、或者直接读你的请求构建代码来估算。然后按优先级排列可用的省钱方案:提示缓存、精简请求内容(包括运行prompt-audit)、限制输出长度、批量处理非紧急任务。如果你提供了评估数据集,它还会跨effort等级和模型选项计算成本与性能的权衡。

Anthropic在四个公开基准测试上跑了这个命令:

LegalBench上,cost-optimize建议缓存跨任务的共享前缀、设置低effort、通过Batch API处理任务。思考token从102,779降到8,284,通过率保持在误差范围内,成本下降约58%。

tau2-bench零售场景,通过显式设置缓存断点,成本降低72%,通过率持平。

OfficeQA Pro,加上批量处理和文档缓存,成本从136.20美元降到64.87美元,降幅约52%。

SWE-bench Verified,默认配置缓存已经正确,省钱来自把effort设为中等、把智能体的输出限制为几句简洁的话。每道题的平均步骤从29步降到17步,提示token从7520万降到3370万,成本降幅约55%。

第三个是/claude-api hillclimb。这是最狠的一个——它不光是分析,而是主动搜索。给它一个评估数据集,它会拆分成训练集和测试集,然后不断尝试配置变更,读取训练集里失败的案例来指导搜索方向,最终在测试集上打分。

Anthropic在客户支持基准上跑了一次hillclimb。从Opus 4.8的默认(高)effort出发,hillclimber先尝试了Opus 5在低effort下运行,同时用prompt-audit移除了强制工具调用仪式、草稿板步骤和矛盾规则。结果:训练集准确率98.9%,每张工单成本降到2.6美分。

然后它把模型降到了Sonnet 5、同样低effort,成本更低——每张工单1美分——但准确率掉到了88.9%。读取失败的训练工单后,Claude自己往提示词里加了路由规则和退款额度交叉引用。Sonnet 5回到了98.9%的准确率,成本不变。

在14张从未见过的测试工单上,最终配置得分90.5%,而原始配置只有78.6%——成本只有原来的五分之一。

别把优化当一次性工程:缓存断点要跟着对话一起长大

优化不是一锤子买卖。

随着对话变长,缓存的断点位置需要跟着调整。Claude Platform的自动缓存功能可以帮你把缓存断点自动应用到最后一个可缓存的块上。

还有一个很多人忽略的点:对话分叉(forking)时的缓存问题。子智能体和分支只有在前缀字节级相同、使用同一个模型、同一个effort设置时,才能共享父级的缓存。一旦任何一个条件不满足,缓存就断了。

Anthropic在博客里反复强调一件事:监控你的缓存命中率。Claude Console和缓存诊断API会告诉你缓存未命中的原因,甚至能精确指出两个请求是在哪里开始分叉的。

你以为缓存命中率很高?数据不会骗人。打开控制台看一眼,真相可能让你后背发凉。

截至2026年9月,Claude Platform的模型家族已经相当完整。Fable 5.1是最顶级的推理模型,输入每百万token 10美元、输出50美元;Opus 5是复杂智能体编程的主力,输入5美元、输出25美元——性能接近Fable 5但价格只有一半;Sonnet 5是速度与智能的平衡型,输入2美元、输出10美元。Fable 5.1的缓存读取价格已经降到了每百万token 0.25美元,比Fable 5便宜75%。

Anthropic官方测算,Fable 5.1在典型工作负载下的整体成本可以下降约25%,在高度智能体化的工作负载中最高可降45%。

但前提是——你得用对。

把优化当成一次性工程的人,永远拿不到这些数字。

优化是一个持续的过程。每次模型升级,你的提示词可能需要重新审计。每次对话变长,缓存的断点可能需要重新设置。每次任务形态变化,effort的校准可能需要重新跑一遍。

好消息是,这些活可以让Claude自己干。

坏消息是,你得先知道有这些活要干。

现在你知道了。