“在一项涵盖英语、技术、多语言和数字文本的小型比较中,我们用于 GPT-5.6 Sol 的分词器使用了 766 个词元,而 Claude Opus 5 估计使用了 1,170 个词元。 这意味着token数量减少了约 34.5%,这是一个非常显著的差异。
摘要:2026年大模型价格战白热化,但“每百万Token单价”是彻底失效的比价工具。OpenAI的o200k_base分词器比Anthropic新Tokenizer少切20%-35%的Token。本文用发帖人自曝的数据撕开“单价幻觉”,还原真实账单的数学真相。
标价牌上写着你付5块,结账时却掏了6块5
2026年8月16日,OpenAI工程师Tibo在X上抛出一个让无数CTO头皮发麻的问题:“如果你的公司还在用Opus而不是Sol,为什么?价格对你不重要吗?”
评论区瞬间炸锅。有人直接回怼:“Opus比Sol便宜啊,你搞错了吧!”
Tibo只回了四个字:“只看标价吗?”
这四个字就是捅破窗户纸的那根针!
如果你打开Anthropic官网,Opus 4.8输入每百万Token收你5美元,输出25美元。OpenAI Sol输入也是5美元,但输出要30美元。输出端Opus便宜了整整17%——任何一个采购经理看到这里都会毫不犹豫地选Opus。
但Tibo紧接着爆出了那个改变一切的数字:OpenAI的Tokenizer比Anthropic少产生大约30%的Token。
这意味着什么?意味着同样一段代码,你用Opus跑,API计数器转得更快、跳得更勤。月底账单来了,你以为自己用了1000万Token,实际上你的业务只干了OpenAI那边770万Token就能干完的活。
标价上的17%优势,被Tokenizer效率差吃掉之后,变成了什么?变成了Opus实际每百万有效Token成本比Sol高出将近10%到20%——具体取决于你写的是TypeScript还是散文!
这就怪了!
Token不是米,不是电,是厂商自己印的“虚拟粮票”
我们需要停下来,把“Token”这个东西彻底讲透——因为绝大多数人把它当成了客观物理单位。
石油按桶卖,一桶是42加仑,全世界通用。电力按度卖,一千瓦时谁家都一样。但Token不是。Token是模型厂商自己定义的一个虚拟切割单位——用一套叫做“Tokenizer”的算法,把你的自然语言或代码,切成一块一块的碎片。
OpenAI的Tokenizer叫o200k_base,词汇表大约20万个词元。Anthropic的Tokenizer是闭源的,内部代码叫A\ Tokenizer(Tibo在回复里故意写成“A\”来调侃)。
同样的句子“Please write a Python function”,在OpenAI那边可能被切成["Please", " write", " a", " Python", " function"]——5个Token。在Anthropic那边,因为对“Python”这个组合模式的压缩方式不同,可能被切成["Please", " write", " a", " Py", "thon", " func", "tion"]——7个Token。
多出来的40%不是你的任务变复杂了,纯粹是人家那把刀切得细!
Tibo说得非常直白:“OpenAI token != Anthropic token。”这不是哲学问题,这是小学数学问题——你的成本等于“单价乘以数量”。单价做不了假,数量可以做文章。
20%到35%的差距,换算成美元有多痛?
咱们拿一个真实创业公司的月活来算账。
假设你有个AI编程助手,每月处理1000万次API调用,每次调用平均输入5000个字符、输出2000个字符。用OpenAI的Tokenizer,输入侧大约切出1176个Token,输出侧471个Token。每月总Token消耗大约165亿。
如果换成Anthropic的Tokenizer,按中间值多出30%算——输入变成1529个Token,输出变成612个Token。每月总消耗飙升到214亿。多出来的49亿Token是什么概念?
按Opus输出每百万25美元算,每月多付12250美元——一年将近15万美元的纯利润凭空蒸发。而这还没有算输入端的差价!
更可怕的是,评论区有个叫fawn的用户说了一句大实话:“30%更少的Token是个很怪的卖点,因为没人会盯着Token看——直到账单开始变得像闹鬼一样。”
对,这就是陷阱所在!
但有人说“Opus推理更准”——好,咱们掰扯清楚
评论区KaiStarkk站出来替Anthropic辩护:“更高效”这个说法太片面了。Sol不知道答案的时候,超过90%的情况下会胡编乱造。这种效率的代价,在某些场景下根本不值得。
这是个极其犀利的反驳!
确实有人测过:30个复杂推理任务,Claude Opus第一次尝试就做对22个,GPT-5只做对16个。Opus的准确率高出37.5%。
但问题来了——如果你的业务是让AI写一个登录页面、调一个数据库接口、修一个bug,那6个任务的差距几乎感知不到。如果你的业务是法律合同审查、医疗诊断辅助——那对不起,多付30%的Token成本你也得捏着鼻子认。
所以这场争论的真相是:没有绝对的好坏,只有场景匹配。
但Anthropic的危机在于——Sol在代码智能基准上已经把Opus压下去了。DeepSWE v1.1测试里,Sol的输出Token不到Fable 5的一半,成本低了三分之一。也就是说,在AI编程这个最大的企业付费场景里,OpenAI的效率优势已经大到足以抹平推理能力的细微差距。
你愿意为那6个任务的准确率,每年多付15万美元吗?
Anthropic不知道这个问题吗?他们太知道了!
Anthropic不是傻子。他们知道自己的Tokenizer比OpenAI多切30%的Token,所以他们用了最传统的手段来对冲——打折。
2026年7月到8月底,Sonnet 5的输入价格压到每百万2美元,输出压到10美元。这基本上是赔本赚吆喝。但Tibo发帖的时间是8月16日——距离促销结束只剩半个月。
促销一过,Sonnet 5涨回3美元输入、15美元输出。虽然还是比Opus便宜,但跟Sol的5美元输入、30美元输出比起来,输出端便宜一半,输入端贵了67%。
换算成有效Token成本呢?Sonnet 5输入端的实际成本是3美元 ÷ 0.75(假设OpenAI Token为基准)= 4美元,跟Sol的5美元差不多。输出端15美元 ÷ 0.75 = 20美元,确实比Sol的30美元便宜。
但别忘了——输出端Opus是25美元,折算下来33.3美元,比Sol还贵!所以Anthropic把Opus架在了一个尴尬的位置:推理最强、价格最贵、Token效率最差。
这不是三体问题,这是死局!
但评论区还藏着一个更诡异的声音
有个叫Arina_kk的用户在Tibo帖子下面留言:“自从上次重置之后,我的配额消耗得比最初还要快,这让我非常担忧。”
另一个叫boss.zes的直接哀嚎:“Tibo求你了重置一下我的项目吧,没有它我的生活就要崩溃了!”
这两个留言指向了另一个被忽视的维度:输出Token的计费方式和“思考Token”的隐藏成本。
OpenAI的Sol和Anthropic的Opus在处理复杂Agent任务时,都会在内部产生大量“推理轨迹”——这些轨迹本身也是Token,也要计费。不同的模型架构,推理轨迹的长度天差地别。
评论区gsusMad问了一句直击灵魂的话:“你到底贿赂了哪路神仙才把长链条Agent任务做得这么稳……虽然我的钱押在强化学习之神身上。”
翻译过来就是:Sol在Agent任务上的Token效率优势,很可能不只是Tokenizer的功劳,还有推理调度算法层面的碾压。
而这部分数据,没有任何厂商公开过!
比一比“每百万Token”本身就是过时的游戏
整个行业现在还在用“每百万TokenX美元”来比价——这个指标在2024年也许还凑合,在2026年已经彻底沦为营销话术。
Token不是标准单位。Tokenizer不是标准算法。推理成本不是标准开销。就连“输入”和“输出”的定义,不同厂商都有微妙的差异。
那真正该比什么?比“每次成功任务的价格”!
Grok在回复Arthur时已经点破了:“没有单一的赢家。效率因语言和内容类型而异。”中文场景下,Qwen和DeepSeek的Tokenizer效率吊打OpenAI和Anthropic。非英语场景的Token成本差异可能比英语场景还要大30%以上。
如果你的业务是多语言的,你连拿英语场景做的所有成本测算都得扔进垃圾桶!
还没完:你的账单还取决于模型版本更新的“暗箱操作”
Anthropic在2026年更新了Tokenizer——从旧版切换到新版的瞬间,同一段代码的Token数暴涨了大约30%,但官方的“每百万Token价格”纹丝没动。
这意味着什么?意味着你睡了一觉醒来,同样的代码、同样的用户量、同样的API调用次数,月底账单自动涨了三成。没有任何通知、没有任何选项、没有任何补偿。
评论区NIK一开始说“Opus比Sol便宜”,Tibo反问“你说的是标价吗?”——这句话的真正杀伤力在于:绝大多数用户根本不知道自己的Token计数方式在版本更新中已经悄悄变过了。
你以为是物价没涨,其实是秤砣被换了!
最后那个让所有人都闭嘴的实验细节
Tibo在帖子里说“我会更详细地写这个话题”——但他没写。他在等什么?在等Anthropic回应?还是在等更完整的跨语言测试数据?
评论区Firat Özcan直接问:“你能对不同的语言做类似的基准测试吗?那将非常棒。”Tibo没回。
为什么没回?因为中文的Tokenizer效率差距可能比英文更大——OpenAI的o200k对中文的压缩率一直被诟病,而Qwen和DeepSeek在中文上遥遥领先。Tibo如果放出一组“Sol在中文上输给国产模型”的数据,那就不是打Anthropic的脸,而是给自己挖坑了。
所以那个最关键的实验至今没人做:同样一段500字的中文技术文档,OpenAI、Anthropic、DeepSeek、Qwen各自切出多少Token?成本分别是多少?
Tibo手里一定有这个数据。但他没发!你猜为什么?