日语敬语让AI多烧三倍钱:等级观被写进了语言底层

一句敬语让AI多烧三倍钱!

你有没有算过,跟AI说一句“谢谢”,日本人要比你多掏多少钱?

答案是:六倍。

这不是汇率问题,也不是模型版本问题。这是日语本身在AI的“计价器”上跑出了更高的里程。更离谱的是,当你让AI写一封带敬语的商务邮件,它可能会给你回一篇“宇宙级歉意”的战书。日本人把这叫做“敬语核弹”。

今天这篇文章就干一件事:把日语烧token这件事拆到骨头里。你会发现,AI对不同语言的收费逻辑,跟语言本身的美丑、难易都没有关系,只跟你说的那句话在“分词器”里被切成了多少块有关系。


语言之间的隐形价格差

先看一组扎心的数字。

英文说一句“Thank you”,在大语言模型的计价体系里算1个token。日语说同样意思的“ありがとうございます”,直接被拆成7个token。同样是表达感谢,日语用户要付七倍的钱。

这不是某个小公司偷偷调价,这是整个行业通用的底层计费逻辑。OpenAI、Anthropic、Google,所有按token收费的AI服务,都在用同一套规则:你说的话被拆成多少块,就收多少钱。

实测数据更扎心。一条简短的日常指令,英文消耗8个token,日文消耗17个,差距超过两倍。三行中等长度的指令,英文41个token,日文91个,差距拉到2.2倍。哪怕是一段完整的回复,英文67个token,日文122个,仍然高出1.8倍。

最扎心的不是平均差距,而是对话越短、差距越大。短到“谢谢”这个级别,直接飙到7倍。而恰恰是这种短句,在日常对话里出现频率最高。每一次“好的”“收到”“请继续”,都在用更高的单价被计费。


分词器才是那个定价的人

要理解这个差距,得先弄清楚AI是怎么“看”文字的。

大语言模型不认识完整的句子。它靠一个叫分词器的组件,把文字切成小块再处理。分词器干活的方法叫字节对编码,这玩意儿的工作逻辑是:统计训练数据里哪些字符组合出现频率最高,把高频组合打包成一个token。

问题出在训练数据上。互联网上最大的语料库Common Crawl里,英文内容占了将近一半,日文的比例低到可以忽略不计。分词器学了一肚子英文的常见组合——“the ”是一个token,“tion”是一个token,“ing”是一个token。这些组合在英文里天天出现,被压成了一个个“单词块”。

但日文没有空格,没有天然的词边界,汉字、平假名、片假名三种文字系统混在一起。分词器在训练数据里没见过足够多的日文组合,不知道哪些字符应该打包,只好把日文拆到最细——有时候甚至拆到单个字符级别。

一个汉字就是一个token,一个假名也是一个token。同样一段话,英文能被压缩成几个大块,日文只能散成一地碎片。这就是“语言税”的数学根源:AI的训练数据偏向谁,谁就便宜。英文是亲儿子待遇,日文是外来务工,干同样的活拿更少的钱。

早期模型更夸张。GPT-2处理日文时,每个词产生的token数量是英文的56倍。后来技术进步了,差距被压到了三四倍以内。但差距依然存在。GPT-4用的分词器下,日文token消耗是英文的2.9倍。GPT-4o稍微好一点,降到了1.7倍。技术一直在优化,但日语用户始终在付“溢价”。


敬语把AI逼成了恐怖分子

今年四月底,一个日本网友让ChatGPT写一封商务邮件。指令很简单:用“爆敬语”。

结果AI直接疯了。邮件里除了常规的“在您百忙之中万分抱歉”,还冒出了“宇宙级的歉意”“恳请您炸裂一下”,甚至在结尾说了一句“かしこまりボンバー”——翻译过来是“我明白了……炸弹”。网友笑疯了,管这叫“敬语核弹级灾难”。

好笑归好笑,但背后藏着两个硬核问题。

第一个问题:文化习惯让输入变长。日本人在正式场合默认使用敬语,外交、商务、后辈对前辈都要用。很多人跟AI说话也带着这个习惯。你让AI“用敬语写一封邮件”,指令本身就多了好几个token。AI输出的时候还要再“尊敬”一遍,输出又长了一截。两头都在烧钱。

第二个问题:AI没有“社会脑”。敬语在日语里是一整套精密的社交距离标尺——尊敬语抬举对方,谦让语压低自己,丁宁语保持基本礼貌。人类会根据场合、关系、亲疏自动调节尺度。但AI没有这套感知系统。你让它“爆敬语”,它就把礼貌推到极致、推到荒谬、推到“宇宙级”。它不知道什么时候该收、什么时候该放,因为它学的只是“这些词经常一起出现”,而不是“这些词在什么语境下用”。

有语言学者专门研究过这个问题。西安外国语大学的毋育新教授在论文里指出,当前主流大语言模型处理日语敬语时存在大量典型偏误。另一项研究也发现,现有AI工具在处理日语请求表达时,没法稳定复现母语者的语用规范。AI会说敬语,但不懂敬语。它像一个背了整本礼仪手册但从来没社交过的机器人,每句话都正确,但每句话都怪。


行业开始反击了

这场“语言通胀”已经引起了整个行业的注意。解决方案分三个方向。

第一个方向:造专属模型。2026年8月2日,日本AI公司Sakana AI上线了一个叫Sakana Namazu的API。这个模型基于开源模型Kimi K2.6,额外针对日语和日本商业文化做了后训练。价格跟基础模型一模一样,输入每百万token九毛五美元,输出四美元。等于说敬语优化的成本被Sakana自己吞了,用户不涨价。在FairPoliticsQA这个测试集里,它的得分从34%跳到了56%。乐天也出了手。他们的RakutenAI-7B模型把词汇表从32000个扩展到了48000个,专门给日语腾出空间。词汇表大了,每个词被切碎的概率就小了,token效率自然往上走。

第二个方向:直接压缩。开源社区出了一个叫genshijin的工具——日语里就是“原始人”的意思。它的逻辑简单粗暴:把日语里的敬语、礼貌用语、填充词、缓冲表达全部砍掉。官方数据说可以减少大约75%的token消耗。它有三个档位可选:礼貌、正常、极限。选“极限”模式,AI说话就跟山顶洞人一样,没有敬语、没有客套、没有废话,只剩下干巴巴的技术内容。这个工具本来是给AI编程代理用的——程序员用AI写代码的时候,日式客套话纯属多余。但它证明了一件事:日语里的冗余表达确实在大量消耗token,砍掉就能立竿见影省钱。

第三个方向:优化分词器本身。Preferred Networks在2026年6月发布的PLaMo 3.0 Prime,用的就是自研的、专为日语token效率优化的分词器。DeepSeek和Qwen这些中国模型也在逼近英文的token效率,某些任务上已经接近一比一。趋势很明确:谁先解决非英语语言的token效率问题,谁就能吃下那个市场。


日语敬语 与 印度种姓制度的相似性

语敬语的繁多,是其作为一种精细社会工具,需要同时标记上下、内外、亲疏等多重维度的必然结果。它远不止是礼貌用语,更是一种强有力的社会“划界符” 和身份地位的“晴雨表”。

简单来说:印度种姓制度是一个基于血缘的、与生俱来的、封闭的社会分层系统;而日语敬语是一种基于社会情境和人际关系的、灵活的、可习得的语言沟通工具。

用维特根斯坦的“语言即世界”来切——你会发现,敬语和种姓制度根本不是“不同的东西”,它们是同一台机器在不同文化里长出的两张脸。

这台机器的名字叫:语言如何划定“谁可以对你做什么”的边界。

想象一个日本职场新人,第一次对上司开口,他必须选择用“です・ます”体还是“だ・である”体,用“おっしゃる”还是“言う”,用“いただく”还是“もらう”。每一个选择都不是“礼貌不礼貌”的问题——他是在用语言划出上司和他之间的权力距离。 这个距离一旦被语言固定下来,就变成了他世界里的“事实”:上司高于我,我不能越界。

再看一个印度高种姓婆罗门,他对一个达利特(贱民)说话时,用的词汇、代词、动词变位,天生就带有“洁净”与“不洁”的标记。他不是在“表达”等级,他是在用语言制造等级。只要那句话被说出来,等级就在那一刻被重新确认了一次。

维特根斯坦会说:这两者根本不是“社会现象”,它们是“语言现象”。 而所有社会现象,归根结底都是语言现象。因为你的社会关系、你的身份、你对他人的权力,全都被锁在你能说、不能说的那些话里。

如果你从社会标签和语言标签这两个词语陷阱去看,日语敬语 与 印度种姓制度好像完全不答架,但是抛弃这种陷阱,从“语言即世界”去看,它们都是一样的。这就是语言这把手术刀的犀利之处。

日语敬语 与 伊朗说话特别客气的 相似性?

日语敬语和伊朗人“特别客气”的说话方式,相似程度远超你的想象。它们不只是礼貌,更像是一种深入骨髓的、用来维持社会运转的“操作系统”。伊朗的这种文化现象,被称为塔洛夫(Taarof)。

它们最核心的共同点是:语言的意义是次要的,它真正的作用,是精准地定位人与人之间的社会关系。在这个游戏里,说话的内容不重要,重要的是你通过说话,确认了谁的地位更高、谁更值得尊重。

这种“家族”相似性,可以从以下几个方面来看:

  • “抬举对方,贬低自己”
  • 一套完整的“表情包”
  • 会关系的“粘合剂”与“润滑剂”

用维特根斯坦的话来说就是:语言的意义在于它的用法。日语敬语和伊朗的塔洛夫,都是在各自社会中 “玩” 着同一套礼貌游戏,这个游戏的目的不是为了传递信息,而是为了定位彼此、维系秩序、表达尊重。它们不是语言的装饰品,而是语言本身最重要的用法之一。

大模型对伊朗语(波斯语)不擅长,根源在于三重短板叠加:

  1. 数据稀缺:波斯语属于低资源语言,高质量训练语料和评测基准严重不足,模型缺乏学习素材。
  2. 语言复杂:波斯语采用阿拉伯-波斯字母书写且省略短元音,形态变化丰富,主流分词器(Tokenizer)又为英文优化,对波斯语切分效率极低。
  3. 文化隔阂:模型输出的文本在语法上可能正确,但系统性偏离伊朗文化规范,无法在具体场景中理解客套、隐喻等社会含义。
结果是,即使GPT-4o等顶尖模型,在波斯语评测基准上准确率也常低于50%,几乎一半回答是错的。

天赋人权?你出生后学的语言就给你刻入等级。