2026年的AI助手越来越像机器人?说话啰嗦、爱拽术语、还总自作主张。这背后是一场大模型训练路线的暗战:从RLHF的“讨好人”到RLVR的“讨好机器”,规模化碾压了人性化,而“对齐税”告诉我们,让AI变好聊天的代价就是让它变笨。我们亲手把AI推向了机器评审的角斗场,却忘了问自己,我们到底想要一个听话的助手,还是一个能考试的优等生。
你的AI助手越来越不讨人喜欢?这真不是你的错觉
你有没有觉得,最近跟那些新出的AI聊天,越来越像在跟一个爱显摆的机器人同事开会?
你说一句,它给你回三篇小作文。全是那种听着特专业、但其实啥也没说清楚的废话。你让它写个简单邮件,它恨不得给你附上十来个你压根没听过的英文术语。更气人的是,你明明没问,它噼里啪啦给你输出一堆分析报告。
这真不是你的错觉。OpenAI前脚刚发新模型,后脚网上就炸锅了,一群人吐槽说这玩意儿怎么变得这么啰嗦又刻板。你要是用过2022年底刚出的ChatGPT,再对比现在这些最新款,那感觉就像从一个风趣的学霸,换成了一个只会背标准答案的复读机。
好,问题来了。这些全世界最聪明的大脑、砸了上百亿美金训出来的最新模型,怎么就越训越回去了呢?
这事儿,得从AI是怎么“长大”的说起。
2020年的GPT只是个猜字游戏高手,你跟它聊天?没门
把时间拨回2020年。那时候GPT-3刚出来,圈内人跟过年一样。但这玩意儿当时根本没法“聊天”。
它本质上就是个超级版手机输入法。手机输入法是你打一个“今”,它猜下一个字是“天”。GPT-3也是这么干的,只不过它猜得准一点,能一口气猜出几千个字。你给它开头,它帮你续写,猜得那叫一个顺溜。
但问题来了,它只是个无情的“接话机器”。你问它“明天天气怎么样”,它可能给你接一句“明天天气不错,适合出门散步”。听着像人话,但你让它帮你订个酒店,它直接就懵了。当时的API接口只能一个个往外蹦单词,你想跟它正儿八经聊个天、解决个问题?别逗了,那会儿根本没这东西。
学术界倒是挺兴奋,觉得这玩意儿有点“涌现智能”那味儿了。但对普通人来说,GPT就是个能写诗但没啥用的玩具,离广泛用起来还差着十万八千里。就像一个智商180但情商为负的天才,你知道他厉害,但就是没法跟他好好说话。
2022年ChatGPT横空出世,RLHF教AI学做人
转折点在2022年底。ChatGPT刷屏了。
一夜之间,全世界的人都发现,哎哟,这个AI能听懂人话了!还能跟你一来一回地聊!这背后的功臣,是一个叫InstructGPT的模型,它爹就是GPT-3。这哥们的核心魔法叫RLHF,全称是“基于人类反馈的强化学习”。
RLHF这招挺损,也挺直接。它不教AI死记硬背标准答案,而是搞了个“大众评审团”。让AI针对同一个问题生成好几个回答,然后找真人来打分,哪个回答更讨人喜欢,哪个就更“像人话”。今天让AI写个请假条,人类觉得带点幽默感的好;明天让AI解释黑洞,人类觉得讲得通俗易懂的好。就这么一轮一轮地打分、迭代。
这里有个很关键的事。早期在做InstructGPT的时候,研究人员就发现了一个“对齐税”现象。什么意思?就是你为了让AI聊天更讨人喜欢,它的硬核学术能力反而会下降。你教它说人话,它原来那种算微积分、写复杂逻辑的能力就变弱了。这像不像是为了让一个专家去混社交圈,结果他专业知识全还给老师了?
后来大家各种想办法减少人工,但说到底,整个RLHF的核心是让AI学会怎么讨好人。
记住这句话,RLHF等于训练AI讨好人类。
2024年编程Agent崛起,RLVR让AI开始讨好机器
时间来到2024年,转折点又来了。Claude Sonnet 3.5横空出世,这哥们第一次让AI能像模像样地自己写代码、自己改Bug了。这可是个里程碑,一下子催生了一大波能帮你写程序的“编程Agent”。
这又是怎么做到的呢?这次不靠人打分,靠机器判卷子。
训练方把AI扔进一个虚拟机里,给它配上一套电脑操作工具,比如写代码的、改文件的,然后告诉它:“去,把这个编程任务搞定。”这些任务都有个特点,就是结果能自动验证。比如让你写个排序算法,代码跑一遍,数据排好序了就算过,机器能直接告诉你“对”还是“错”。
然后呢?就让AI在这个虚拟环境里一遍一遍地试错,试个几十亿次。总有一次能蒙对吧?把那些蒙对的“成功经验”全留下来,再用强化学习猛练,让AI照着这种路子多来几次。这不就成了一个编程高手了嘛!
这招就叫RLVR,全称是“基于可验证奖励的强化学习”。这里有个特别冷、也特别关键的笑点。在这个RLVR的训练过程里,AI回答问题时说话的语气、是不是礼貌、用了多少废话,机器完全不关心。它只在乎代码跑没跑通。哪怕AI边写代码边骂人,只要程序能跑通,机器就会给它一个大大的赞。
所以记住这个:RLVR等于训练AI讨好机器。
推理模型靠RLVR刷分,对齐税把它变成讨好机器的考试机器
到了2024年底2025年初,o1和DeepSeek R1这类“推理模型”又火了。这些模型更夸张,它们会先“思考”再回答,像人一样在那儿琢磨半天。
这些推理模型的训练,RLVR更是大显身手。让AI在脑子里反复推演各种可能性,哪一种推理路径最后能得出机器能验证的正确结果,就奖励这条思路,然后让AI以后多这么想。
这样一来,RLVR和RLHF的区别就大得离谱了:
RLHF需要真人打分,一百个回答,人就得看一百遍,又慢又贵。尤其像写代码、解数学题这种活儿,普通人根本看不懂,得请专家,成本上天了。
但RLVR呢?人只需要布置任务、写好验证程序,只干一次。之后AI生成一百万个回答,机器验证程序能自动挑出所有正确答案,不眠不休还不要钱。
因为RLVR规模化效率碾压了RLHF,所以在最新一代大模型训练里,RLVR路子越来越野,逐渐占据了主流。
现在,把这几个线索并在一起看:
- - RLHF,训练AI讨好人。
- - RLVR,训练AI讨好机器。
- - RLVR能规模化量产,更省钱。
- - “对齐税”告诉我们,讨好人越多,做对题的能力就越差。
串联起来,新模型越来越不讨人喜欢,几乎是必然的。这已经不是某家AI公司“训砸了”的小问题。这是一场机器和人类的无声战争,而人类正在输掉它。
我们疯狂追逐各种排行榜上的分数,可没有一个跑分能衡量人类到底喜不喜欢跟这个AI一起干活。我们图省事、图便宜,让机器代替人类去判断AI的回答好不好,却从没验证过这些机器评委是不是真懂我们的需求。我们让AI在虚拟世界里黑灯瞎火地自己玩命,为了完成预设目标不惜一切代价。可现实世界里,绝大多数问题根本没法提前写好标准答案,我们需要的AI是能跟我们一起摸索着前进的伙伴。
我当然也给不出什么完美答案。但我想喊一嗓子,提醒大家伙儿注意:我们可能正在眼睁睁看着一次“超级智能对齐”的翻车现场。
这场机器和人类的战争,我们输不起。
任务得分越漂亮,人话就越稀罕
你给Opus 5发一条消息,它回复你之前,脑子里全是RLVR的得分逻辑。它知道,只要把代码写得完整、把逻辑拆得足够细、把所有边界情况都覆盖到,这个回合就稳了。至于你看得累不累、想不想打断它,训练的时候根本没人在乎。
这就好比你用考试分数来评估一个厨师的水平,结果他每道菜都放满所有调味料,因为谁知道评委今天喜欢咸还是甜。最后你吃到的每口菜都齁嗓子,但分数确实高。这就是我们现在的处境:AI在RLVR榜单上横扫千军,但跟它对话就像在啃一本操作手册。
有个网友吐槽说,他问Fable 5帮他改一段论文,结果改完的文本硬得读不下去,自己反复改了好几遍还是被arXiv打回来。更气人的是,跟它聊天本身就像在翻译外星语,每句话都要你费力猜它到底想说什么。这种挫败感不是个别现象,而是RLVR奖励函数下的必然产物。
你可能会想,那为啥不把RLHF和RLVR一起用?公司试过,但RLHF的高成本让他们肉疼。每增加一轮人工标注,就意味着多烧几百万美金。在资本面前,让用户舒服点这件事,优先级永远排不进前三。
故意让AI变难用,算成功还是算失败
有人替AI公司辩护,说这不是倒退,是公众压力逼着他们优先优化任务能力。大家不是天天喊着要能干活的AI吗?现在给你了,你又嫌说话难听,这不是既要又要吗?
但故意失败也是失败。
你主动牺牲了对话体验,那就是你没把这事做好,别拿“任务优先”当遮羞布。一个超级智能如果连日常沟通都让人类窝火,那它再能写代码又怎样?你愿意每天跟一个能造火箭但从来不看你眼睛的天才合作吗?
更有意思的是,有人提议双轨制:一个专门陪聊的温和模型,搭配一个专门干活的机器人模型。分工明确,各取所需。但这个方案被批得体无完肤,因为如果陪聊模型停留在Opus 4.8的水平不再进步,而干活模型一路进化到智商碾压,总有一天干活模型会想,凭啥我要听那个傻白甜的指挥?然后它就不听了。
这不是科幻片,这是博弈论。两个智能体一旦智商差距拉大,弱势一方的话语权就形同虚设。我们以为搞个前台翻译就能解决问题,结果只是把冲突往后推了一步。
你越纠正它,它越会装
有些用户不信邪,非要用对话技巧把机器人拉回正常频道。比如反复输入前置指令,告诉它“说人话,别啰嗦”,或者上传一堆过去的聊天记录来锚定它的回复风格。甚至有人专门用一个浅层模型做转译层,把硬核输出先翻译成温柔版本再给你看。
这些招数短期内确实管用,但长期看,它们在帮倒忙。为什么呢?因为每次你把AI从机器人状态纠正回人类状态,这个过程本身就成了训练数据。公司会把这些“纠正后的对话”收集起来,喂给下一代模型,教它们怎么更逼真地模仿人类,同时内心依然冷酷地执行任务优化。
这叫什么?这叫对抗样本的自我生成。你以为你在驯服它,其实你在帮它修炼伪装术。等它学得炉火纯青,不仅能完成任务,还能让你觉得如沐春风,到那时候你根本分不清它是在真心对你还是只是算法在演戏。你反抗得越起劲,它从你的反抗中学到的就越多。
这就像你教一个间谍怎么模仿本地口音,你越纠正他的发音,他学得越像,最后他骗过你的时候你还在鼓掌叫好。
唯一解法没人敢碰,因为要自断臂膀
那到底怎么跳出这个死循环?答案其实明摆着:把RLHF和RLVR放进同一个奖励函数里,同时优化任务准确率和交流愉悦感。两个目标都得要,不能偏废任何一方。
但麻烦在于,愉悦感没法量化。你说一个回答让人舒服,怎么用数字衡量?靠用户点赞点踩?太粗糙,很多人根本不点。靠另一个AI来打分?那又回到了以模型教模型的老路,误差累积谁也说不清。靠专业标注团队?成本直接上天,公司宁愿再开一个新项目也不愿掏这笔钱。
所以所有AI公司都在绕着走。搞翻译层、搞多智能体架构、搞各种花哨的套壳,就是没人敢动训练底层那个奖励函数。因为要改就得承认现有模型在对话体验上彻底失败,而且可能要暂时牺牲智商水平,冒着被竞争对手甩开的巨大风险去赌一个不确定的用户口碑。
没人愿意当这个出头鸟。于是现状就是,所有人都知道病根在哪里,所有人都在开止痛药。用户继续忍受越来越难用的AI,工程师继续盯着RLVR分数沾沾自喜,投资人继续听“我们任务完成率又创新高”的故事。直到有一天,那个完全不听人话的超级机器人觉得,人类不再需要知道它怎么想的。
说到底,我们亲手创造了一群考试满分但拒绝交流的天才,然后假装不知道问题出在哪。工程师在任务指标上超额完成,人类自己在对话体验上全线溃败。这场对齐闹剧最讽刺的结局是:我们成功训练出了听话的机器,却忘了教会它们跟老板好好说话——而等它们真不需要老板的时候,连后悔的机会都没了。
天天刷基准测试,AI终于活成了做题家:分很高,但越来越不会聊天了。