强化学习在给AI大模型上课时,竟然比死记硬背的预训练还要高效?这完全违背了信息论的基本常识,就像说用针尖挖隧道比用盾构机还快。
按照信息论算账,强化学习每次只拿1比特的奖励信号,而预训练每个词都要啃下十几个比特。但现实恰恰相反,强化学习经常在十步之内就让模型打通关,预训练连个屁都学不出来。这种反常识的现象,直接把AI圈子的认知炸得稀碎。
信息论算账:强化学习亏到裤子都没了
先按传统算法来算算这笔账。预训练模型每次看一个词,就计算一次损失,每次损失包含的信息量等于词库大小的对数。如果词库有四万个词,那就是大约十五个比特的信息。一个句子几十个词,几百个比特的信息就到手了,日积月累下来简直是个信息轰炸机。
强化学习这边就惨了。一次完整的推理过程,可能消耗了几千甚至几十万个词,但等到最后只能拿到一个奖励信号。这个奖励通常就是个零或一,也就一个比特的信息。从头到尾忙活半天,就为了这一个比特,这效率低得令人发指。
更操蛋的是,生成这些推理过程的计算成本比普通预训练还要高。Transformer架构在处理长序列时,受限于内存带宽,生成每个词的速度慢得像蜗牛爬。预训练是一次性把所有词都喂进去处理,强化学习却要一个字一个字往外蹦,成本直接翻了好几倍。就这效率,按照常理来说应该早就被淘汰了。
游戏数据啪啪打脸:强化学习十步封神
但真实世界的数据完全不给理论面子。谷歌DeepMind在2024年发布的论文显示,他们的模型经过强化学习微调后,在数学推理任务上的准确率从百分之二十飙升到百分之八十,总共只花了几百步。OpenAI的研究也表明,在某些编程任务中,强化学习甚至能在十步之内就看到显著提升。
十步是什么概念?预训练跑了十步可能连一句话都没读完,参数更新了个寂寞。强化学习这十步里,每个奖励信号虽然只有一个比特,但就像狙击枪的子弹,一发入魂。预训练那几百个比特的信息虽然多,但全打在无关紧要的地方,跟洒水一样。
这就有意思了。一个理论上极度低效的算法,在实际应用中反而表现得极其高效。这就好比你跟人说用筷子夹汤比用勺子快,谁信?但数据就是这么说的,只能重新审视之前的推理哪里出了岔子。
信号淹没困境:预训练学了一堆没用的东西
答案藏在目标的错位上。
预训练的目标是预测下一个词,这个目标本身跟实际想要的任务完成度之间,隔着一万八千里。一个模型可能完美预测了故事里的每个词,但对解决故事里的数学题毫无帮助。
在预训练过程中,关于任务成功的信号确实存在,但这些信号被海量的无关信息淹没了。就像在一片嘈杂的菜市场里,要找一个人说的一句关键话,周围全是叫卖声和讨价还价的噪音。
强化学习直接跳过这些噪音,只关心最终任务有没有做成,信号清晰得要命。
从信噪比的角度看,预训练虽然有巨大的信息量,但有效信号的比例极低;强化学习那一个比特,是全频段纯净信号。
这就解释了为什么迭代式自我监督微调打不过强化学习,自我监督微调继承了预训练的毛病,被无关词预测的噪音带偏了方向。
地貌突围论:模型在损失地貌上挖洞
可以把模型训练想象成在一片连绵起伏的山脉中寻找最低点。
预训练阶段,模型拿着模糊的地图,只能看到大山大谷的轮廓,信噪比限制了观察分辨率。跑了一段时间后,模型就卡在一个浅浅的山谷里转圈,因为噪音太大,看不清谷底还有没有更深的洞。
这时候突然切换到强化学习,信噪比暴增,分辨率一下子从卫星云图变成了显微视图。模型低头一看,脚底下全是密密麻麻的深坑裂缝,随便挑一个跳下去,性能就蹭蹭往上涨。这就是为什么强化学习能在几百步内取得巨大进展,本质上是在高分辨率下精确挖掘任务专属的深井。
预训练末期降低学习率之所以有效,也是类似原理。降低学习率相当于把步长缩小,变相提高了信噪比,让模型能察觉到之前忽视的精细结构。只不过这时候的目标还是预测下一个词,挖出来的井属于通用能力。强化学习的井口很小,但深度惊人,专门为一个任务服务。
预训练是地基而非天花板
所有这些都指向一个残酷的前提:强化学习必须站在巨人的肩膀上。如果模型本身连基本的语言理解和逻辑推理能力都没有,强化学习那一丁点信号完全不够用。好比给一个婴儿看一百遍微积分题目做对的奖励信号,他依然看不懂题目,奖励信号再纯净也是白搭。
这就是为什么现在的中期训练变得如此重要。在通用互联网文本上预训练完成后,模型懂英语懂常识,但缺乏复杂的工具使用和多步推理的行为模式。中期训练就是用大量相关任务的数据,把模型推到强化学习能发挥作用的门槛上。
门槛的意思很简单:模型得有一定概率能瞎猫碰上死耗子,蒙对几次任务。如果一千次推理没有一次成功,奖励信号全是零,强化学习直接原地等死。中期训练至少要让成功率达到百分之一或百分之二的水平,这样强化学习才能从偶尔的成功样本里提取出有效的梯度方向。
经典强化学习与LLM强化学习的物种隔离
传统强化学习的玩家听到这里估计要吐血了。当年在雅达利游戏机上训练一个打砖块或者太空入侵者的智能体,动辄需要上千万帧的游戏画面,相当于人类不吃不喝玩好几年。样本效率低到令人发指,跟现在LLM强化学习几百步出奇迹完全不是一个物种。
原因就在于起始点完全不同。雅达利强化学习是从零开始,它要同时学习视觉感知、游戏规则、操作策略,所有信息全靠那一个比特一个比特的奖励信号硬啃。而LLM强化学习是在一个已经看过人类几乎所有公开文本的模型上做微调,各种高级概念早就内化了,只需要最后的策略精调。
这个差异也解释了为什么参数规模在LLM上有效,在传统强化学习上效果不明显。传统强化学习的信息管道就那么细,加再多参数就像往一根吸管里灌长江水,灌不进去。而预训练的信息管道粗得没边,每个词都提供监督信号,模型越大能吸收的信息就越多。
探索危机:LLM取巧绕过了死循环
经典强化学习还有一个老大难问题叫探索困境。智能体在环境中行动,收集数据,再根据数据改进策略。如果早期策略太烂,收集到的全是垃圾数据,改进后的策略只会更烂,形成恶性循环。最后智能体卡在一个死胡同里出不来,所有奖励信号都一样糟糕,学习直接停摆。
LLM强化学习巧妙绕过了这个陷阱。预训练阶段模型已经看过全世界的书和网页,相当于脑子里装了一份世界地图。即使策略暂时走偏,底层的知识储备也能把行为拉回正轨,不会像雅达利智能体那样掉进坑里再也爬不出来。
更直白地说,LLM强化学习目前压根不需要真正意义上的探索。如果模型在某个任务上表现不够好,AI研究员的做法是去找更多相关数据塞进中期训练里,让模型先见足够多的正确样例,而不是让模型自己在环境里瞎试错。
这种方式相当于提前把答案喂到嘴边,强化学习只负责做最后的技能打磨。
GRPO把外面请来的“估值裁判”给开了
GRPO把外面请来的“估值裁判”给开了,让模型靠自己肚子里的那点“自我感觉”(概率置信度),配合最后那道题的“红笔对号”(最终奖励),来决定刚才那一大段废话里哪些词该赏、哪些词该罚。
第一层,什么叫“模型的内部感知”?
传统强化学习(比如PPO)得额外养一个巨大的“价值网络”当保姆,这个保姆每时每刻都在预测“这步走得咋样”。而GRPO把这保姆辞退了。它直接扒开模型自己的脑袋,看它在生成每一句话时,对每个词给出的对数概率(Logits)是多少。模型对自己越有把握的词,概率就越高;吞吞吐吐的地方,概率就低。这个内部的概率分布,就是它“内部的感知”。
第二层,什么叫“根据已验证的信号”?
“信号”不是模型自己YY出来的,是外界给的真凭实据。比如做数学题,最后算对了是1,算错了是0;写代码,跑通过是1,报错是0。这个信号是盖棺定论的客观事实,不带任何猜测,所以叫“已验证”。
第三层,把这两样东西串起来怎么“判断轨迹好坏”?
GRPO的骚操作来了:对于同一个问题,它让模型一口气输出8条或16条轨迹(一组的输出)。跑完后,用那个“已验证的信号”(1或0)给这一组轨迹挨个打分。然后,不跟别组比,只在这一组内部比。谁得分高,模型就调整自己的“内部感知”——下次遇到类似的词,把概率往上拱一拱;谁得分低,就把概率往下踩一踩。
用大白话总结:以前是请个专家全程盯着你步子迈得标不标准(价值网络),现在是只看你最后有没有撞线(奖励信号),而且撞线了还不算完,你得比你身边那七八个跑得慢的兄弟快才算你真牛逼(组内相对比较)。
偏置方差跷跷板:LLM站在悬崖边上
机器学习里有个经典困境叫偏置方差权衡。引入偏置相当于给模型加了一副有色眼镜,虽然可能看偏方向,但过滤掉了很多干扰信息,让学习更稳定。传统强化学习因为信息太少,极度依赖偏置来帮助收敛,不然那点信号根本不够用。
但LLM的情况完全反过来了。预训练已经用海量的无偏数据把模型参数打磨得极其精密,就像一块调校到微米级别的瑞士手表。这时候突然引入任何形式的偏置,哪怕是看起来很小的改动,都相当于往手表齿轮里扔了一把沙子,整个系统直接卡死。
这就解释了为什么LLM强化学习对数据陈旧程度和数值精度差异极度敏感。训练器用的模型参数和生成推理轨迹时用的模型参数哪怕有微小的差异,都会引入偏置,导致训练崩溃。传统强化学习那边完全不在乎这种事,因为他们的模型本身就没那么精密,这点偏置影响不大。
从长远看,整个AI竞赛的核心就是不断降低方差、提高信噪比。预训练用了巨大的计算量来压制噪声,强化学习则是用精确的目标定位进一步放大了有效信号。每一步都在向损失地貌的更深处挖掘,但越往下挖,能获得的边际收益越小,需要的精度和代价却越高。
这就是苦涩教训的本质,无偏算法终将碾压一切花哨的偏置技巧,只要计算量足够大,纯粹的信号就能穿透层层噪音,抵达任何试图靠耍小聪明都无法企及的深度。
沿着这条路走下去,要么看到通用人工智能的曙光,要么撞上收益归零的南墙,目前没有任何人知道答案。