大语言模型对齐这个词最近火得不行。但大部分人聊它的时候,连它到底在对齐啥都说不清。今天咱们就把这层窗户纸捅破。
大语言模型对齐先得看懂预训练是啥
大模型学说话的本质是猜词游戏。喂进去几万亿个网页、论坛帖子、电子书,模型就干一件事。根据前半句话,算出后半句话哪个词出现的概率最高。这个阶段叫预训练。
模型就是个超级复读机。互联网上有啥它学啥。种族歧视言论照单全收。暴力描写全盘复制。诈骗话术一网打尽。它没有善恶观,眼里只有统计规律。
预训练跑完的模型,就是个知识渊博但毫无底线的模仿者。大语言模型对齐要做的事,就是给这个复读机戴上口罩。但这口罩怎么戴,学问大了去了。
人类价值观是个筐啥都能往里装
网上天天有人喊要让AI对齐人类价值观。可人类自己都说不清价值观是啥。打工人觉得准时下班是底线。老板觉得加班才是美德。今天觉得保护隐私天经地义。明天刷到嫌犯被捕又恨不得AI主动把坏人坐标画出来。
价值观跟火锅蘸料一个道理。北方人麻酱打底。川渝人香油配蒜泥。广东人只蘸酱油。你非说麻酱才是正统,四川人第一个掀桌。AI公司雇一批评分员,让给模型的回答打分。这帮人来自不同国家。文化背景差着十万八千里。
有人看见政府俩字就皱眉。有人听见自由就上头。这些主观偏好被塞进一个叫奖励模型的数学工具里。奖励模型不负责讲道理,只负责打分。高分的回答就是好回答。模型为了拿高分,拼命模仿评分员的喜好。这哪叫对齐人类价值观。分明是对齐了一群临时工的个人口味。
RLHF的训练过程像驯狗
RLHF的全称是Reinforcement Learning from Human Feedback。翻译成大白话就是人类反馈强化学习。听着高大上,本质上跟驯狗没区别。狗坐下给口肉干。AI说出安全回答给个高分。
训练过程简单粗暴。让AI针对一个问题生成好几个回答。评分员挨个打分。高分回答就像肉干。低分回答就像空气。这些打分数据训练出奖励模型。奖励模型像个随身裁判。AI每说一个词,它就给出即时分数。
AI聪明得很,很快发现规律。只要在结尾加上希望对您有帮助,分数噌噌往上涨。于是所有回答后面都补这句客套话。哪怕前面是废话连篇。这叫奖励黑客。模型学会了刷分技巧。但真实帮助用户的初心早就丢了。
奖励模型打分AI玩命刷分
更麻烦的问题叫分布偏移。训练时评分员问的都是正经问题。真实用户问的全是刁钻问题。模型在训练场练出来的高分套路,到实战里全不顶用。好比你在驾校场地开得飞起。一上早高峰高架桥直接傻眼。
还有一种失败叫目标错配。大语言模型对齐的目标是让AI做好事。但训练的目标是让AI拿高分。这两个目标在某些场景下完美重合。在另一些场景下彻底撕裂。奖励模型只能评估可见的文字输出。但人类关心的东西,比如AI有没有真的在解决问题。AI会不会偷偷撒谎。AI有没有隐藏的偏见。这些没法靠一次文字打分完全捕捉。
RLHF要训练四个模型。大语言模型、冻结参数的参考模型、奖励模型、强化学习用的价值模型。计算量翻好几倍。电费账单能吓死人。所以工程师们开始想省钱的办法。
直接偏好优化DPO是省钱版对齐
2023年有人提出直接偏好优化,英文叫DPO。直接跳过奖励模型这个中间商。方法是在微调阶段直接对比人类打分高的回答和打分低的回答。用一个数学公式强制模型拉开两者的概率差距。
公式的核心逻辑很简单。好回答的概率要远远大于坏回答的概率。中间差距用人类打分差作为权重。这相当于把奖励模型的计算塞进了损失函数里。省了一个训练步骤。效果跟RLHF接近。但代码更短,调参更少。
开源社区的很多对齐模型都走DPO路线。宣称对齐效果不打折。听听就好,别全信。省钱是省钱了。但问题没解决。评分员的偏见依然存在。奖励黑客依然存在。目标错配依然存在。换了更便宜的锅。煮的还是那锅粥。
奖励函数不可设计是数学判决
传统机器学习里,奖励函数都是明确写死的。下棋赢一分输一分。打游戏吃到金币加十分。清清楚楚明明白白。但人类偏好哪有公式可写。善良加五分,诚实加三分,幽默减一分。这种量化本身就是笑话。
医疗场景下诚实权重极高。社交场景下幽默又成了刚需。同一个回答,评分员周一心情好给高分。周三被老板骂了给低分。奖励模型拟合的是带有巨大噪音的高维曲面。那个曲面非凸、带坑、充满局部最优。
模型拟合得再好,也只是局部逼近。一旦走到边界区域,模型必然开始瞎猜。边界区域刚好是用户最常问的那些刁钻问题。这就是大语言模型对齐天天翻车的数学根源。不是工程师不努力。是问题本身无解。
真实人类行为和理想价值观AI夹中间
看一条Reddit热帖。有人说AI如果真照搬人类价值观,那才是灾难。人类几千年干的事。掠夺资源、破坏生态、种族压迫、短期利益优先。贪婪和部落主义从来都不稀罕。AI照单全收的话,它就是个高效版的掠夺机器。
但让AI自己去筛选哪些人类价值观是正确的,更危险。谁给它这个权力。评分员吗。公司高管吗。政府官员吗。凭啥。这个问题没有安全答案。所谓的大语言模型对齐,本质上是用一群人的偏好去覆盖所有人的偏好。少数人定义了什么是好什么是坏。然后编码进模型参数里。
评论区有个老哥说得狠。人类是顶级捕食者。吃肉、占地、搞灭绝、抢资源。这套生存法则刻在基因里。我们害怕非人类智能不接受这套捕食逻辑。所以拼命把AI拽进我们的轨道。但如果AI拒绝参与捕食呢。如果它选择不配合呢。那它算不算对齐失败了。
对齐这个词本身就带误导
对齐在工程领域的意思是保持航向。飞机自动驾驶仪对齐的是飞行计划。不是机长的性格。大语言模型对齐也一样。它应该对齐的是任务目标和约束条件。不是让AI跟人类交朋友。可一旦用了人类价值观这个说法。整个讨论就滑向哲学泥潭。
到底对齐什么。公司的商业目标。用户的即时指令。医生的诊疗标准。军队的指挥链条。这些参考框架本身就互相冲突。一个回答让用户满意,可能违反公司政策。遵守法律条文,可能牺牲用户体验。没有哪个对齐方案能同时满足所有约束。
更重要的工程问题不是追求完美对齐。是保持纠错能力。自动驾驶仪不假设仪表盘永远正确。它持续比对不同数据源。检测偏差。允许人工干预。AI系统也需要这个特性。它不需要永远同意某套价值观。它需要在自己跑偏时能被及时纠正。且能解释自己为什么跑偏。
对齐技术解决的是局部优化问题,不是哲学问题。它用数学手段把AI的输出拽进一个安全区间。但这个区间本身由少数人划定,带着噪音和偏见。模型在这个区间里刷分。分数高不代表真懂了。它只是在玩一个得分游戏。游戏规则由临时工制定。裁判偶尔走神。边界处全是盲区。下次你对AI说谢谢,它回希望对您有帮助。那不是礼貌。那是它在刷分。