大模型成功背后的 RLHF 到底是什么?
· 7 min read
RLHF 是大模型从"能用"到"好用"的关键一步。它不解决"模型知不知道答案",而是解决"答案像不像人话"。
- 三阶段工作流:SFT 教指令遵循 → 奖励模型学打分 → PPO 用打分信号优化策略。
- 奖励模型的核心任务:给任意 prompt+response 打出标量分数,替代人类实时标注。
- PPO 的奖励不是纯 RM 分,而是 RM 分减 KL 惩罚——防止模型为刷高分胡说八道。
- PPO 对超参极度敏感,RM 不准确会导致优化跑偏,这是 RLHF 最大的工程难点。
- DPO(NeurIPS 2023)直接砍掉奖励模型和 RL,把偏好对齐变成分类问题。
- DPO 更稳定更省资源,已成 RLHF 主流替代方案。
RLHF 不是锦上添花,是必需
很多人以为大模型训练就是"抓一堆网页,让它学会下一个词预测"。这个理解没错——但只对了一半。
GPT-3 在 2020 年就展示了一个诡异的现象:你问它"2+2=?",它知道答案是 4。但你问"帮我写封辞职信",它可能回复"你想辞职的公司叫什么名字?为什么要辞职?"——它在反问,不是在执行。
基座模型的本质是"什么都见过",但它不知道什么叫"帮人办事"。
基座模型的目标函数是下一个 token 预测。这个目标决定了它的行为模式:续写、反问、展开——但不会总结、不会拒绝、不会承认不知道。你让它写一篇关于"强化学习"的文章,它给你列了 10 个问题让你回答——因为它见的文本里经常是问答结构,它觉得"接下来该你说了"。
RLHF 要解决的问题就是这个:把"下一个 token 预测"的能力,转化成"按人类意图办事"的能力。
你没听错——RLHF 不是让模型变聪明,是让它变听话。