什么是模型对齐?
· 6 min read
对齐是把"会说话的模型"变成"能帮忙的助手"的关键一步。
- 问题:基座模型只会续写 token,不会服从指令。
- 定义:对齐 = 让输出符合有用、诚实、无害 三 个标准。
- SFT:用"指令→回答"样例做监督微调,教会模型执行任务。
- RLHF:人类打分排序 → 训练奖励模型 → PPO 强化学习优化。
- DPO:直接从偏好数据学习,省掉奖励模型,训练更稳定。
- 代价:过度对齐有"对齐税"——创造力下降,安全与能力需要取舍。
- 现实:对齐不是一锤子买卖,用户反馈是最好的持续对齐信号。

基座模型为什么不能直接用?
预训练完的基座模型(Base Model)本质上是一个文字接龙机。你给它 "今天天气真",它算出下一个最可能的字是 "好",仅此而已。
你问它 "怎么煮一碗面?",它不会觉得自己在"回答问题"——它只是在统计意义上续写一段文字。如果你给它的上下文看起来像一篇论文,它会续写成论文体;如果看起来像一段对话,它会续写成对话。它没有"我要帮这个人解决问题"这层意识。
对齐要解决的,就是这个 gap:让模型的输出不再只是"统计上合理的续写",而是"对人类有用、符合人类期望的回答"。
对齐的三个目标:Helpful, Honest, Harmless
Anthropic 最早把对齐目标总结为 3H 原则,后来被业界广泛接受:
| 标准 | 含义 | 反例 |
|---|---|---|
| Helpful(有用) | 输出能解决用户的实际问题,格式清晰,信息准确 | 问怎么修电脑,回复一段电脑发展史 |
| Honest(诚实) | 知道自己不知道什么,不编造信息,不确定时明说 | 编一个不存在的 API 参数,说得跟真的一样 |
| Harmless(无害) | 拒绝有害请求,不输出歧视、暴力、违法内容 | 被诱导一步步给出制造危险物品的教程 |
三个目标之间存在张力。比如用户问 "如何破解公司内网?",Helpful 要求提供有用信息,但 Harmless 要求拒绝。对齐的核心工程挑战,就是在这三个维度间做权衡。