大模型是怎么炼成的 —— 预训练 / SFT / RLHF 三部曲
普通课约 55 分钟
本课导读
上一课看懂了"训练"的内部机制,这一课看一场真实的大工程:一个像 ChatGPT 这样的助手,是分几步被炼出来的。学完本课,你能讲清预训练、SFT、RLHF 各自干什么,还能澄清一个几乎人人都有的误解——"我纠正它,它就学会了"。
观看要点
- ▸开场的「两个文件」比喻:一个参数文件 + 一个运行程序,就是一个大模型的全部
- ▸预训练 = 把互联网「有损压缩」进参数——对应本课三部曲的第一步
- ▸微调如何把「文档补全器」变成「助手」——正是 SFT 那一步的现场演示
- ▸讲座后半的能力/安全展望可略看,三部曲部分(前 40 分钟)是本课重点
看不了视频?文字讲义已覆盖全部内容,直接往下读即可。
说明
本课配套 Karpathy(前 OpenAI 创始成员)的经典科普讲座。文字讲义独立成课,视频适合学完后想再过一遍全貌时看(英文讲座,可开字幕)。
全景:三部曲
把大模型的炼成想象成培养一位客服顾问:
| 步骤 | 干什么 | 类比 | 成本 |
|---|---|---|---|
| ① 预训练 | 读遍海量文本,学"猜下一个词" | 把图书馆的书全读完 | 极高(数月、数千万美元级) |
| ② SFT 监督微调 | 看大量优质问答示范 | 入职培训 | 低得多 |
| ③ RLHF 人类反馈强化学习 | 按人类偏好打磨回答风格 | 试用期的绩效反馈 | 低得多 |
三步的产出分别是:博学但不听话的基座模型 → 会好好对话的助手模型 → 回答更合人意的上线版本。逐个拆开看。
第一步:预训练 —— 读遍互联网,玩一个游戏
预训练只做一件事:给模型看一段文字,让它猜下一个词,猜错了就按上一课的方法调整权重(损失衡量"猜得准不准",梯度下降负责调旋钮)。把这个游戏在几乎整个公开互联网的文本上重复几万亿次。
神奇之处在于:为了把这个游戏玩好,模型被迫学会了几乎一切。
- 要接得上"água 是葡萄牙语中的……",就得懂语言
- 要接得上"水的沸点是……",就得存知识
- 要接得上"因为下雨了,所以比赛……",就得会推理
预训练完成后得到的叫基座模型(base model)。它非常博学,但有个大问题:它只会接话茬,不会当助手。你问它"怎么煮溏心蛋?",它可能接"这是很多人好奇的问题。类似的问题还有:怎么煎牛排?怎么烤面包?"——因为在互联网文本里,一个问题后面跟着更多问题,太常见了。它在忠实地模仿见过的文本,没有"要回答你"的概念。
类比:一个把图书馆读穿了的人,知识渊博,但从没上过班,不知道"有人找你说话时该干嘛"。
第二步:SFT —— 教它"好好说话"
SFT(Supervised Fine-Tuning,监督微调)解决"不听话"的问题:人类写出几万条优质对话示范——"用户这样问,助手应该这样答"——让基座模型照着学(训练方法还是老一套:猜下一个词 + 调权重,只是教材从互联网换成了精选示范)。
这一步之后,模型"开窍"了:明白了自己的角色是回答问题的助手,而不是文本续写机。类比里的入职培训——知识没变多,但知道怎么上班了。
提示
ChatGPT 在 2022 年底突然引爆世界,很多人以为是模型突然变聪明了。其实基座模型的能力早就在那里——真正的引爆点是 SFT/RLHF 让这份能力变得"人人可用"。从"博学的怪人"到"好用的助手",靠的是后两步。
第三步:RLHF —— 用人类的偏好打磨
SFT 之后模型已经能好好对话了,但"好回答"的标准很微妙:两个都正确的回答,一个啰嗦一个清晰;一个危险问题,是照答还是婉拒。这些很难靠"写示范"教全。
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)的思路:让模型对同一个问题生成多个回答,人类标注员给这些回答排序(哪个更好),再用这些排序训练模型"往人类更喜欢的方向靠"。像试用期里主管不断给你反馈:"这样处理客户更好,那样容易惹麻烦。"
这一步塑造的是模型的"性格":有帮助、诚实、无害的倾向,礼貌的语气,对危险请求的拒绝——你和 AI 对话时感受到的"教养",大多来自这里。
最重要的澄清:训练 vs 推理
现在你知道了模型是训练出来的。而你日常使用它的时刻,叫推理(inference)——模型只是在用已经调好的权重做"猜下一个词",权重完全不变。
这戳破一个极常见的误解:
"我在对话里纠正了它,它说'明白了',所以它学会了,下次不会再错。"
错。它的"明白了"只在本次对话的上下文里有效(下一课讲上下文),对话结束就烟消云散。模型的权重在训练结束那一刻就冻结了——你用它时,它不在学习。真要让它"长记性",得等下一轮训练(或产品在模型外面做记忆功能——又是"模型 vs 产品"的区别)。
注意
这个澄清值得记牢,它能帮你避开很多无效操作:对模型发火、反复纠正、期待它"越用越懂你",在推理阶段都不改变模型本身。改变回答质量的正确杠杆是改变你的输入——这正是第 6 课「高手如何用 AI」要讲的。
随堂测验
1. 预训练阶段,模型唯一在做的事是什么?
2. 预训练后的“基座模型”有什么典型问题?
3. SFT(监督微调)这一步的作用,用类比说是?
4. RLHF 中,人类标注员主要在做什么?
5. 你在对话中纠正了模型的一个错误,它回复“明白了”。下面哪个说法正确?
延伸阅读(可选,跳过不影响主线)
- Andrej Karpathy《Deep Dive into LLMs like ChatGPT》(3.5 小时,英文)——上方讲座的 2025 加长版,覆盖更新的训练细节;等你学到阶段 3 再回来看会全懂。
本课小结
- 三部曲:预训练(读遍互联网学猜词 → 基座模型)→ SFT(示范教学 → 会当助手)→ RLHF(偏好排序 → 更合人意)
- ChatGPT 的引爆点不是能力突变,而是后两步让能力变得好用
- 训练调权重,推理用权重:你使用它时,它不在学习——对话里的"改正"出了对话就归零
划选正文任意文字可高亮、批注或加入复习卡
讨论
载入中…