你身边的同事最近经常说「这是预训练做的」「等 SFT 完了再测」「RLHF 之后语气更乖了」—— 听起来像黑话,其实背后是一条非常具体的生产流水线。这本图鉴把这条流水线拆开摆在桌面上,让你看见每一个零件、每一道工序, 并在合适的位置贴上术语标签。读完,你不会变成算法工程师,但你能听懂工程师的会议,并且知道哪些产品需求是「合理」的,哪些是「想多了」。
把巨量未标注的文本(书、网页、代码、论文……)一股脑喂给模型,让它做一件事:盖住下一个词,让模型猜。猜错了就调整内部参数,猜对了就保留。重复几万亿次,模型就学到了语法、常识、世界知识、推理模式。
这一步决定了模型的「智商上限」。上线后再怎么调 prompt、加 RAG、做微调,都只能在这个智商之内施展。
预训练完的基座只会接龙:"今天天气真" → "好"。但你问它"帮我写封请假邮件",它可能续写成"——出来吃饭吧"。SFT 就是用大量"问题 → 标准答案"的高质量对话数据,告诉模型:「这种格式才是被期待的」。
用到的对话量大约几万到百万级,由专业标注团队(或更强模型 + 人工筛选)产出。质量比数量重要 100 倍 —— 一条垃圾数据可以毁掉一万条好数据。
SFT 之后的模型「会回答」,但答得未必好——可能啰嗦、可能装腔、可能在敏感话题上瞎说。RLHF 让人类对模型的两个回答"打分 / 二选一",把"哪种更好"反复教给模型。模型学会的不是某个具体答案,而是「人类喜欢什么风格」。
DPO(Direct Preference Optimization)是 RLHF 的简化升级版,效果接近但工程上更省事,是 2024 年起的新主流。两者都属于「对齐 Alignment」工作 —— 让 AI 和"人类期望"对齐。
模型练完不会自动上线。要先过两轮考试:跑分(Benchmark)—— MMLU、GSM8K、HumanEval 等几十项标准测试;红队(Red-teaming)—— 雇人专门"找茬",看能不能套话、绕过安全限制、诱导有害输出。
都通过了,才会被打包成你能调到的 claude-opus-4-7 或 deepseek-v3。同一个基础模型,可能会被「蒸馏」成更小的版本(如 Haiku、Mini),用更低成本服务高并发场景。
| 易混对 | 区别关键 | 记忆口诀 |
|---|---|---|
| 预训练 vs. 微调 | 预训练 = 从 0 教所有;微调 = 在已有模型上继续教一点点。规模差几个数量级。 | 从 0 起 / 在墙上贴 |
| SFT vs. RLHF | SFT 给"标准答案";RLHF 给"两个答案哪个更好"。前者教内容,后者教偏好。 | 教内容 / 教口味 |
| 微调 vs. RAG | 微调改"性格 / 格式";RAG 给"实时知识"。要让 AI 知道你昨天写的新文档 —— 用 RAG,不是微调。 | 改性格 / 给资料 |
| 训练 vs. 推理 | 训练造模型(一次性、贵);推理用模型(持续、按量)。你的 API 账单 95% 是推理费。 | 建工厂 / 跑流水 |
| 参数量 vs. 上下文长度 | 参数 = 模型"多聪明";上下文 = 单次能"看多少"。一个老学究 vs. 一张大书桌,是两回事。 | 脑容量 / 桌面 |
| 提示词 vs. 系统提示 | 系统提示 = "你是谁、规则是什么";用户提示 = "这次问什么"。系统提示对所有对话生效。 | 人设 / 这一句 |
| 幻觉 vs. 拒答 | 幻觉 = 不知道还瞎说;拒答 = 不知道说"我不知道"。后者是更好的 AI 行为。 | 硬编 / 认怂 |
| 基座模型 vs. Chat 模型 | 基座 = 只会接龙;Chat = SFT+RLHF 之后,会聊天。你在 API 看到的几乎都是 Chat 版本。 | 毛胚 / 精装 |