大模型术语图鉴 Vol.01
给运营 · 产品 · 非技术伙伴的视觉手册
2026 · INTERNAL
手册 / Handbook 阅读时间约 18 分钟 · 图表优先

大模型训练图鉴 从一堆文本,到一个能聊天的 AI —— 它中间到底经历了什么?

受众
运营 / 产品 / 内容
覆盖术语
21 个核心概念
阅读方式
顺序读,或按图索骥
不需要懂
数学 · 代码 · 公式

你身边的同事最近经常说「这是预训练做的」「等 SFT 完了再测」「RLHF 之后语气更乖了」—— 听起来像黑话,其实背后是一条非常具体的生产流水线。这本图鉴把这条流水线拆开摆在桌面上,让你看见每一个零件、每一道工序, 并在合适的位置贴上术语标签。读完,你不会变成算法工程师,但你能听懂工程师的会议,并且知道哪些产品需求是「合理」的,哪些是「想多了」。

建议读法:先扫一遍第二章的训练流水线大图 ⟶ 再回头逐章看术语卡片 ⟶ 最后看第五章的常见困惑。
00

「大模型」到底是个什么东西

先把四个最基础的零件认全 —— LLM、Transformer、Token、参数
001
大语言模型Large Language Model · LLM
一个吃文本、吐文本的统计模型。你给它一段开头,它根据「见过的所有文字」预测下一个最可能出现的字。把这件事重复几万次,就是你和 ChatGPT、Claude、DeepSeek 聊天时看到的回答。
一个读过半个互联网、特别会接话的实习生。
002
Transformer 架构Transformer Architecture
2017 年 Google 发的一种神经网络结构,现在几乎所有大模型都是它的变种。核心是「注意力机制」——让模型在生成每一个字时,自动看一眼上下文里最相关的那些字。
写论文时,眼睛会自动扫向相关段落的那种能力。
003
Token / 词元Token
模型眼里的「字」。一个中文字大约是 1.5–2 个 token,一个英文单词约 1–2 个。计费、上下文长度、生成速度,全都按 token 算,不按字。
模型的「最小货币单位」,像电费里的「度」。
004
参数Parameters
模型内部可调的「旋钮」数量。7B = 70 亿个,405B = 4050 亿个。参数越多通常越聪明,也越贵越慢。但不是线性关系,架构和训练数据同样重要。
大脑的神经元连接数 —— 多 ≠ 一定聪明,但很难特别笨。
注:1B = 10 亿 参数量 ≠ 文件大小(受精度影响) "上下文窗口" 见第四章
01

一张图看懂:模型是怎么"养"出来的

从原始语料到你手上能用的产品,要走完 5 道工序
RAW DATA 原始语料 书籍 · 网页 · 代码 论文 · 对话 · 字幕 10–15 万亿 token ≈ 整个互联网的相当一部分 STAGE 01 预训练 Pre-training 教它「猜下一个字」 读完所有人类文本 数月 · 数千 GPU 成本:千万–亿美元 STAGE 02 SFT 监督微调 教它「会回答问题」 而不是接龙 数万–百万对话 STAGE 03 RLHF / DPO 人类偏好对齐 教它「说人话」「不胡说」 「不教坏小孩」 人类打分 / 偏好对 STAGE 04 评估 · 部署 Eval & Deploy 跑分 + 红队测试 才能上线供你调用 SOURCING PRE-TRAINING POST-TRAINING ▸ ALIGNMENT SHIP 「基础能力」 智商在这里被决定 「后训练 / Post-training」 性格、风格、安全、可用性,在这里塑造 读这张图的三个关键认知: ①「智商」由预训练决定 —— 上线后再怎么改 prompt,也提不动它的硬实力。 ②「性格 / 风格 / 安全」在后训练塑造 —— 这是大多数业务方真正能影响的环节。 ③ 整个过程一旦"出炉"就基本定型 —— 你和它聊的每一句话,并不会让它「记住」或「变聪明」。 FIG. 01 — 训练流水线全景图,按工序自左向右排列,时间跨度数月。
输入物料(蓝阴影)
核心阶段(红阴影)= 预训练
后训练阶段(米白)
部署阶段
02

每道工序到底在干什么

把刚才那张大图拆成四章,逐一打开来看
STAGE · 01

预训练 Pre-training"读"完半个互联网

把巨量未标注的文本(书、网页、代码、论文……)一股脑喂给模型,让它做一件事:盖住下一个词,让模型猜。猜错了就调整内部参数,猜对了就保留。重复几万亿次,模型就学到了语法、常识、世界知识、推理模式。

这一步决定了模型的「智商上限」。上线后再怎么调 prompt、加 RAG、做微调,都只能在这个智商之内施展。

耗时
2–6
算力
10⁴张 GPU 起
数据
10–15Ttoken
"基座模型 / Base Model" 就是预训练完、但还不会"听话"的版本 —— 它会接龙但不会回答问题。
FIG. 02 — Next-token Prediction
输入: "今天天气真" 模型对下一个 token 的概率分布: 62% 不错 26% 8% 4% 模型重复这件事 10¹³ 次,"经验" 就长成参数
STAGE · 02

SFT 监督微调Supervised Fine-tuning · 教它学会"回答问题"

预训练完的基座只会接龙:"今天天气真" → "好"。但你问它"帮我写封请假邮件",它可能续写成"——出来吃饭吧"。SFT 就是用大量"问题 → 标准答案"的高质量对话数据,告诉模型:「这种格式才是被期待的」。

用到的对话量大约几万到百万级,由专业标注团队(或更强模型 + 人工筛选)产出。质量比数量重要 100 倍 —— 一条垃圾数据可以毁掉一万条好数据。

耗时
数天~1 周
关键
质量≫ 数量
效果
"会聊天"
FIG. 03 — Base vs SFT 行为对比
用户输入: "帮我写一封请假邮件" ▾ 基座模型(未 SFT) "——给老板,对吧?我来" "教你三步:第一步……" → 在"接龙",不在"回答" ▾ SFT 之后 "好的,请告诉我请假天数、" "事由,以及收件人,我帮您" "按正式格式起草。" → 学会了"产品形态的回答"
STAGE · 03

RLHF / DPO 偏好对齐Reinforcement Learning from Human Feedback · 教它"说人话"

SFT 之后的模型「会回答」,但答得未必好——可能啰嗦、可能装腔、可能在敏感话题上瞎说。RLHF 让人类对模型的两个回答"打分 / 二选一",把"哪种更好"反复教给模型。模型学会的不是某个具体答案,而是「人类喜欢什么风格」。

DPO(Direct Preference Optimization)是 RLHF 的简化升级版,效果接近但工程上更省事,是 2024 年起的新主流。两者都属于「对齐 Alignment」工作 —— 让 AI 和"人类期望"对齐。

输入
偏好对chosen vs rejected
改变
风格· 安全 · 拒答
无法改
智商
FIG. 04 — Preference Pair
同一个问题,模型生成两个回答: 回答 A "我会尽力帮您解决" "这个问题。请问能" "先告诉我具体场景" "吗?" 人类标注员选 ✓ 理由:友好 / 主动澄清 回答 B "信息不足,无法" "回答。请重新提" "问。" 人类标注员 ✕ 理由:冷淡 / 推回去 "以后倾向于回答 A 这种风格"
STAGE · 04

评估 · 红队 · 上线Eval · Red-teaming · Release

模型练完不会自动上线。要先过两轮考试:跑分(Benchmark)—— MMLU、GSM8K、HumanEval 等几十项标准测试;红队(Red-teaming)—— 雇人专门"找茬",看能不能套话、绕过安全限制、诱导有害输出。

都通过了,才会被打包成你能调到的 claude-opus-4-7deepseek-v3。同一个基础模型,可能会被「蒸馏」成更小的版本(如 Haiku、Mini),用更低成本服务高并发场景。

MMLU = 学科综合 HumanEval = 写代码 GSM8K = 小学奥数 蒸馏 Distill = "大老师教小学生"
FIG. 05 — From Training to API
完整版 Opus / Pro 405B+ 蒸馏 Sonnet 中等规模 Haiku 同一家族的不同尺寸 —— 智商相近,速度 / 价格相差几十倍。 业务上的选型,本质是「在哪一档上"够用且划算"」。 SCALE 1 : N
03

模型上线之后:你每天打交道的概念

推理 · 上下文 · Prompt · RAG · 幻觉 —— 这些都是"运行时"的事
011
推理Inference
模型生成一次回答的过程。和"训练"是两件事 —— 训练是教学生,推理是考试。你每发一条消息,就是一次推理,按 token 计费。
老师在讲台上讲课(训练)vs. 学生在考场上答题(推理)。
012
上下文窗口Context Window
一次能"看见"的最大 token 数。8K = 约 6000 字,1M = 约 75 万字(一整本《红楼梦》)。超过这个窗口的内容,模型会"忘"。
短期记忆的大小 —— 不是越大越好,越大越贵越慢。
013
提示词Prompt
你输入给模型的全部内容 —— 包括"系统指令"+"对话历史"+"这次的提问"。Prompt Engineering 就是研究怎么把这堆东西组织得最有效。
给员工的"今日任务说明书"。
014
上下文学习In-context Learning
不用重新训练,直接在 prompt 里给几个示例(few-shot),模型就能现学现卖。是大模型最神奇也最实用的能力。
老员工带新人:"看我做一遍,照着干。"
015
幻觉Hallucination
一本正经地胡说八道。模型本质是"猜下一个最可能的词",所以遇到不知道的事实,它会"猜得很像真的"。无法被根除,只能被缓解(RAG / 引用 / 拒答训练)。
实习生不会说"我不知道",硬着头皮编。
016
RAG · 检索增强Retrieval-Augmented Generation
回答前先去你的资料库查一遍,把找到的内容塞进 prompt,再让模型基于这些内容回答。"开卷考试"模式,能大幅降低幻觉。
客服回答前先查工单系统,而不是凭印象答。
017
Embedding · 向量化Embedding
把一段文字翻译成一串数字(一个向量)。意思相近的文字,向量也相近。RAG 检索就是靠它实现"语义搜索",而不是关键词匹配。
给每段文字打一个"语义坐标",相似的坐标靠在一起。
018
微调Fine-tuning
在已有模型基础上,用自家的小批量数据继续训练,让它更懂自家业务。注意:能改风格、能学格式,但很难注入新知识(那是 RAG 的活)。
让一个通才员工,去你们部门轮岗一个月。
019
涌现能力Emergent Ability
模型规模跨过某个阈值后,突然出现的、之前完全没有的能力 —— 比如多步推理、写代码、跨语言迁移。规模质变。
"量变到质变" —— 蚂蚁堆够了出现蚁群智能。
020
Agent · 智能体Agent
让模型自己「规划 → 调工具 → 看结果 → 再规划」的循环。Claude Code、Cursor、Manus 都是 Agent。本质是 LLM + 工具调用 + 多轮自主决策。
从"回答问题的同事"升级成"会自己干活的同事"。
021
思维链 · 推理Chain-of-Thought · Reasoning
让模型"先想后答"——把推理过程一步步写出来再给结论。2025 年起的 o1 / DeepSeek-R1 / Claude Thinking 都是这个思路的产物,复杂任务正确率大幅提升。
学生考数学题:列草稿 vs. 直接写答案。
+ 022
多模态Multimodal
能同时处理文字 + 图片 + 音频 + 视频的模型。GPT-4o、Gemini、Claude Sonnet 4 都是。对运营 / 产品意味着:上传截图、语音、PDF 给 AI,已经是默认能力。
从"只能读邮件"到"还能看图听语音"。
04

最容易混淆的几对概念,一表理清

当工程师把这两个词当同一个用时 —— 你心里应该有数
易混对区别关键记忆口诀
预训练 vs. 微调 预训练 = 从 0 教所有;微调 = 在已有模型上继续教一点点。规模差几个数量级。 从 0 起 / 在墙上贴
SFT vs. RLHF SFT 给"标准答案";RLHF 给"两个答案哪个更好"。前者教内容,后者教偏好。 教内容 / 教口味
微调 vs. RAG 微调改"性格 / 格式";RAG 给"实时知识"。要让 AI 知道你昨天写的新文档 —— 用 RAG,不是微调。 改性格 / 给资料
训练 vs. 推理 训练造模型(一次性、贵);推理用模型(持续、按量)。你的 API 账单 95% 是推理费。 建工厂 / 跑流水
参数量 vs. 上下文长度 参数 = 模型"多聪明";上下文 = 单次能"看多少"。一个老学究 vs. 一张大书桌,是两回事。 脑容量 / 桌面
提示词 vs. 系统提示 系统提示 = "你是谁、规则是什么";用户提示 = "这次问什么"。系统提示对所有对话生效。 人设 / 这一句
幻觉 vs. 拒答 幻觉 = 不知道还瞎说;拒答 = 不知道说"我不知道"。后者是更好的 AI 行为。 硬编 / 认怂
基座模型 vs. Chat 模型 基座 = 只会接龙;Chat = SFT+RLHF 之后,会聊天。你在 API 看到的几乎都是 Chat 版本。 毛胚 / 精装
05

给运营 · 产品的高频困惑

读完这一章,你可以心安理得地"假装懂"了
"我们能不能训练一个自己的 GPT?"
取决于你说的"训练"是哪一步。从零预训练 ≈ 千万到亿美元,没人能玩;做微调(SFT/LoRA)≈ 几百到几万人民币,运营都能搞;做RAG(接知识库)≈ 不用训练,写代码就行 —— 这才是 95% 业务实际需要的方案。
"它会不会记住我和它说过的话?"
默认不会。一次对话结束,下一次它就忘了。你看到的"记忆"功能(如 ChatGPT Memory),是产品层在数据库里偷偷帮你存了,下次以 prompt 形式塞回去。模型本身不会"长大"。
"为什么有时它语气突然变奇怪?"
通常是上下文太长系统提示被你的对话稀释。模型注意力像沙漏,越往后看越糊。解法:开新会话,或在长对话里周期性把核心指令重述一次。
"为什么它有时把网址 / 数字编错?"
这就是幻觉。模型不知道"真实存在的网址",只知道"看起来像网址的字符串"。任何要"准确事实"的场景(链接、数字、引用),都应该接 RAG 或工具调用,让它去查,而不是凭印象生成。
"用更贵的模型,业务效果一定更好吗?"
不一定。多数场景上,便宜模型 + 好 prompt + RAG,效果优于贵模型 + 烂 prompt。先把工程做扎实,再考虑往上升级。每个项目都跑一次"小模型够不够用"测试。
"模型能给我'独家'答案吗?"
通过系统提示 + RAG(你的私有库) + 微调三件套,可以做到"看起来独家"。但模型本身的知识,是几千万个人共享的 —— 真正的差异化来自你喂给它的资料和你怎么编排它,不来自模型本身。
"为什么开源模型说'比 GPT-4 还强',用起来却差很远?"
跑分(benchmark)和真实使用是两件事。开源模型常常在测试集上过拟合,但工程上缺乏对应的 SFT / RLHF / 工具适配。"开源 ≥ 闭源" 在 2026 年的实战门槛上仍然不成立。
"什么时候该用 Agent,什么时候用普通对话?"
一句话:需要"自己决定多步操作"的用 Agent,单轮问答的用对话。Agent 慢、贵、不可控,能解决的问题维度更高(写代码、做研究、执行任务)。运营场景里 90% 用对话 + RAG 就够了。
06

一页速记 · 离开前请带走

把这页存图发到群里,比解释一百遍都管用
FIG. 06 — CHEATSHEET
训练阶段
预训练 · 决定智商
在所有人类文本上做"猜下一字"
SFT · 教会回答
问题 → 标准答案,对话格式塑型
RLHF · 塑造性格
人类打分,学"什么风格被偏爱"
运行时
推理 = 一次回答
按 token 计费的"使用阶段"
Prompt = 你说的话
含系统提示 + 历史 + 这次提问
RAG = 现查现答
把私库切片向量化,相似度检索
业务侧"该用什么"
要 AI 懂自家产品 →
RAG(最常用、最便宜)
要 AI 有专属风格 →
SFT / 微调(次常用)
要 AI 自己干活 →
Agent + 工具调用
三句话顶过一篇白皮书
① 大模型的"聪明"在预训练时定型 —— 上线后改不了。
② 大模型的"性格"在后训练(SFT + RLHF)时塑造 —— 业务可影响。
③ 业务用起来,Prompt + RAG + Agent 三件套覆盖 95% 场景,根本用不到"训练"。