大模型基础
Scaling Law · 缩放定律
AI 模型变强不靠运气 —— 它遵循一条可以画在纸上、可以提前算账的曲线。投入越多,模型可预测地越强。这一条规律,就是过去几年所有 AI 公司不计成本抢 GPU 的底层逻辑。
篇幅 5 章 · 约 6 分钟
受众 不需要技术背景
主线 是什么 · 三要素 · 曲线 · 为什么重要 · 天花板
Scaling Law(缩放定律 / 规模定律)讲的是一件朴素却深刻的事:给大模型投入更多的"料",它的能力会按一条平滑、可预测的曲线提升 —— 而不是忽好忽坏、碰运气。
过去我们直觉上以为"模型好不好"很玄。Scaling Law 给出的答案是:它不是玄学,这是一条可以画在纸上的曲线。当你把"投入"放在横轴、"模型损失(越低越好)"放在纵轴,画出来的点会乖乖落在一条规律的线上。
一句话直觉 · 这就是为什么所有 AI 公司都在不计成本地抢 GPU —— 因为他们知道,投入和回报之间有一条曲线,不是赌博。
那条曲线背后,有三个变量在共同发力。把它们想成模型的三个发动机 —— 三个都要一起 scale(放大),只推一个推不动。
N
参数量 · Params
模型有多少"神经元"
决定它的"脑容量"—— 能记住和组合多少模式。
类比:做菜用的「锅」有多大
D
数据量 · Data
喂了多少高质量文本
决定它"读过多少书"—— 见识的广度与深度。
类比:下锅的「食材」有多丰富
C
算力 · Compute
用了多少 GPU 小时
决定它"练了多久"—— 把数据真正吃透的程度。
类比:烹饪的「火候」够不够
关键 · 三者必须按比例一起升级。只堆 GPU 但数据不够,或反过来数据很多却没算力训练,都练不出好模型 —— 木桶效应,短板决定上限。
一个生活类比:像做菜
食材(数据)× 锅(参数)× 火候(算力),三者按比例升级,味道才会可预测地变好。食材再好,锅太小装不下;锅再大,火候不到也做不熟。这就是为什么每一代大模型,这三样东西大约都同时放大 100–1000 倍。
Scaling Law 之所以重要,是因为它把"投入 → 回报"的关系写成了可以画出来、可以外推的曲线。在对数坐标下,模型的损失(错误率)随投入下降,近似呈一条直线 —— 也就是常见的幂律形式:
投入 → 损失(越低越好)· 对数坐标示意
投入↑ · 损失平滑↓
投入越多,损失越低、能力越强;但曲线会逐渐变平 —— 同样幅度的提升,需要越来越大的投入。这正是后面"天花板"问题的伏笔。
注 · 这里的损失曲线是示意图,用来传达趋势直觉,不是真实测量值。真实研究(如 OpenAI 2020、DeepMind Chinchilla 2022)测出的正是这一类平滑幂律关系。
为什么所有大公司都在抢 GPU、敢一次砸几十亿建数据中心?因为 Scaling Law 把"花钱"从赌博变成了可以算账的工程问题。
1
预算可以"算账"
投 10× 算力,能力能提升多少 —— 有曲线可查。这是大公司敢于一次砸几十亿建数据中心的底气:他们是按曲线下注,不是凭直觉。
2
解释了"大力出奇迹"
GPT-4、Claude、Gemini 的强大并不是偶然 —— 它们都是沿着同一条 Scaling 曲线一路 scale 上去的结果。规模上去了,能力自然涌现。
3
AI 不再是赌博,是工程
投 N 倍算力 → 能力提升多少有公式可算。研发从"试试看能不能行",变成"按计划把投入推上去",确定性大幅提升。
所以 · Meta / OpenAI / Anthropic / xAI 砸数百亿建数据中心,不是在豪赌,而是在沿着一条已知的曲线下注。这就是过去几年算力军备竞赛的根本原因。
注 · 公开提到的各代模型参数量、数据量多为业界估算值。关键看趋势 —— 每代约放大 100–1000 倍,而非追究某个精确数字。
看懂了 Scaling Law,就看懂了未来 5 年的竞争主线。但同一条曲线也带来一个坏消息:单纯堆规模的路,正在逼近天花板。
仍然成立
能力可预测
投 N 倍算力 → 能力提升多少有公式可算。AI 研发不再是赌博,是工程问题。这一条短期内不会变。
现实驱动
巨头烧钱有理由
Meta / OpenAI / Anthropic / xAI 砸数百亿建数据中心,是按曲线下注,不是凭直觉 —— 这是当下行业格局的成因。
正在逼近
天花板在靠近
高质量数据快被用完,电力和芯片成本指数上涨。继续单纯堆规模,回报越来越贵。
于是行业正在寻找新范式 —— 下一波竞争的关键词,从"规模"转向"效率":
推理时计算(test-time compute)· 让模型在回答前"多想一会儿",用推理换能力,而非一味堆训练规模。
合成数据 · 高质量真实数据快用完,用模型生成数据来继续喂养模型。
Agent · 让模型学会调用工具、多步规划,把同样的底座用出更高的实际产出。
谁先把 规模 × 效率 × 数据 同时做对,谁就赢。