给定算力预算 C = 6ND,Kaplan 说造大模型、早点停;Chinchilla 推翻它——模型和数据要等比例涨(D ≈ 20N)。从 IsoFLOP 的 U 形曲线,到用小实验预测大模型的 scaling recipe。
训练一个语言模型花多少算力,大致正比于 6 × 参数量 N × token 数 D。预算 C 是固定的(你的 GPU·小时有限),于是只剩一个问题:把这笔预算分给更大的模型,还是更多的数据?
两项工作画出两条不同的「最优」路线。把真实模型画到「参数量 N × 训练 token D」的对数图上,谁对一目了然——GPT-3 和 PaLM 都明显落在 Chinchilla 最优线的下方,意味着模型太大、数据没喂够,即「欠训练」。
为什么 Chinchilla 更可信?因为 Kaplan 偷了个懒——没有为每个模型大小单独调学习率。Chinchilla 把这一步补上,并用三种独立方法交叉验证,得到同一个结论。
| 改进点 | Kaplan (2020) | Chinchilla (2022) |
|---|---|---|
| 调学习率 | ❌ 每个规模共用 | ✅ 为每个计算预算单独调优 |
| 验证方法 | 单一幂律拟合 | 三种独立方法(见下节) |
| 核心结论 | 大模型优先、提前停止,N 增长远快于 D | 模型与数据等比例扩展,D ≈ 20N |
| 现实含义 | —— | GPT-3、PaLM 都「训亏了」(欠训练) |
Chinchilla 最有说服力的一张图:固定一个算力预算 C(即 6ND = 常数),画出 loss 随模型大小 N 的变化——它是一条 U 形曲线。两端都差,只有底部最优。
横轴模型参数量 N,纵轴最终 loss(越低越好)。每条曲线是一个固定的算力预算 C。曲线最低点 = 该预算下最优的模型大小。预算越大,最优 N 越大、能达到的最低 loss 越低——但无论哪条曲线,把模型做得太大都会撞上右端的欠训练墙。
为避免单一方法的偏差,Chinchilla 用三种独立方法估计最优比例,三者得到同一个答案——这是结论可信的关键。
Scaling laws 最大的实用价值不是「该训多大」,而是可预测性——在小规模上花很少的钱做实验,就能可靠预测大规模训练的 loss。Lec1 原话:「Predictability is at least as important as optimality!」
Sutton 的「苦涩的教训」常被误读成「scale 就是一切、算法不重要」。CS336 的正确读法是:能 scale 的算法才是重要的。落到一个贯穿全课的公式——
accuracy = efficiency × resources
规模越大,效率越重要(浪费的绝对成本更高)。Scaling laws 正是「认真对待 scaling」的思维工具:它让你在花大钱之前,就能预测这笔钱花得值不值。
Chinchilla 的最优比例 没有考虑推理成本。如果你要部署一个会被调用几十亿次的模型,你可能更想要一个更小、训得更透的模型——那样每次推理更便宜,即使训练时多花点数据算力也划算。现实里的「最优」取决于训练 + 推理的总账。
来源:CS336 Lecture 1: Language Modeling From Scratch — Percy Liang & Tatsunori Hashimoto, Stanford, 2026(Scaling Laws / Assignment 3 单元)
参考文献:Kaplan et al. 2020《Scaling Laws for Neural Language Models》;Hoffmann et al. 2022《Training Compute-Optimal LLMs》(Chinchilla)