CS336 · Lecture 1

Language Modeling
From Scratch. 图解

Stanford CS336 开篇讲座的可视化讲解——把讲义里最难用文字讲清的概念,一张一张画成图。

这门课的口号是 understanding via building(通过构建来理解)。但有些概念,文字再怎么排版也是一堵墙——Scaling Laws 的幂律曲线长什么样、四种 tokenizer 为什么只有 BPE 没有明显短板,画出来才一目了然。这个系列就把 Lecture 1 里最值得「画」的概念,各做成一页手绘 SVG 图解。

讲者:Percy Liang & Tatsunori Hashimoto Stanford · Spring 2026(第三次 offering) 原始讲义 ↗
已完成的图解
  1. 01
    Scaling Laws:算力该花在「更大的模型」还是「更多的数据」?

    Kaplan 说「造大模型、早点停」,Chinchilla 推翻它:「模型和数据要等比例涨」(D ≈ 20N)。从 C=6ND 的预算分配,到 IsoFLOP 的 U 形曲线,再到用小实验预测大模型的 scaling recipe——为什么 GPT-3 和 PaLM 其实都训「亏」了。

    scaling-lawschinchillacompute-optimal幂律
  2. 02
    BPE Tokenizer:为什么四种方案只有它没有明显短板

    字符级(词表太大)、字节级(压缩比最差)、词级(UNK 问题)——三种极端各有死穴。BPE 从字节出发,迭代合并最高频 pair,在「词表大小 × 压缩比」的二维平面上正好落在没有短板的那个点。同一句 "café matcha 🐱" 四种切法的对比 + 逐步合并算法。

    tokenizationbpe子词压缩比

讲解页为独立公开产物,头部链向原始讲义 URL 可追溯原文。

每页自包含(内联 CSS + 手绘 SVG),可单独保存分享。