Stanford CS336 开篇讲座的可视化讲解——把讲义里最难用文字讲清的概念,一张一张画成图。
这门课的口号是 understanding via building(通过构建来理解)。但有些概念,文字再怎么排版也是一堵墙——Scaling Laws 的幂律曲线长什么样、四种 tokenizer 为什么只有 BPE 没有明显短板,画出来才一目了然。这个系列就把 Lecture 1 里最值得「画」的概念,各做成一页手绘 SVG 图解。
Kaplan 说「造大模型、早点停」,Chinchilla 推翻它:「模型和数据要等比例涨」(D ≈ 20N)。从 C=6ND 的预算分配,到 IsoFLOP 的 U 形曲线,再到用小实验预测大模型的 scaling recipe——为什么 GPT-3 和 PaLM 其实都训「亏」了。
→字符级(词表太大)、字节级(压缩比最差)、词级(UNK 问题)——三种极端各有死穴。BPE 从字节出发,迭代合并最高频 pair,在「词表大小 × 压缩比」的二维平面上正好落在没有短板的那个点。同一句 "café matcha 🐱" 四种切法的对比 + 逐步合并算法。
→讲解页为独立公开产物,头部链向原始讲义 URL 可追溯原文。
每页自包含(内联 CSS + 手绘 SVG),可单独保存分享。