FRONTIER · 路线之争
审慎地谈缩放定律
Scaling Laws, Carefully
Lilian Weng
前 OpenAI 安全研究副总裁 · 深度学习领域最受信任的技术博客作者之一
为什么选它「模型越大越好」人人会说,但「大多少、配多少数据才划算」多数人答不上来。这篇把 Kaplan 与 Chinchilla 两个结论为何不同拆得最清楚,还给了三条独立推导路径——解释了为什么今天小模型能追平几年前的巨无霸。
「模型越大越好」这句话人人会说,但真正问一句「大多少、配多少数据才最划算」,多数人就答不上来了。这篇长文把这件事从头讲透,而且讲的是一段被普遍误解的历史。
2020 年 OpenAI 的 Kaplan 团队最早给出缩放定律:损失随模型规模、数据量、算力呈幂律下降,在双对数坐标上是一条直线。这个发现直接催生了「把模型堆大」的军备竞赛。但 2022 年 DeepMind 的 Chinchilla 论文得出了不同结论:当时的大模型全都训练不足——参数堆得太多,数据喂得太少。按 Chinchilla 的配比,参数和训练数据应当大致同步增长,一个 700 亿参数、喂足数据的模型,能打赢 2800 亿参数但数据不够的模型。
Weng 这篇的价值在于,她不只复述两个结论,而是把两边为什么会得出不同答案拆开——实验设计的差异、学习率调度的处理、拟合方法的选择,并给出三种独立的推导路径和一个玩具模拟,让你看到幂律是怎么冒出来的。
对普通人的意义。这解释了为什么开源社区能用几十亿参数的小模型追平几年前的巨无霸——不是模型架构突然变神了,而是训练配比对了。也解释了为什么现在竞争的焦点从「参数量」转向了「数据质量」和「推理时算力」。任何时候有人拿参数量当卖点,你可以想起这篇。
去读原文
本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。
原文Lil'Log · Scaling Laws, Carefully →
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。