Skip to content

Q140 · 大模型的 Scaling Law 会持续有效吗? ​

假设一个团队已经训练了几档文本大模型,发现训练计算量越大,留出的测试文本上的预测损失越低。负责人问:“下一档投入十倍算力,产品中的复杂问答准确率也一定继续涨吗?”这里至少有两次跳跃:从已做过的训练实验推到更大规模的训练,再从预测下一个词的损失推到真实问答是否完成。Scaling Law 对第一步有参考价值,但不能替第二步作保证。

Scaling Law,通常译为“规模定律”,在大模型语境中主要指从一系列实验拟合出的经验关系:在研究指定的模型、数据和训练方法下,参数量、数据量或训练计算量增加时,某项损失怎样变化。它是量化规划工具,不是“算力增加,能力必然无限增长”的自然定律。Kaplan 等人的原始研究

术语与符号 ​

后文沿用“团队准备训练下一档客服问答基础模型”的假设场景。表里的符号只用于说明关系,不是某篇论文的拟合参数。

术语或符号在本文中的意思在这个场景里怎样观察
参数量 N模型训练时会调整的数字总数,常用来粗略描述模型大小比较几档同类模型的参数数目
训练数据量 D训练时送入模型的 token 数;token 是模型处理文本的计数单位,不一定等于一个汉字或一个词记录实际读入多少 token,并区分独特内容与重复遍历
训练计算量 C完成训练花费的计算工作,研究中常用 FLOPs(浮点运算次数)估算统计各档训练所用运算量,而不是只数显卡或训练天数
验证集 / 验证损失 L不用于更新参数、只用来检查模型的文本及其平均预测误差;这里的损失通常指交叉熵,越低表示对正确下一个 token 分配的概率总体越高用同一来源、隔离好的留出文本比较各档模型
幂律一个量按另一个量的固定指数变化的一类数学关系;画在某些对数坐标上常近似直线用多档实验点拟合“计算量增加、损失下降”的趋势
拟合 / 外推拟合是用已测数据求一条近似曲线;外推是把曲线延伸到没做过实验的范围从小模型测量去估计更大模型时,属于外推
compute-optimal在给定训练计算预算和指定目标下,寻找参数量与训练 token 数的较优组合同样预算下比较“更大但少训练”和“较小但多训练”
推理时计算量模型部署后回答一个问题所用的计算;与一次性的训练计算量不同让模型在一道难题上花更多推理步骤,通常会增加延迟和费用
评测饱和题目太容易或分数已接近上限,难再区分模型所有候选模型在同一张简单测试卷都接近满分

原始研究究竟发现了什么 ​

Kaplan 等人研究的是语言模型的交叉熵损失,在他们考察的范围内,损失与模型大小、训练数据大小和训练计算量呈幂律关系。由此可以估计:在固定计算预算下,应把预算分给多少参数、多少数据、训练多久。这里“在他们考察的范围内”和“交叉熵损失”都很重要;论文并没有证明所有架构、所有数据与所有真实任务都按同一条曲线增长。Kaplan 等,2020

后来 Hoffmann 等人的 Chinchilla 研究用另一批系统实验重新考察固定训练计算量时的最优分配。其研究范围内,计算预算增加时,较优模型参数量与训练 token 数应大致按相近比例增加;同样训练计算预算下,他们训练的 Chinchilla 参数更少、读入数据更多,并在多项评测上优于 Gopher。它修正了先前“优先把模型做得更大、训练数据相对少”的具体预算建议。这正说明拟合规律依赖实验设置,后续证据能够改变最优分配结论。Hoffmann 等,2022

不要把“参数越大越好”当作 Chinchilla 的结论。假设团队只有固定训练预算,把参数从一档直接翻倍,意味着每个参数可能见到更少训练数据;另一种方案是保留较小模型,让它读更多高质量文本。应比较同等训练预算下的验证损失,再根据部署成本和业务准确率选方案。Chinchilla 的 compute-optimal 指向它设定的训练目标,若模型要服务海量请求,推理成本也进入总账,最划算的配置可能改变。考虑推理需求的后续研究

概念示意图:已测训练计算量内,验证损失下降;超出范围的走势仍需实验验证

图中的曲线只是概念示意,非论文实验数据,也没有数值刻度。蓝色实线代表在某组条件下已测得的趋势;橙色虚线是待验证的外推,不表示未来真的会按这个斜率下降。

用一组假设数字看“下降”意味着什么 ​

为了让幂律直觉可算,完全假设团队拟合出了 L(C) = 1 + C^(-1/5)。这里 L 是假设的验证损失,C 是归一化后的假设训练计算单位;式中的 1 是这条玩具曲线的拟合底项,-1/5 是假设指数,都不是 Kaplan 或 Chinchilla 的实测系数,更不是通用极限。

假设训练计算量 C按假设公式得到的 L相对底项 1 还多多少
12.001.00
321.500.50
10241.250.25

这组假设数字说明:计算量从 1 增到 32、再增到 1024,每次都是 32 倍,损失相对拟合底项的“剩余部分”各减半,但绝对降幅从 0.50 变为 0.25。它体现收益递减的可能形状,却无法推出客服问答正确率、收入或安全性怎样变化,也无法保证把 C 再扩大 32 倍仍适用。

什么时候经验曲线不能照搬 ​

继续用这个团队的扩算决策看五个边界。它们不会自动宣布所有 Scaling Law 失效,却会让“沿用原曲线的系数和结论”变得不可靠。

条件变化团队可能见到什么应怎样处理
独特且合适的数据变少新增的训练 token 主要是旧语料反复读,表面 D 增加了,新增信息却有限区分独特数据量与重复次数,重新拟合数据受限条件下的规律;有研究发现少量重复的影响可有限,但重复过多时新增计算的价值会递减。数据受限原始实验
数据来源或质量变了相同 token 数下,某些来源更适合目标任务,噪声、重复、污染也会改变损失固定数据清洗和来源混合方式作对照实验;数据配比优化研究表明,仅改变领域混合就能改变训练效率。DoReMi 原论文
指标太窄或已经饱和验证损失还在降,但简单选择题几档模型都高分,真实客服仍答错复杂政策同时看留出损失、困难评测和真实任务切片;MMLU-Pro 的提出就针对原 MMLU 区分度和稳定性问题,不能把一张测试卷的停滞等同所有能力停滞。MMLU-Pro 原论文
模型结构或训练办法变了旧曲线按普通稠密模型的参数量拟合,新模型让每个 token 只激活部分专家,名义参数量与实际运算不再同义按新架构重新定义活跃参数和实际 FLOPs,做新规模实验,不直接移植旧系数。Switch Transformers 原论文
目标从训练转到部署训练损失更低的方案可能回答慢、单次费用高,或复杂问题仍不稳把每次推理的成本、延迟和业务正确率纳入目标;训练计算最优并不自动等于生产成本最优。推理成本研究

“数据耗尽”尤其不应被说成某个已经确定的日期。可获取、可授权、去重后仍有价值的数据量,会随采集方式、语言、模态、合成数据质量和使用规则变化;可以说高质量独特数据是现实约束,不能从一篇外推研究推出全行业在哪年停止进步。

推理时多花计算量,是同一条规律吗 ​

不是同一条训练曲线。上文的 C 指训练时一次性投入的计算量;推理时计算发生在每个用户问题到来之后。例如假设团队对一条复杂售后政策问题,先只生成一个简短答案,再让模型进行更多内部推理或检验候选答案。后者可能在难题上更准确,但会占用更多计算并增加响应等待。OpenAI 对其推理模型的公开实验报告过:在所测任务和模型设置下,更多训练时强化学习计算及更多推理时计算都与性能改进相关。这是另一组经验结果,不能把“多思考 10 倍”代入上面的预训练损失公式,也不能保证任意任务都获益。OpenAI 原始报告

实际选择需要问:同一业务测试集里,额外推理计算让多少错误变正确?新增延迟与费用是多少?简单请求是否也要付这笔成本?有些错误来自缺少最新政策或错误工具结果,单靠延长推理未必能修复。对用户展示可核对的依据与操作结果即可,不需要暴露模型私有的内部推理过程。

扩算决策中怎样用它,怎样发现判断失准 ​

假设团队先用较小的几档同架构、同数据处理流程模型拟合曲线,预计下一档在验证损失上会改善。正常路径是:保留干净的留出集;记录每档的参数 N、实际 token 数 D、运算量 C 和验证损失 L;在预算允许的邻近规模做一档验证实验;再跑客服任务集,检查政策引用、拒答、复杂多轮准确率和推理费用。只有这些结果都支持业务目标,才继续放大。

失败路径是:团队把小规模曲线直接外推到远超已测范围,同时新训练数据重复、混入大量不相关网页。新模型的损失下降小于预测,原有选择题分数仍高,真实复杂客服题没有改善。此时先核对计算统计和训练配置,再查独特数据比例、数据混合与验证集污染;按新条件重做几档小实验,不继续用旧系数算回报。最后用更难且隔离的业务题确认变化。“预测偏了”可能是规律适用条件变了,也可能是测量设计出了问题,需要定位,不能只宣称 Scaling Law 已终结。

面试时怎样回答 ​

我会把 Scaling Law 当作一定实验范围内的经验规律。Kaplan 研究发现语言模型验证损失与参数、数据、训练计算量呈幂律关系;Chinchilla 进一步表明,固定训练预算下参数和训练 token 的分配也重要,不能只堆参数。它有助于做下一档训练预算预测,但结论依赖模型结构、数据分布和评价目标。高质量独特数据受限、重复训练、架构改变、评测饱和时,旧拟合都需要重测。推理时计算是另一条轴,还要付延迟和部署成本。所以我会在邻近规模验证预测,再用隔离的业务测试集评估真实收益,不对无限未来作确定性断言。

如果追问“验证损失持续降低,为什么业务准确率没有涨”,可以回答:两者测量的对象不同。前者平均考察下一个 token 的概率,后者可能要求正确引用一条少见政策、做多步判断或调用工具。还要排查业务测试集是否足够难、是否受训练数据污染,以及错误是否其实来自缺失信息。降低训练损失是有价值的信号,但不是该业务成功率的直接换算公式。

参考资料 ​

最后更新2026-09-26
难度P1
频率medium
阅读18 min
主题scaling-law / llm-training / compute
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题