Skip to content

Q127 · “涌现能力”是什么意思?通常在模型多大时出现? ​

一个模型做四位数加法,小规模版本几乎总把整题算错;把同一系列模型做大后,某个规模附近“整题全对率”突然上升。看图时很容易说:“模型长到这里,忽然学会了加法。”这种先平后升、像越过门槛的观察,就是大模型研究里常说的“涌现能力”现象之一。

但面试中如果追问“到底达到多少亿参数就会涌现”,不能给一个通用数字。不同任务、模型家族、数据、训练量、提示方式和评分指标下,曲线都可能不同;“跃升”本身也有争论。2022 年的涌现论文把它描述为小模型中不明显、较大模型中可见,且难从小规模表现直接预测的任务能力;2023 年另一篇 NeurIPS 论文指出,某些突然跃升的外观可能来自整题全对等不连续评分,换用连续评分会看到较平滑的进步。Wei 等:Emergent Abilities of Large Language Models · Schaeffer 等:Are Emergent Abilities of Large Language Models a Mirage?

同一组模型用部分得分和整题全对率评分,曲线可能呈现平滑上升或看似跨过门槛

术语和观察曲线的方法 ​

词面向初学者的解释
参数模型训练后保存的数值,决定它如何处理输入。参数量是规模的一种指标,但不等于训练质量。
模型规模常以参数量表示,也可考虑训练计算量、训练数据量;说“模型变大”时要交代具体横轴。
能力在某个任务上的表现,如多位数加法、翻译或按步骤解决题目;要有明确测试方式。
评测题集 / Benchmark一组固定题,用来比较不同模型的表现;题的来源、难度和是否泄漏进训练数据会影响结果。
全对率 / 精确匹配每道题答案完全正确才得 1 分,否则得 0 分。例如四位答案错一位也算错题。
部分得分 / 连续指标对接近正确答案给一定分数,如数字位数对了几位,或正确答案的概率;只是说明指标区别,实际选择要看任务价值。
涌现在一些研究的定义中,较小模型表现接近随机或很低,较大模型在某规模后明显提高,曲线看起来像出现新能力。
阈值曲线被判断开始明显上升的规模点。某个实验的阈值不自动适用于别的任务。
训练计算量完成训练所花的计算工作量。参数相同的两模型,若训练数据和算力不同,性能也未必相同。

本文所有小数字曲线都是教学示意,不是某篇论文的实际测量点。图里左右假设是同一组模型,只换评分方法,用来说明为什么读者必须看清坐标轴和指标。

最初研究观察到了什么 ​

研究者把同一系列里不同大小的语言模型放在相同任务上比较。在若干任务中,小模型分数长期靠近随机或很低;规模进一步增加后,得分明显上升。Wei 等人把这类“从较小模型难以预测较大模型表现”的现象称为涌现能力。Wei 等,2022 BIG-bench 等任务集提供了大量不同难度的评测题,研究者因而可以画出“任务得分随模型规模变化”的曲线。BIG-bench 原论文

Google Research 对原研究的介绍举了 GPT-3 家族多位数加法的例子:按其测试口径,约 1 亿到 130 亿参数范围内表现较平,随后更大模型的分数明显上升。这个例子回答的是“历史实验中有没有出现过某个数量级的跃升”,不是说所有涌现都发生在 130 亿参数,也不是说超过 130 亿就必然掌握多位数加法。甚至同一任务,换题目位数、提示、训练方案或指标都可能改变曲线。Google Research:Characterizing Emergent Phenomena

为什么会有“像突然学会”的感觉?因为很多复杂任务有多步:先理解题意,再选择方法,再保持中间状态,最后输出格式也要对。只要任一步出错,“整题全对”就是 0。随着模型每一步慢慢改进,所有步骤同时正确的比例可能在某一段规模区间变得显眼。这里说的是可能的机制解释,并非已经证明所有涌现都由同一原因造成。

同一道题,换评分方式会看到什么 ​

设正确答案是 1847+2658=4505。模型 A 回答 4504,只差最后一位;模型 B 回答 4505,全对。如果按“整题全对”打分,A 得 0,B 得 1;如果为分析学习趋势而额外记录“各位数字有多少对”,A 有三位对,B 有四位对。实际评估数学能力时,给用户的答案当然应以全对为准,但研究模型是否在逐步接近正确时,连续的辅助指标能提供额外信息。

这就像把逐步变化的能力投到一个开关上:没达到全对就是 0,一旦全对就是 1。Schaeffer 等人的 NeurIPS 2023 论文对若干被称作“涌现”的实验作了重新分析,认为部分突然跳变可由不连续或非线性指标造成;使用更连续的指标时,相关提升可能更平滑。因此他们质疑“看起来突然上升就意味着模型内部发生了神秘相变”的强结论。NeurIPS 2023 论文

这并不意味着“所有新能力都是假的”。对最终用户,“能不能完整做对”仍是真实的重要门槛;模型跨过可用标准后,产品体验也可能突然改变。争论的焦点是:曲线中的不连续程度有多少来自模型能力本身,有多少来自评分口径和采样方式。要分别报告“任务是否全对”和“错误如何随规模逐步变化”,不要用其中一张图替代全部事实。

为什么不能给一个统一的参数门槛 ​

任务不同。两位数加法、四位数加法、长文推理、多语言翻译所需的能力不同,同一模型也可能在不同任务上呈现不同曲线。笼统说“几百亿参数后会推理”没有指定题目、准确率和提示方式,无法验证。

模型训练不同。参数量一样,不代表读过同样的数据、用过同样的计算量或训练目标。更高质量数据、不同分词方式、指令训练和工具使用都可能影响结果;只把参数量当唯一因果变量容易误判。若比较两种模型家族,需要标明还有哪些变量一起变了。

提示与评测不同。零样本还是给示例,是否允许分步提示,答题格式如何判,全部会影响表现。尤其“随机水平”“达到某阈值”必须写清对照分数、题量、置信区间。测几十道题且只测试几个离散规模,图上一个“跳”也可能是采样太稀或分数波动。

能力可能是组合出来的。一个系统用小模型加计算器也能完成较大模型单独做不好的算术任务。因此“系统能做”与“某个模型不借助工具能做”也要区分。若讨论 Agent,工具、检索和反馈循环会改变可观察能力,不应把整个系统的成绩直接归因于模型参数涌现。

因此给面试官的准确回答是:某些经典实验在十亿到数百亿、甚至更大规模范围内观察到不同任务的跃升,但没有跨任务、跨模型、跨指标共用的固定参数阈值。若引用 130 亿一类数字,必须说清是 GPT-3 多位数加法的特定实验范围,而不是普遍定律。Google Research 原研究介绍 · BIG-bench

真实项目里怎样判断一项能力是否“出现” ​

假设团队关心客服 Agent 能否正确处理复杂退货规则。先写明“正确处理”的标准:政策引用正确、金额计算正确、未授权时拒绝、所有步骤有据可查。再选一组难度分层的真实任务,用相同数据和提示比较不同模型;同时记录整单成功率、每个步骤的部分正确率、错误类型和置信区间。若整单成功率在某个规模附近跃升,还要检查是否是政策检索、提示长度、评测题太少或工具配置变化造成的。

一个反例是:20 道测试题,小模型答对 0 道,大模型答对 3 道,就宣称“出现通用业务规划能力”。样本太少、成功定义过宽,且三道题可能恰好是它见过的常见模式。应扩充任务覆盖、做独立测试并复测不同随机样本。另一种反例是只看平均损失平滑下降,就断言产品能力没有门槛:即使模型逐步改善,用户要求“退款金额绝对不能算错”时,达不到完整正确标准仍不能上线。

这就是涌现问题在工程上的用法:它提醒我们不要从小模型在某些题上差,就武断外推更大模型永远差;也不要从一张陡峭曲线,武断推出到某个参数量系统就安全可靠。测试任务与评分标准要贴近真实用途。

面试时怎么回答 ​

涌现能力原本指某些任务上,小模型表现很低,模型扩大后在某个范围内出现明显的成绩跃升,而且这种跃升不容易从小规模成绩外推。经典例子是多位数加法等 BIG-bench 任务。但它没有一个统一的参数门槛;常提到的“十几亿、上百亿”都只能对应特定模型家族和任务。还要看评分方式:全对才得分的指标可能把逐步改善显示成突然跳变,NeurIPS 2023 的后续研究就对此提出过质疑。我会同时看整题成功率和连续的中间指标,固定训练与提示条件,给出题集和置信区间。工程上真正关心的是目标任务是否达到可用和安全标准,而不是宣称模型过了某个参数数就自动拥有所有能力。

如果追问“那涌现是不是被证伪了”,回答应保留两层:许多表观跳变可以由评测指标解释;但不同模型和任务是否存在更深层的不连续行为,不能凭单篇论文一概否定。若追问“通常多少参数”,先要求指定任务、模型、提示和评分口径,再给相应论文中的实验范围,不能报通用临界值。

资料依据 ​

最后更新2026-09-26
难度P1
频率medium
阅读24 min
主题llm / emergent-abilities / scaling
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题