专题篇章 · 开放权重、蒸馏与本地运行

涌现:能力为什么会突然出现

跨过某个规模阈值后能力阶跃式跳升;以及这个现象在学术上尚存的争议

本页解决的问题

先给结论

「涌现:能力为什么会突然出现」要解决的关键问题是什么?

跨过某个规模阈值后能力阶跃式跳升;以及这个现象在学术上尚存的争议

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

先说结论
能力随参数量的增长,很多时候并不平滑。有一类任务,模型在很宽的规模区间里成绩一直贴着零,看上去毫无进展。等参数量跨过某个位置,成绩在很短的区间内跳到可用水平。跳升之前,你从已有的数据点看不出后面会发生什么。
两条曲线,形状完全不同

把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头。

阈值区间(示意) 100% 75% 50% 25% 0 1M 10M 100M 1B 10B 100B 1T 参数量(对数刻度) 任务成绩
常规能力,随规模稳步抬升 涌现能力,跨过阈值后跳升
上图为示意,横轴与纵轴的取值不对应任何具体模型或评测集。现象与曲线形态参考 Wei et al., Emergent Abilities of Large Language Models, TMLR 2022(arXiv:2206.07682)。

麻烦的地方在左半段。跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。手里只有前半段数据的时候,没有办法外推出后面会不会抬头,也没有办法预测抬头的位置。目前也没有一套理论能提前算出某项能力会在哪个规模出现。

这件事读起来平淡,拖一遍才有感觉。下面把模型规模交给你,从 0.5B 一路往上推,看六项能力是怎么一项一项亮起来的。

从最小拖到最大,注意灯不是一起亮的,是一项一项蹦出来的。
模型规模 0.5 B
0 / 6
上面的阈值为量级示意,取自公开研究与行业讨论中被反复引用的观察,不是精确测量值。换架构、换训练数据或换评测方式,这些位置都会明显偏移。
六个被反复提到的例子

下面这些能力都在公开研究和行业讨论里被当作涌现的例子。括号里的规模只是量级参考。同一项能力换个架构、换批训练数据、换种评测方式,位置就会明显偏移。

多步数学推理
单步算术小模型也能做对一部分。要求它连着推好几步再给答案,小模型的正确率长期贴着零。
约 10B 量级
多语言迁移
在英文语料上学会的推理方式,能用到训练里出现得很少的语种上。规模不够的时候,换个语种成绩就崩。
约 7B 量级
结构化输出与工具调用
稳定吐出合法 JSON,按函数签名填对参数类型。这项能力没有被专门设计进去,是训练完之后发现它有的。
约 7B 量级
思维链推理(CoT)
让模型先写出推理过程再给答案。这招在小模型上拿不到收益,有时还会把原本能答对的题带偏。
约 100B 量级
理论心智(ToM)
判断对话里的另一个人掌握了哪些信息、会怎么想。这一项的争议最大,有研究把测试题改写几个字,能力就消失了。
争议中
长对话角色一致性
几十轮之后仍然守住设定好的身份、语气和边界,中途不跑偏,也不被用户几句话带走。
约 13B 量级
思维链在约 100B 规模才出现明显收益,见 Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, NeurIPS 2022(arXiv:2201.11903)。理论心智的相关报告见 Kosinski, arXiv:2302.02083(2023);同期 Ullman, arXiv:2302.08399 指出对任务做微小改写后该表现即消失。其余各项的参数量为量级参考,行业内没有统一的权威阈值,请勿当作精确数字引用。核对日期 2026-08-07。
这件事在学术上还没有定论
有一派研究认为,相当一部分「涌现」是评测指标造出来的假象。换一种打分方式,同一批模型在同一批题目上画出来的曲线会变成平滑上升。

论证是这样的。多步数学题通常按「答案完全正确」判分,中间错一步,整题算零。这种打分方式是离散的,它把模型的连续进步压成了一个二值结果。模型从错得离谱进步到只差最后一点,分数照样是零。等它跨过最后那点门槛,分数才一次性从零跳起来。

把判分换成连续指标,比如逐个 token 看正确答案的对数概率,同一组实验的曲线就变成一条平滑上升的线。跳变消失了,说明跳变来自尺子,模型本身一直在稳步变好。

离散指标

一次通过才算分。中间的进步全部记为零,最后集中兑现,看上去就是一次跳升。

连续指标

给部分正确也记分。同一批模型的进步被完整记录下来,曲线变成平滑上升。

Schaeffer, Miranda & Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023(arXiv:2304.15004)。该文主张涌现在很大程度上由研究者选择的评测指标引发,采用非线性或离散指标时出现跳变,改用线性、连续指标后曲线平滑。上面两张迷你图为原理示意,未取自原文数据。核对日期 2026-08-07。

这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃。

对做产品的人意味着什么
1

换更大的模型之前,先自己测一遍

跑分榜测的是通用任务,你的场景可能正好卡在某个阈值附近。换一档规模也许立刻就通了,也许毫无变化。花半天做一个二三十条样本的小测试集,用真实数据跑一遍,比读十篇评测有用。

2

小模型做不到的事,别急着用提示词硬凑

遇到怎么改提示词都做不对的任务,先换一档规模试试。如果大一档立刻就对了,那之前那些复杂提示词只是在补规模的缺口。这类提示词通常又长又脆,换个模型、换个版本就失效。

3

看到「突然会了」,也别急着下结论

上面那个争议在自己的测试里同样成立。加一个宽松一点的判分口径做交叉验证,比如按步骤给分、按字段给分。两把尺子都显示跳升,这个结论才站得住。

一句话记住:规模是一个自变量,值得单独测。它可能给你带来没预期过的能力,也可能什么都不给。这件事只有在你自己的任务上才能问出答案。
接下来

涌现说明规模能换来能力。它同时留下一个问题:既然大模型更强,为什么整个行业还在拼命把模型做小?把几百 B 压到几 B,损失掉的正是这一节讲的这部分东西。压缩的收益是什么,代价能不能接受,下一节从这个矛盾开始讲。

「先说结论」要放回选型约束

「把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。

先写淘汰条件,再看最高分

「麻烦的地方在左半段。跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。手里只有前半段数据的时候,没有办法外推出后面会不会抬头,也没有办法预测抬头的位置。目前也没有一套理论能提前算出某项能力会在哪个规模出现」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。

没有测试集,就没有可靠的赢家

以「涌现说明规模能换来能力。它同时留下一个问题:既然大模型更强,为什么整个行业还在拼命把模型做小?把几百 B 压到几 B,损失掉的正是这一节讲的这部分东西。压缩的收益是什么,代价能不能接受,下一节从这个矛盾开始讲」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。

从「先说结论」走到「两条曲线,形状完全不同」

「先说结论」先把问题落在「能力随参数量的增长,很多时候并不平滑。 有一类任务,模型在很宽的规模区间里成绩一直贴着零,看上去毫无进展。等参数量跨过某个位置,成绩在很短的区间内跳到可用水平。跳升之前,你从已有的数据点看不出后面会发生什么」上;到了「两条曲线,形状完全不同」,讨论继续推进到「把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。

  • 「先说结论」:能力随参数量的增长,很多时候并不平滑。 有一类任务,模型在很宽的规模区间里成绩一直贴着零,看上去毫无进展。等参数量跨过某个位置,成绩在很短的区间内跳到可用水平。跳升之前,你从已有的数据点看不出后面会发生什么
  • 「两条曲线,形状完全不同」:把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头
  • 「最后的要点」:这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃

最后的「最后的要点」把讨论落到「这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 涌现:能力为什么会突然出现 开放权重、蒸馏与本地运行
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助