涌现:能力为什么会突然出现
跨过某个规模阈值后能力阶跃式跳升;以及这个现象在学术上尚存的争议
本页解决的问题
先给结论「涌现:能力为什么会突然出现」要解决的关键问题是什么?
跨过某个规模阈值后能力阶跃式跳升;以及这个现象在学术上尚存的争议
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头。
麻烦的地方在左半段。跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。手里只有前半段数据的时候,没有办法外推出后面会不会抬头,也没有办法预测抬头的位置。目前也没有一套理论能提前算出某项能力会在哪个规模出现。
这件事读起来平淡,拖一遍才有感觉。下面把模型规模交给你,从 0.5B 一路往上推,看六项能力是怎么一项一项亮起来的。
下面这些能力都在公开研究和行业讨论里被当作涌现的例子。括号里的规模只是量级参考。同一项能力换个架构、换批训练数据、换种评测方式,位置就会明显偏移。
论证是这样的。多步数学题通常按「答案完全正确」判分,中间错一步,整题算零。这种打分方式是离散的,它把模型的连续进步压成了一个二值结果。模型从错得离谱进步到只差最后一点,分数照样是零。等它跨过最后那点门槛,分数才一次性从零跳起来。
把判分换成连续指标,比如逐个 token 看正确答案的对数概率,同一组实验的曲线就变成一条平滑上升的线。跳变消失了,说明跳变来自尺子,模型本身一直在稳步变好。
离散指标
一次通过才算分。中间的进步全部记为零,最后集中兑现,看上去就是一次跳升。
连续指标
给部分正确也记分。同一批模型的进步被完整记录下来,曲线变成平滑上升。
这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃。
换更大的模型之前,先自己测一遍
跑分榜测的是通用任务,你的场景可能正好卡在某个阈值附近。换一档规模也许立刻就通了,也许毫无变化。花半天做一个二三十条样本的小测试集,用真实数据跑一遍,比读十篇评测有用。
小模型做不到的事,别急着用提示词硬凑
遇到怎么改提示词都做不对的任务,先换一档规模试试。如果大一档立刻就对了,那之前那些复杂提示词只是在补规模的缺口。这类提示词通常又长又脆,换个模型、换个版本就失效。
看到「突然会了」,也别急着下结论
上面那个争议在自己的测试里同样成立。加一个宽松一点的判分口径做交叉验证,比如按步骤给分、按字段给分。两把尺子都显示跳升,这个结论才站得住。
涌现说明规模能换来能力。它同时留下一个问题:既然大模型更强,为什么整个行业还在拼命把模型做小?把几百 B 压到几 B,损失掉的正是这一节讲的这部分东西。压缩的收益是什么,代价能不能接受,下一节从这个矛盾开始讲。
「先说结论」要放回选型约束
「把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。
先写淘汰条件,再看最高分
「麻烦的地方在左半段。跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。手里只有前半段数据的时候,没有办法外推出后面会不会抬头,也没有办法预测抬头的位置。目前也没有一套理论能提前算出某项能力会在哪个规模出现」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。
没有测试集,就没有可靠的赢家
以「涌现说明规模能换来能力。它同时留下一个问题:既然大模型更强,为什么整个行业还在拼命把模型做小?把几百 B 压到几 B,损失掉的正是这一节讲的这部分东西。压缩的收益是什么,代价能不能接受,下一节从这个矛盾开始讲」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。
从「先说结论」走到「两条曲线,形状完全不同」
「先说结论」先把问题落在「能力随参数量的增长,很多时候并不平滑。 有一类任务,模型在很宽的规模区间里成绩一直贴着零,看上去毫无进展。等参数量跨过某个位置,成绩在很短的区间内跳到可用水平。跳升之前,你从已有的数据点看不出后面会发生什么」上;到了「两条曲线,形状完全不同」,讨论继续推进到「把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。
- 「先说结论」:能力随参数量的增长,很多时候并不平滑。 有一类任务,模型在很宽的规模区间里成绩一直贴着零,看上去毫无进展。等参数量跨过某个位置,成绩在很短的区间内跳到可用水平。跳升之前,你从已有的数据点看不出后面会发生什么
- 「两条曲线,形状完全不同」:把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头
- 「最后的要点」:这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃
最后的「最后的要点」把讨论落到「这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。