零基础入门 · 先把 AI 的雾气拨开

「跑分第一」的模型,为什么用起来不行?

榜单分和真实好用度的反转演示 + 三个原因:刷榜、过拟合题库、场景不匹配;顺便说清什么榜更可信

本页解决的问题

先给结论

「跑分第一」的模型,为什么用起来不行?

榜单分和真实好用度的反转演示 + 三个原因:刷榜、过拟合题库、场景不匹配;顺便说清什么榜更可信

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

一句话回答

榜单测的是考试,你要的是干活。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是拿自己的活儿去试

反转演示 · 高分选手输给了谁

下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急,点下面三个真实任务,看看它们各自的表现。

模型 A

95 分
榜单排名靠前,新闻里的常客

模型 B

88 分
榜单成绩平平,无人报道
三个任务试完了。结论呼之欲出:95 分和 88 分的差距,在你的日常任务里可能根本感觉不到,甚至反过来。分数排的是考场座次,干活好坏还得上手试。
为什么会这样 · 三个原因
📖

刷榜

榜单题库在网上流传久了,难免混进模型的训练数据。相当于考前背了答案:分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」。

🎯

过拟合考试

厂商知道大家看榜,就专门朝着考点优化。就像应试教育里的做题家:卷面成绩顶尖,日常交流和动手能力反而可能被牺牲掉。

🗺️

考纲不含你的场景

榜单考数学、考代码、考知识问答,但不考「懂你们行业」,也不考「安慰人」。你最在意的那门课,考纲里可能压根没有。

什么榜相对可信 · 认准真人盲测

也有相对可信的榜:真人盲测投票类。做法是把两个模型的回答摆在一起,隐藏名字,让大量真实用户投票选哪个更好。这种榜没有固定题库可背,考官是活人,刷起来难度大得多。

但它也只是「相对」可信:投票的人未必和你干同一行,大众觉得好的回答风格,未必适合你的场景。想看国产模型在各种真实场景里的实际表现,可以移步国产模型怎么选那一页。

自己怎么选 · 建一套私人题库

最靠谱的评测机构是你自己。方法很土,但极其有效:从自己的工作里攒 10 个真实问题,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然。

私人题库的攒法(示例)

  • 挑最常干的活:周报、方案、邮件,选你每周都要做的 3 件
  • 挑最专业的活:带上行业黑话和内部语境的问题,考它懂不懂你这行
  • 挑翻过车的活:以前 AI 答砸过的问题,最能试出新模型的成色
  • 留一道送分题再留一道刁钻题:送分题都答不好的直接淘汰,刁钻题用来拉开差距
  • 答案好坏你说了算:你比任何榜单都清楚,什么样的输出算「能交差」
这套题库还有个隐藏好处:它会逼你想清楚自己到底需要 AI 干什么。很多人换了三个月模型,最后发现真正的问题是提示词没写好。题库在手,换模型五分钟出结论,再也不用追着新闻跑。

「反转演示 · 高分选手输给了谁」要放回选型约束

「榜单测的是 考试 ,你要的是 干活 。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是 拿自己的活儿去试」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。

先写淘汰条件,再看最高分

「下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急, 点下面三个真实任务 ,看看它们各自的表现」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。

  • 挑最常干的活 :周报、方案、邮件,选你每周都要做的 3 件
  • 挑最专业的活 :带上行业黑话和内部语境的问题,考它懂不懂你这行
  • 挑翻过车的活 :以前 AI 答砸过的问题,最能试出新模型的成色

没有测试集,就没有可靠的赢家

以「最靠谱的评测机构是你自己。方法很土,但极其有效: 从自己的工作里攒 10 个真实问题 ,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。

从「反转演示 · 高分选手输给了谁」走到「为什么会这样 · 三个原因」

「反转演示 · 高分选手输给了谁」先把问题落在「下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急, 点下面三个真实任务 ,看看它们各自的表现」上;到了「为什么会这样 · 三个原因」,讨论继续推进到「榜单题库在网上流传久了,难免混进模型的训练数据。 相当于考前背了答案 :分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。

  • 「反转演示 · 高分选手输给了谁」:下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急, 点下面三个真实任务 ,看看它们各自的表现
  • 「为什么会这样 · 三个原因」:榜单题库在网上流传久了,难免混进模型的训练数据。 相当于考前背了答案 :分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」
  • 「最后的要点」:答案好坏你说了算 :你比任何榜单都清楚,什么样的输出算「能交差」

最后的「最后的要点」把讨论落到「答案好坏你说了算 :你比任何榜单都清楚,什么样的输出算「能交差」」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

✅ 这一页想和你分享的

  • 跑分是入学考试,你要的是试用期表现:两件事相关,但相关得有限
  • 高分可能是背过题:题库会泄漏进训练数据,考点会被针对性优化
  • 真人盲测投票的榜相对可信:没有固定题库,考官是活人
  • 建一套自己的十题小考卷:换模型跑一遍,五分钟出结论,比追新闻管用
标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 「跑分第一」的模型,为什么用起来不行? 先把 AI 的雾气拨开
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助