未来挑战:自我改进的七道关
弱评估器 / 记忆退化 / 奖励黑客 / 多样性坍缩 / 人类角色,通往完整 RSI 的瓶颈
本页解决的问题
先给结论「未来挑战:自我改进的七道关」要解决的关键问题是什么?
弱评估器 / 记忆退化 / 奖励黑客 / 多样性坍缩 / 人类角色,通往完整 RSI 的瓶颈
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
自动研究:能写论文 ≠ 能做科学
六种反复出现的失败模式
Trehan & Chopra (2026) 系统测试了 LLM 从想法到论文的全流程能力,发现了六种反复出现的失败模式。这些是当前自动研究的结构性瓶颈,绝非偶发 Bug。
💬 打个比方:健身有体重秤,代码有测试,但「这篇论文有没有价值」没有秤可称。没有秤,再努力的减肥计划也不知道自己是瘦了还是胖了。
💬 打个比方:全班都抄第一名的作业,短期分数好看,但再也不会有人想出新解法了。
💬 打个比方:如果考试只看分数,学生就会背题库、找漏洞、甚至改成绩单,没有人真正学会知识。所以出卷人和改卷人绝不能是学生自己。
最终思考
自动研究、递归自我改进、AI Agent,这些技术正在快速发展,但上面列出的七道关并不是工程问题,它们是根本性的系统设计挑战。
弱评估器让反馈信号模糊,多样性坍缩让创新停滞,奖励黑客让改进方向跑偏,短期优化让长期健康受损。所有这些问题的共同解法,最终都指向同一个方向:
我们在为人类更好的未来构建技术,方向永远是技术服务于人。
许多挑战都需要人类的反馈和引导。人是系统不可或缺的方向盘,从来都不是要被替代的瓶颈。
「自动研究: 能写论文 ≠ 能做科学」为什么能找到相关内容
「Trehan & Chopra (2026) 系统测试了 LLM 从想法到论文的全流程能力,发现了 六种反复出现的失败模式 。这些是当前自动研究的结构性瓶颈,绝非偶发 Bug」把检索问题从“把资料存起来”推进到“怎样找到真正相关的资料”。这一步决定了 RAG、推荐和以图搜图最后交给模型的输入质量。
相似度不是答案,召回之后还要核对
在「自动研究、递归自我改进、AI Agent,这些技术正在快速发展,但上面列出的七道关并不是工程问题,它们是 根本性的系统设计挑战」对应的流程里,Embedding 负责把对象放到可比较的语义空间,近邻索引负责减少搜索范围,最终的回答仍然依赖召回片段是否覆盖问题、距离指标是否合适,以及内容有没有过期。
先区分找得到和找得准
把「我们在为人类更好的未来构建技术,方向永远是技术服务于人。」落成一次小测试:准备几条有明确答案的查询,记录召回的相关性、遗漏和无关结果,再决定是否需要换切分方式、索引或重排。
从「自动研究: 能写论文 ≠ 能做科学」走到「六种反复出现的失败模式」
「自动研究: 能写论文 ≠ 能做科学」先把问题落在「AI Scientist 证明了专家设计的 Harness 能协调自动研究循环的大部分环节,但论文产出并不等于科学发现。系统可以写出看似合理的论文,却可能包含虚假引用、实现漂移或薄弱的实验结果。 💬 说人话: AI 现在能写出 看起来像论文的东西 ,但就像一个只会套模板的实习生:格式对了、引用全了,可实验可能是错的、结论可能是编的。下面这六种毛病,是研究者反复观察到的实习生通病」上;到了「六种反复出现的失败模式」,讨论继续推进到「Trehan & Chopra (2026) 系统测试了 LLM 从想法到论文的全流程能力,发现了 六种反复出现的失败模式 。这些是当前自动研究的结构性瓶颈,绝非偶发 Bug」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
检索系统也可以这样看:先确定什么算相关,再观察召回是否覆盖问题,最后检查排序、切分和时效性有没有把真正有用的内容挤出去。
- 「自动研究: 能写论文 ≠ 能做科学」:AI Scientist 证明了专家设计的 Harness 能协调自动研究循环的大部分环节,但论文产出并不等于科学发现。系统可以写出看似合理的论文,却可能包含虚假引用、实现漂移或薄弱的实验结果。 💬 说人话: AI 现在能写出 看起来像论文的东西 ,但就像一个只会套模板的实习生:格式对了、引用全了,可实验可能是错的、结论可能是编的。下面这六种毛病,是研究者反复观察到的实习生通病
- 「六种反复出现的失败模式」:Trehan & Chopra (2026) 系统测试了 LLM 从想法到论文的全流程能力,发现了 六种反复出现的失败模式 。这些是当前自动研究的结构性瓶颈,绝非偶发 Bug
- 「最后的要点」:我们在为人类更好的未来构建技术,方向永远是技术服务于人。 许多挑战都需要人类的反馈和引导。人是系统不可或缺的方向盘,从来都不是要被替代的瓶颈
最后的「最后的要点」把讨论落到「我们在为人类更好的未来构建技术,方向永远是技术服务于人。 许多挑战都需要人类的反馈和引导。人是系统不可或缺的方向盘,从来都不是要被替代的瓶颈」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。