自我改进 · 当 Harness 开始自我改进

工作流设计:从手工到自动搜索

AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流

本页解决的问题

先给结论

「工作流设计:从手工到自动搜索」要解决的关键问题是什么?

AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

Workflow Design & Automated Search

当工作流本身成为搜索空间,设计就从艺术变成了工程

从完全手工的管线设计,到用 MCTS 自动发现最优工作流,Agent 系统的设计范式正在发生根本转变。代码是定义 Harness 的通用语言。
手工设计的工作流
💬 说人话:工作流就是给 AI 安排的做事流程表。就像新员工入职,你得告诉他「先做 A,再做 B,出问题找 C 核对」。以前这张流程表全靠人一步步写,下面这两个例子就是人手工写出来的最强流程表。
Lu et al. 2026
AI Scientist
构建完整的科研自动化管线
核心思想:将科学研究的完整流程交给一个 Agent 系统自动完成:从零开始执行一轮完整的研究循环。

管线流程:
  • 提出研究想法
  • 写代码
  • 跑实验
  • 分析结果
  • 写论文
  • 同行评审
关键创新:每一步都由 LLM 驱动,形成端到端的自动化科研系统。评审环节引入 LLM-as-judge 进行质量把关。
AI Scientist Pipeline
AI Scientist 的完整管线:从研究构思到论文写作与同行评审,全部由 Agent 自动化执行。(Lu et al. 2026)
Kulikov et al. 2026
Autodata
数据科学家 Agent:合成难度恰到好处的数据
核心思想:通过多角色协作,自动合成训练数据,使数据难度精确可控:strong solver 能做出,weak solver 做不出

角色体系:
Challenger出题者
Weak Solver弱解题者
Strong Solver强解题者
Verifier / Judge验证裁判
关键创新:用难度差作为数据质量信号:只有同时满足强者能解、弱者不能解的题目才被保留,确保合成数据对提升模型有最大价值。
Autodata System
Autodata 的多角色协作体系:Challenger 出题,Strong/Weak Solver 试解,Verifier 仲裁数据质量。(Kulikov et al. 2026)
ADAS: 自动化 Agent 系统设计
💬 说人话:手写流程表太累,那能不能让 AI 自己给 AI 设计流程表?ADAS 就是这个思路:雇一个设计师 AI,让它不停画新的流程表、试跑、打分,把好用的留下来。相当于让老师傅带徒弟的工作也自动化了。
Hu et al. 2025
ADAS — Automated Design of Agentic Systems
将 Agent 设计本身视为优化问题
核心思想:让一个 "Meta-Agent" 在 Agent 设计空间中自动搜索最优方案,取代手工设计 Agent 架构。这就是 "meta-agent search"

工作机制:
1. Meta-Agent 先生成一个高层描述(Agent 的架构、工具使用、推理策略)
2. 将高层描述实现为可执行代码
3. 通过 self-refine 检查新颖性:确保不是简单重复已有方案
4. 在基准任务上评估,保留表现最好的设计

关键创新:用代码作为 Agent 设计的搜索空间表示,使设计可以被自动生成、修改和评估。
ADAS Meta-Agent Search
ADAS 的 Meta-Agent Search:Meta-Agent 生成候选 Agent 设计→实现为代码→评估→迭代优化。(Hu et al. 2025)
AFlow:基于 MCTS 的工作流搜索
💬 说人话:ADAS 是让 AI 随便发挥想新方案,AFlow 则更进一步,用下棋 AI 同款的棋盘推演法(MCTS,蒙特卡洛树搜索)来找最优流程。就像 AlphaGo 下棋前会在脑子里推演几百步「如果我走这里,对方会怎样」,AFlow 也是在脑子里推演几百种流程改法,哪条路线得分高就往哪边深挖。
Zhang et al. 2025
AFlow
将 Agent 工作流表示为图,用 MCTS 自动优化
核心思想:把工作流表示为有向图:节点是 LLM 调用动作,边是代码中的逻辑操作(条件分支、循环、数据传递)。然后用蒙特卡洛树搜索(MCTS)在这个图空间中自动寻找最优工作流。

MCTS 优化流程:
  1. 初始化起始工作流作为搜索树的根节点
  2. soft mixture of score and uniform exploration 选择待扩展节点(平衡利用与探索)
  3. 让 LLM 生成修改后的工作流变体(添加/删除/修改节点和边)
  4. 在目标任务上执行并评估新工作流的表现
  5. 如果有改进,加回搜索树中作为新的候选
  6. 重复直到 top-k 平均分稳定或达到计算预算
关键创新:将工作流设计问题转化为树搜索问题,让 MCTS 的探索-利用平衡机制自动发现好的工作流结构,无需人类手工设计。
AFlow Architecture
AFlow 的图表示与 MCTS 搜索:工作流被表示为节点(LLM 动作)和边(逻辑操作)的有向图。(Zhang et al. 2025)
AFlow 实验结果
方法 设计方式 搜索策略 核心优势
手工设计 人类专家迭代 无(凭经验) 可解释性强
ADAS Meta-Agent + 代码 Self-refine 自动化设计
AFlow 图表示 + MCTS 蒙特卡洛树搜索 系统化搜索 + 稳定收敛
AFlow Experimental Results
AFlow 在 QA、代码生成、数学推理等任务上的表现对比:系统化搜索优于手工设计和 ADAS。(Zhang et al. 2025)
逐步体验:AFlow 的 MCTS 搜索过程
就绪
1
初始化
W₀: Plan → Execute 得分 52
从最简单的单步工作流开始。没有反思、没有验证、没有并行。
2
扩展:LLM 提出变体
W₁: +Reflect61 W₂: +Verify58 W₃: +Decompose55
让 LLM 基于 W₀ 生成三个修改方案,分别加入反思、验证、任务分解。
3
评估 & 选择父节点
W₁: 61 ← 选中
W₁ 得分最高(61 > 58 > 55),选它作为下一轮扩展的父节点。
4
再次扩展
W₄: Reflect×265 W₅: Reflect+Verify78 🏆
从 W₁ 扩展两个方案:双重反思 vs 反思+验证组合。后者大幅领先!
5
剪枝 & 收敛
W₃: 55 ✗ W₆: 56 ✗ W₅: 78 ✓ 最优
分数低于阈值的工作流被剪枝。W₅(Plan → Execute → Reflect → Verify → Output)确认为搜索到的最优方案。比手工设计高出 50%!

核心洞见

  • 搜索空间巨大:工作流的组合可能性远超人类手动探索的能力范围,手工设计只能触及冰山一角
  • 设计即搜索:把工作流设计当作搜索问题,用算法(如 MCTS)取代直觉去寻找好的解决方案
  • 代码是通用语言:Harness 本质上就是编排 prompt、工具调用、子 Agent、控制流、记忆和工作流逻辑的代码
  • 从 ADAS 到 AFlow 的进化:Agent 设计的自动化程度在不断提升,从让 LLM 设计进化到让算法系统化搜索

「当工作流本身成为搜索空间,设计就从艺术变成了工程」里的算法代价曲线

「AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流」真正训练的不是背诵步骤,而是识别重复工作:输入变大时,程序到底多做了多少次比较、移动或递归。

先找重复工作,再谈快慢

「AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流」可以拆成输入规模、每轮做什么、以及是否能缩小下一轮范围三个问题。Big-O 是描述增长趋势的语言,不是对每台机器的精确计时;常数、内存和真实数据分布也会影响最终结果。

  • 用 soft mixture of score and uniform exploration 选择待扩展节点(平衡利用与探索)
  • 让 LLM 生成修改后的工作流 变体(添加/删除/修改节点和边)
  • 重复 直到 top-k 平均分稳定或达到计算预算

别把理论最优当成无条件最优

面对 AI 写出的算法,先用小输入手算一遍,再用逐渐放大的数据做基准测试。这样才能把「AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流」从一句结论变成可检查的性能判断。

从「当工作流本身成为搜索空间,设计就从艺术变成了工程」走到「手工设计的工作流」

「当工作流本身成为搜索空间,设计就从艺术变成了工程」先把问题落在「从完全手工的管线设计,到用 MCTS 自动发现最优工作流,Agent 系统的设计范式正在发生根本转变。代码是定义 Harness 的通用语言」上;到了「手工设计的工作流」,讨论继续推进到「💬 说人话: 工作流就是给 AI 安排的 做事流程表 。就像新员工入职,你得告诉他「先做 A,再做 B,出问题找 C 核对」。以前这张流程表全靠人一步步写,下面这两个例子就是人手工写出来的最强流程表。 Lu et al. 2026 AI Scientist 构建完整的科研自动化管线 核心思想: 将科学研究的完整流程交给一个 Agent 系统自动完成:从零开始执行一轮完整的研究循环。 管线流程: 提出研究想法 → 写…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

算法题换成真实任务后,先找出重复工作,再问输入规模如何变化,最后用一个小基准验证理论判断。这样不会把复杂度记成脱离场景的标签。

  • 「当工作流本身成为搜索空间,设计就从艺术变成了工程」:从完全手工的管线设计,到用 MCTS 自动发现最优工作流,Agent 系统的设计范式正在发生根本转变。代码是定义 Harness 的通用语言
  • 「手工设计的工作流」:💬 说人话: 工作流就是给 AI 安排的 做事流程表 。就像新员工入职,你得告诉他「先做 A,再做 B,出问题找 C 核对」。以前这张流程表全靠人一步步写,下面这两个例子就是人手工写出来的最强流程表。 Lu et al. 2026 AI Scientist 构建完整的科研自动化管线 核心思想: 将科学研究的完整流程交给一个 Agent 系统自动完成:从零开始执行一轮完整的研究循环。 管线流程: 提出研究想法 → 写…
  • 「最后的要点」:设计即搜索 :把工作流设计当作搜索问题,用算法(如 MCTS)取代直觉去寻找好的解决方案

最后的「最后的要点」把讨论落到「设计即搜索 :把工作流设计当作搜索问题,用算法(如 MCTS)取代直觉去寻找好的解决方案」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 工作流设计:从手工到自动搜索 当 Harness 开始自我改进
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助