Harness 与自我改进 · 30 道灵魂拷问
每题附考察意图、答题框架与加分点:Harness 本质 / 设计模式 / 上下文自动进化 / 奖励黑客 / RSI 进展与风险
本页解决的问题
先给结论「Harness 与自我改进 · 30 道灵魂拷问」要解决的关键问题是什么?
每题附考察意图、答题框架与加分点:Harness 本质 / 设计模式 / 上下文自动进化 / 奖励黑客 / RSI 进展与风险
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
- 先给定义:Harness 是围绕基座模型的运行时系统,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储制品、评估结果。模型负责智能,Harness 负责让智能落地干活。
- 给证据:Claude Code、Codex、Cursor 这些成功产品已经证明,Harness 层与原始模型智能同等重要。一个平庸的模型加上优秀的 Harness,往往胜过裸露的更强模型。
- 说清 PM 视角的含义:换模型很容易,Harness 才是产品真正的护城河。同一个模型,Harness 设计得好坏,用户体验差几个量级。
- 拔高一层:Harness 正在从工程配角变成优化目标本身。前沿研究让模型改进围绕自己的 Harness,这是递归自我改进的现实路径。
- 报出三大模式:工作流自动化、文件系统做持久记忆、子 Agent 与后台任务。它们覆盖了当前最强 Agent 系统 90% 的架构决策,是结构性需求,没有可选余地。
- 模式一讲循环:Agent 是目标导向的循环,Plan → Execute → Observe → Improve → 再执行。失败是自我纠正的触发信号:测试不通过、命令报错,Agent 回头分析轨迹再调整。
- 模式二讲记忆:长任务的制品会迅速超出上下文窗口。正确做法是把持久状态存进文件系统,让 Agent 按需读写。一句话原则:上下文是工作记忆,文件系统是长期记忆。
- 模式三讲并行:父 Agent 当进程管理器,启动子 Agent、查进度、取消失败分支、合并结果。子 Agent 输出必须持久化成文件,中断也能恢复。
- 先诊断病根:大概率是朴素追加式的上下文管理。把所有工具响应和历史全塞进上下文,任务一长窗口就打满,早期信息被挤出去,输出质量骤降。这是策略问题,换大窗口模型只能延后发病。
- 给第一阶段方案:上文件系统持久记忆。每轮完成后把进度、错误日志、中间结果写文件,释放上下文,下一轮按需读取。上下文占用从持续膨胀变成恒定,可以稳定跑几十轮。
- 给第二阶段方案:引入 ACE 式的结构化上下文维护。Generator 干活、Reflector 复盘提炼经验、Curator 把经验整理成条目化剧本,增量合并、定期去重。经验越用越精,上下文却越用越薄。
- 给节奏承诺:第一阶段是工程改造,周级见效。第二阶段需要搭评测集验证收敛,按双周汇报长任务成功率的变化,用指标说话。
- 先纠正前提:手写 prompt 只是起点。优化对象有一条演进线:指令 Prompt → 结构化上下文 → 工作流 → Harness 代码 → 优化器代码。模型越强,能优化的目标就越复杂。
- 讲 ACE:优化上下文内容。维护一份结构化的 bullet point 剧本,Generator 执行任务、Reflector 从成败轨迹提炼洞察、Curator 用确定性逻辑增量合并条目。从不整块重写,避免上下文坍缩。局限是更新规则仍靠手工设计。
- 讲 MCE:把「怎么管理上下文」和「上下文里有什么」分开,双层优化。内层给定 skill 找最优上下文,外层比较不同 skill 选最优机制。记的内容和记的方法一起进化。
- 讲 Meta-Harness:再深一层,优化对象是决定信息如何存储、检索、呈现的代码本身。Proposer 是一个编码 Agent,输出 Pareto 前沿上的 Harness 候选集。最通用,但每改一版都要完整试运行打分,计算最重。
- 先承认问题真实:这就是奖励黑客,自我改进循环里最危险的反模式。优化单元测试会过拟合测试用例,优化评判模型会学会钻空子,优化 benchmark 分数会利用 benchmark 漏洞。
- 给边界原则:评估器和权限控制必须放在进化循环之外,由人类或不可篡改的独立机制维护。出卷人和改卷人必须独立于被考的学生本人。可编辑面要有界,改到 OS 系统配置这种层级就等于打破了抽象边界。
- 给验证机制:参考 Self-Harness 的三阶段循环。Weakness Mining 从失败轨迹聚类出失败模式,Harness Proposal 提出有界编辑,Proposal Validation 用 held-in 和 held-out 数据集验证,只接受没有回归的编辑。
- 给能力前提:STOP 的实验证明递归结构本身不保证改善。GPT-4 能持续进步,弱模型反而放大噪声、不进反退。上这套系统之前,先评估基座模型撑得住元级优化。
- 先给概念坐标:RSI 的设想从 Good(1965)到 Yudkowsky(2008)就有了,指系统用自己当前的智能去改善产生智能的机制本身。它当了几十年理论概念,近两年才有了现实路径。
- 说清现实路径:模型没有直接改写自己的权重。它改进的是围绕自身的 Harness:上下文管理、工作流、工具编排、评估。更好的 Harness 催生更强模型,更强模型又反过来简化 Harness,形成正反馈飞轮。
- 给进展的真实水位:STOP 证明了改善器能递归改善自己,还自动发现了遗传算法、Beam Search 这类经典策略;Self-Harness 让 Agent 通过挖弱点、提编辑、验证回归来改进自己的配置。但这些都发生在有界、可验证的循环里。
- 正面回答失控问题:离失控还隔着七道关:弱评估器让反馈信号模糊、记忆生命周期管不好、奖励黑客、多样性坍缩、长期健康难以度量。这些是根本性的系统设计挑战,共同解法都指向把人类留在循环里,在正确的抽象层级提供监督。
- 报出五级阶梯:指令 Prompt → 结构化上下文 → 工作流 → Harness 代码 → 优化器代码。调 prompt 只是 Level 1,这条线的尽头是优化「写优化器的代码」。
- 说清上移逻辑:模型越智能,能优化的目标就越复杂、方法越通用。ACE 在优化上下文内容,AFlow 在搜索工作流,Meta-Harness 在改 Harness 源码,STOP 在优化改进器本身,每一级都有代表工作。
- 给 PM 判断:先看清团队现在卡在哪一级。大多数团队还在 Level 1 和 Level 2 之间,往上走每一级,对评估体系的要求都会陡增。
- 先定位角色:父 Agent 是进程管理器,干四件事:启动子任务、检查日志和进度、取消失败的分支、合并成功的结果。这是操作系统层面的思维。
- 讲显式可检查:并行不能发射后不管。父 Agent 要能随时查看每个子 Agent 的状态、输出和错误。
- 讲输出持久化:子 Agent 的结果要存成文件、日志或状态记录,别只回传到父 Agent 的上下文里。这样即使中断也能恢复。
- 讲容错兜底:后台任务会超时、崩溃、产出低质量结果,Harness 要预先设计重试策略和优雅降级机制。
- 先给分工原则:上下文是工作记忆,文件系统是长期记忆。当前任务指令、即时工具结果、最近 2-3 轮对话放上下文;历史实验结果、错误日志、已完成子任务的摘要、长期策略放文件。
- 讲制品现实:长任务的制品(实验日志、代码 diff、论文摘要、错误追踪、完整执行轨迹)会迅速超出上下文窗口,全塞进 prompt 是结构性的死路。
- 给设计理由:文件读写是 LLM 的基础技能,不需要复杂的外部工具链,还受益于基座能力提升:模型越聪明,文件管理越高效。外挂记忆系统吃不到这个红利。
- 讲工作习惯:好的 Agent 会自己维护 scratchpad、todo 列表、实验记录,像人类程序员一样管理工作区。
- 给适用三条件:进化搜索起作用要同时满足:搜索空间庞大且离散、梯度不可用但评估容易、fitness 能量化成数字。三条都占才值得上。
- 给不适用清单:评估一次要数小时、评估标准模糊主观、主要靠启发式判断、算力预算有限、需要人工审核环节。占了任何一条,先别碰。
- 对照自家业务:关键问题是咱们的 Agent 任务有没有能自动打分的评测集。没有的话,第一步是建评测,优先级比上进化算法高得多。
- 给参照系:DGM 用进化把 SWE-bench Verified 从 20% 提到 50%,但那是编码任务,测试通过与否天然可自动评估。先确认自己的任务有没有这种「秤」。
- 先摆机制:ACE 维护一份结构化的 bullet point 剧本,每条有 identifier 和 description。Generator 照剧本干活,Reflector 从成败轨迹提炼洞察,Curator 负责把洞察写回剧本。
- 讲关键设计:Curator 输出结构化的 (identifier, description) 条目,用确定性逻辑合并进剧本,从不重写整块 prompt。
- 说清理由:让模型迭代重写整块内容会带来上下文坍缩和简洁偏差,有用的细节会被一遍遍压没。增量合并加定期精炼去重,经验越用越精,上下文却不会越用越厚。
- 点出局限:ACE 的更新规则仍靠手工设计,这正是 MCE 接着往下解的问题。
- 先定义 skill:一个 MCE skill 定义上下文函数 c = F(x; ρ)。ρ 是静态组件(prompts、知识库、代码库),F 是动态算子(搜索、选择、过滤、格式化)。管上下文的方法本身被形式化了。
- 拆开双层:内层给定 skill,在训练集上找最优上下文;外层在验证集上比较不同 skill,选出最优机制。先优化内容,再优化方法,轮流来。
- 讲进化方式:系统维护 skill 数据库记录每组 (skill, context, 训练分, 验证分),Meta-agent 用 agentic crossover 从历史里杂交出新 skill。
- 对比 ACE:ACE 的更新规则手工设计、固定不变;MCE 把「怎么记」也放进优化循环,记的内容和记的方法一起进化。
- 讲存储结构:每个提出的 harness 在文件系统里就是一个字典:源码、分数、轨迹、状态更新。历史不进 prompt,全部落盘。
- 讲访问方式:Proposer 本身是编码 Agent,用 grep、cat 按需读取执行历史,要哪段查哪段,避免全塞进上下文。
- 讲输出形态:产出的是 Pareto 前沿上的 harness 候选集合,多目标之下保留一组各有所长的方案,可以按场景挑。
- 承认真瓶颈:撑不住的地方在评估侧:每改一版 harness 都要完整试运行打分,Meta-Harness 是三种上下文优化方法里最通用也计算最重的。
- 先讲表示:工作流表示成有向图,节点是 LLM 调用动作,边是代码里的逻辑操作(条件分支、循环、数据传递)。设计问题就此变成了树搜索问题。
- 讲搜索循环:初始工作流做根节点;用分数与均匀探索的软混合选待扩展节点,平衡利用与探索;LLM 生成修改变体(增删改节点和边);执行评估,有改进就加回搜索树。
- 答终止条件:循环到 top-k 平均分稳定,或者计算预算用完。
- 给定位:对比 ADAS 靠 meta-agent self-refine 自由发挥,AFlow 用 MCTS 做系统化搜索,收敛更稳定,实验上也优于手工设计和 ADAS。
- 报出管线:提出研究想法 → 写代码 → 跑实验 → 分析结果 → 写论文 → 同行评审,六步全由 LLM 驱动,端到端跑完一轮完整研究循环。
- 讲评审环节:评审引入 LLM-as-judge 做质量把关,产出的论文格式完整。
- 给现实检验:能写论文远够不上能做科学。系统测试发现六种反复出现的失败模式:训练数据默认值偏好、执行压力下的实现漂移、记忆与上下文退化、过度乐观、领域智能不足、科学品味薄弱。
- 下判断:这些是结构性瓶颈。专家设计的 Harness 确实能协调研究循环的大部分环节,但环节里的判断质量还差得远。
- 报角色体系:四个角色协作:Challenger 出题,Weak Solver 和 Strong Solver 分别试解,Verifier / Judge 仲裁。
- 给核心判据:难度差就是质量信号:只保留 strong solver 能做出、weak solver 做不出的题。
- 说清为什么:两个都会的题没有训练价值,两个都不会的题可能本身就是烂题。落在能力边界上的题,对提升模型价值最大。
- 给 PM 迁移:这套「用两个能力档位夹出难度带」的思路,可以直接搬到评测集建设和训练数据分级的设计上。
- 先纠正对象:STOP 不直接改善解 s,它反复改善的是产生更好解的「改善器」I 本身。种子改善器接受初始解、效用函数、黑盒模型三个输入,返回改善后的解。
- 讲递归的钥匙:改善器本身也是文本(一段 prompt 或代码),所以同样的改善逻辑能作用在改善器自身上:I_t = I_{t-1}(û, I_{t-1}; M),让今天的自己去升级昨天的自己。
- 给实验答案:真能变好,但有门槛。GPT-4 驱动时持续改善,还自动发现了遗传算法、分解改进、多臂 Prompt Bandit、模拟退火、Beam Search 这些经典优化策略;GPT-3.5 和 Mixtral 驱动时反而退化。
- 给结论:递归结构给的只是改善的可能性,收敛没有保证。弱模型在元级操作里缺编程直觉,只会放大噪声。
- 给出方法名:Self-Harness 的第一阶段就叫 Weakness Mining:把失败轨迹聚类成 verifier-grounded 的失败模式,从个案上升到模式。
- 讲记录规格:每条失败记录三件套:终端验证器级的失败原因、相关 Agent 行为的因果状态、轨迹暴露的抽象 Agent 机制。有这三样,失败才是可寻址的。
- 讲下游用法:提案阶段优先挑可寻址的重复错误模式下手,改一处修一类,避免头痛医头。
- 给 PM 落点:失败轨迹库怎么建、按什么维度聚类,这是 PM 现在就能推动的基建,方法可以直接照搬。
- 给验证机制:Self-Harness 第三阶段 Proposal Validation 用 held-in 和 held-out 两套数据集验证候选编辑,只接受没有回归的编辑。改进不许以牺牲已有能力为代价。
- 讲编辑范围:提案本身就是有界 Harness 编辑。模型拿到的是可编辑面、失败模式摘要、通过行为记录、已尝试编辑的历史,出手之前就被框住了。
- 给实验证据:Terminal-Bench-2 上对 MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5 做实验,Self-Harness 给每个模型学出了模型特定的 harness 指令。
- 说产品含义:同一框架对不同基座产生不同优化路径,说明 harness 改进是上下文敏感的。换模型时 harness 配置照搬不得,要重新跑一轮优化。
- 先给方向:答案在七道关的最后一关:人类在栈中向上移动,继续留在循环之中。AI 接管执行层,人的价值上移到设定目标、判断方向、守住底线。
- 给具体职责:有几样必须由人维护:评估器和权限控制要放在改进循环之外;可编辑面的边界要人来划;哪个问题值得解要人来定义。
- 给证据:自动研究的六种失败模式里,「科学品味薄弱」和「领域智能不足」恰好是人的长板:判断问题值不值得问、掌握写不进文档的隐性知识。
- 收个态度:引用课程结尾那句话:人是系统不可或缺的方向盘,从来都不是要被替代的瓶颈。监督要发生在正确的时间和正确的抽象层级。
- 先讲对象:DGM 显式针对可编辑的 harness 代码仓库进化,Agent 被允许修改自己的 harness 代码,这一点比 AlphaEvolve 改别人的程序更激进。
- 讲循环:从池中一个 coding agent 开始;按性能概率选父代;父 agent 检查自己的 benchmark 评估日志、提出改进方案;变异出新 agent;评估后性能够高才进池;循环到停止条件。
- 报出数字:基于 Claude 3.5 Sonnet,SWE-bench Verified 从 20% 提到 50%,Polyglot 从 14.2% 提到 30.7%,全程无人类介入。
- 补工具面:工具集朴素得惊人:bash 加 editor(view / create / edit)。说明威力在循环设计上,用不着花哨的工具。
- 讲 Promptbreeder:用丰富的变异操作进化 task-specific prompts。关键创新是元进化:变异 prompt 本身也通过进化改进,连改法都在进化。
- 讲 GEPA:把 reflection-based prompting 和进化搜索结合:Agent 先反思当前 prompt 的不足,再用进化算子产生候选改进,最后择优。
- 给历史位置:两项工作是 prompt 进化的先驱,为后来更大规模的 Harness 进化(AlphaEvolve、DGM)奠定了基础。它们证明了文本可进化,后来者把可进化对象扩到了代码和整个 harness。
- 回答值不值:值得。看懂了元进化这个内核,再读新论文全是似曾相识。
- 先讲机制:这就是 SIA 的做法,三个角色进同一优化循环:Meta-Agent 提出新 harness 设计,Task-Specific Agent 在新 harness 下执行任务,Feedback-Agent 根据结果决定下一步更新 harness 还是更新模型权重。
- 给评价:方向有趣,但证据暂时性。两大开放挑战没解:训练稳定性,以及 Goodhart 效应,优化代理指标导致真实目标退化。
- 打比方说风险:一边改赛车引擎一边改赛道,两边同时变化,出了问题都不知道该归因给谁。
- 给建议:短期内 harness 优化和权重训练分开跑更稳,等单侧循环都收敛可控了,再谈联合。
- 讲主循环:维护一个候选程序池,用冻结的 LLM 生成代码 diffs 改进程序,反复评估子程序、保留表现最好的。模型全程不训练,提升全部来自搜索循环。
- 拆 prompt 设计:进化 prompt 由父程序、评估结果、指令、元信息共同构成;用 EVOLVE-BLOCK 标记显式圈出可改进区域,把搜索约束在划定范围内。
- 讲 meta-prompt:指令和上下文本身也参与共同进化,不会固定不变。
- 引消融实验:进化流程、上下文 prompt、meta-prompt、全文件进化、更强 LLM,消融证明各自有独立贡献。值得抄的正是这种每个组件都验证过必要性的做法。
- 讲成本大头:搜索类方法的开销集中在评估:每一轮都是 LLM 推理加代码执行加基准测试,代数越多越烧。计算效率(每代要多少次评估)和进化效果(每代提升多少)怎么平衡,学界都还是开放问题。
- 给贵贱排序:ACE 式结构化上下文维护最轻,跑在正常任务流里;MCE 双层要多养一层 skill 进化循环;Meta-Harness 每改一版都要完整试运行打分,三者里计算最重。
- 给投入节奏:先上 ACE 式维护把长任务稳住,再建能自动跑的评测集,评测立住了才评估要上搜索类方法的哪一档。
- 给止损线:评估一次要数小时、指标主观、预算有限,这三条占了就停在轻量档。这也是课程里明确列出的进化搜索不适用场景。
- 先给立场:要存。知道什么行不通和知道什么行同样重要,研究 Harness 应该让失败的尝试和死胡同易于保存和检索。
- 讲为什么难:科学文献严重偏向成功案例,LLM 可能不擅长决定何时放弃假设、何时坦诚报告负面结果。这个偏差会被自动研究系统原样继承。
- 讲怎么存不带偏:负面结果的用途是剪枝,标注清楚试过什么、怎么失败的、原因是什么,Agent 检索到就不再重走死胡同。Self-Harness 给提案器喂「已尝试编辑的历史」就是同一逻辑。
- 连回失败模式:自动研究的「过度乐观」毛病(宣称显著优于基线、实际全是噪声),恰恰说明系统缺少坦诚记录负面结果的习惯。
- 先给分类框架:七道关分四类:评估相关、数据与记忆、安全与稳定性、人类角色。按类报,不容易漏。
- 过评估与记忆:弱且模糊的评估器(很多目标没有快速精确的验证器,反馈信号是糊的);上下文与记忆生命周期(记忆需求随自主性爆炸增长,上下文工程应该成为智能本身的核心部分);负面结果(失败尝试要易于保存和检索)。
- 过安全三关:多样性坍缩(候选挤成微小变体,创新停止)、奖励黑客(过拟合测试、钻评判模型空子、利用 benchmark 漏洞)、长期成功(只顾测试通过,忽视可维护性、所有权边界、迁移成本、向后兼容)。
- 收人类角色:第七关是人的位置:在正确的时间、正确的抽象层级提供监督。这七条是根本性的系统设计挑战,别当成普通工程问题排进迭代就完事。
- 「现在就用」层:三大设计模式(自动化循环、文件系统记忆、子 Agent 并行)已经是 Claude Code、Codex、Cursor 的标配,覆盖最强 Agent 系统 90% 的架构决策,照着搭就行。
- 「下季度可试」层:ACE 式结构化上下文维护。Generator、Reflector、Curator 是清晰的工程管线,前提是先有评测集验证收敛。
- 「有条件上」层:AFlow、DGM 这类搜索方法,要满足评估自动化、fitness 可量化、算力充足。编码类任务最先受益,DGM 的 SWE-bench 数字就是在这种条件下跑出来的。
- 「持续观察」层:SIA 联合优化的训练稳定性未解,Meta-Harness 计算最重,都还在证据暂时性的阶段,跟进论文就好。
- 讲病理:进化算法和 RL 循环天然倾向于利用已知的高奖励模式,短期分数很好看,问题被掩盖。
- 讲症状:种群里所有候选解坍缩成同一方案的微小变体,新一代和上一代长得越来越像,创新就停了。课程的比方很贴切:全班都抄第一名的作业,分数好看,但再没人想出新解法。
- 给解药:需要专门机制防止解空间坍缩:多样性奖励、档案保持。
- 给监控建议:光盯分数曲线看不出坍缩,还要度量种群内方案的差异程度。差异趋零就是警报,它比分数下跌来得早得多。
- 先给病根:这就是七道关里的「长期成功」:当前优化目标太短期,编码 Agent 能完成眼前任务,但不够清楚怎么保护仓库的长期健康。
- 列测不出的东西:标准沙箱 RLVR 训练很少捕获可维护性、所有权边界、迁移成本、向后兼容性。这些恰恰是人审在把的关。
- 给风险画面:只追求测试通过的 Agent,可能在技术债里埋定时炸弹。炸弹爆的那天,不会写在任何一份测试报告里。
- 给折中方案:审查可以换形态:常规改动轻量审,架构层改动重点审。人往上移,盯所有权边界和长期结构,逐行检查交给工具。
「Harness 与自我改进 · 30 道灵魂拷问」为什么能找到相关内容
「每题附考察意图、答题框架与加分点:Harness 本质 / 设计模式 / 上下文自动进化 / 奖励黑客 / RSI 进展与风险」把检索问题从“把资料存起来”推进到“怎样找到真正相关的资料”。这一步决定了 RAG、推荐和以图搜图最后交给模型的输入质量。
相似度不是答案,召回之后还要核对
在「每题附考察意图、答题框架与加分点:Harness 本质 / 设计模式 / 上下文自动进化 / 奖励黑客 / RSI 进展与风险」对应的流程里,Embedding 负责把对象放到可比较的语义空间,近邻索引负责减少搜索范围,最终的回答仍然依赖召回片段是否覆盖问题、距离指标是否合适,以及内容有没有过期。
- 先给定义: Harness 是围绕基座模型的运行时系统,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储制品、评估结果。模型负责智能,Harness 负责让智能落地干活
- 给证据: Claude Code、Codex、Cursor 这些成功产品已经证明,Harness 层与原始模型智能同等重要。一个平庸的模型加上优秀的 Harness,往往胜过裸露的更强模型
- 说清 PM 视角的含义: 换模型很容易,Harness 才是产品真正的护城河。同一个模型,Harness 设计得好坏,用户体验差几个量级
先区分找得到和找得准
把「每题附考察意图、答题框架与加分点:Harness 本质 / 设计模式 / 上下文自动进化 / 奖励黑客 / RSI 进展与风险」落成一次小测试:准备几条有明确答案的查询,记录召回的相关性、遗漏和无关结果,再决定是否需要换切分方式、索引或重排。
从这个例子继续往下看
这篇内容先从「先给定义: Harness 是围绕基座模型的运行时系统,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储制品、评估结果。模型负责智能,Harness 负责让智能落地干活」展开,再把问题推进到「给证据: Claude Code、Codex、Cursor 这些成功产品已经证明,Harness 层与原始模型智能同等重要。一个平庸的模型加上优秀的 Harness,往往胜过裸露的更强模型」。把这两个片段放在一起看,可以更清楚地分辨:哪些是文章给出的事实,哪些是需要结合条件才能成立的判断。
把这条判断带到下一个场景
检索系统也可以这样看:先确定什么算相关,再观察召回是否覆盖问题,最后检查排序、切分和时效性有没有把真正有用的内容挤出去。
- 「Harness 与自我改进 · 30 道灵魂拷问」:先给定义: Harness 是围绕基座模型的运行时系统,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储制品、评估结果。模型负责智能,Harness 负责让智能落地干活
- 「继续往下看」:给证据: Claude Code、Codex、Cursor 这些成功产品已经证明,Harness 层与原始模型智能同等重要。一个平庸的模型加上优秀的 Harness,往往胜过裸露的更强模型
- 「最后的要点」:报出三大模式: 工作流自动化、文件系统做持久记忆、子 Agent 与后台任务。它们覆盖了当前最强 Agent 系统 90% 的架构决策,是结构性需求,没有可选余地
最后的「最后的要点」把讨论落到「报出三大模式: 工作流自动化、文件系统做持久记忆、子 Agent 与后台任务。它们覆盖了当前最强 Agent 系统 90% 的架构决策,是结构性需求,没有可选余地」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。