工程进阶
可靠 Agent 的工程模式
学习上下文装配、工具设计、评测、长任务和沙箱隔离等生产级模式。重点是:当 Agent “碰巧成功”时,你能找到并检查边界。
工程进阶22篇札记
本页解决的问题
先给结论「可靠 Agent 的工程模式」AI 学习路径适合解决什么问题?
学习上下文装配、工具设计、评测、长任务和沙箱隔离等生产级模式。重点是:当 Agent “碰巧成功”时,你能找到并检查边界。 路线包含 22 篇免费札记,每篇聚焦一个可以独立搜索、理解和验证的问题。
判断标准
核心主题包括:Agent 设计模式、工具设计的艺术、Agent 评测、长运行 Agent。
下一步
从「Workflow vs Agent:先搞清楚你要什么」开始,再按当前任务选择下一篇。
常见误区
不要为了完成目录而跳过实践;能用自己的例子解释一个取舍,比读完更多标题更重要。
这条路径会练什么
从第一篇打开
每个章节都围绕一类真实决策展开。可以顺着走,也可以从正在处理的工作切入。
01Workflow vs Agent:先搞清楚你要什么预定义流程 vs 模型自主决策,Anthropic 定义的两大类 Agent 系统↗02五种 Workflow 模式Prompt Chaining / Routing / Parallelization / Orchestrator-Workers / Evaluator-Optimizer↗03从 Prompt 工程到上下文工程在每一轮推理时策展最优的 Token 组合,写好提示词只是其中一环↗04上下文的三板斧Compaction、结构化笔记、子 Agent 架构,长任务的三种上下文管理策略↗05ACI:Agent-Computer Interface工具是 Agent 和世界之间的契约。像设计人机界面一样设计 Agent 界面↗06Milvus 作为 Agent 知识库工具把向量检索封成 search_knowledge:ToolMessage、记忆分层与调用/不调用的测试↗07Think Tool:让 AI 先想后做在复杂工具链中给 Agent 一个暂停思考的空间,τ-bench 性能提升 54%↗08用 Agent 优化 Agent 的工具Claude Code 实践:用 AI 写工具描述、跑评测、自动迭代优化↗09为什么评测比训练更重要没有评测,修一个 bug 制造三个。Anthropic 的 Eval 方法论↗10三种 Grader:代码、模型、人工静态断言 vs LLM-as-Judge vs 人工校准,每种适合什么场景↗11评测的坑:噪音、作弊与退化基础设施噪音可造成 6pp 误差、模型会识别考试、改 Prompt 可能让 Eval 掉 3%↗12为什么 Agent 跑不了长任务一口气做太多、做完就收工,两种典型失败模式↗13Initializer + Coding Agent初始化 Agent 搭环境、编码 Agent 增量推进,双角色 Harness 设计↗14Managed Agent:脑手分离把思考和执行拆到不同进程,像操作系统一样虚拟化 Agent↗15Session ≠ Context Window会话日志是持久的事件流、上下文窗口是临时的工作记忆,两者必须分离↗16三类风险:滥用、失控、外部攻击Anthropic 的安全分类框架:用户滥用 / 模型 Misbehavior / Prompt Injection↗17沙箱与凭证隔离生成的代码和密钥永远不在同一个容器里。结构性安全比靠提示词更可靠↗18Contextual Retrieval:更好的 RAG在检索前先给 Chunk 加上下文,Anthropic 的 RAG 升级方案↗19进阶全景图设计模式、工具、评测、长运行、安全,一张图串起来↗20做最简单的、能跑的东西Anthropic 的核心工程哲学:"Do the simplest thing that works"↗21搭你的第一个评测集改动前后跑分对比演示;三档任务:攒十条真实用例、写通过标准跑基线、用分数说话↗22AI 工程设计模式 · 30 道灵魂拷问每题附考察意图、答题框架与加分点:上下文工程 / 长任务 / grep vs RAG / ACI 工具设计 / 评测基建 / LLM-as-Judge / 沙箱隔离↗