工程进阶

可靠 Agent 的工程模式

学习上下文装配、工具设计、评测、长任务和沙箱隔离等生产级模式。重点是:当 Agent “碰巧成功”时,你能找到并检查边界。

22 篇札记开放阅读 · 无需登录
工程进阶22篇札记

本页解决的问题

先给结论

「可靠 Agent 的工程模式」AI 学习路径适合解决什么问题?

学习上下文装配、工具设计、评测、长任务和沙箱隔离等生产级模式。重点是:当 Agent “碰巧成功”时,你能找到并检查边界。 路线包含 22 篇免费札记,每篇聚焦一个可以独立搜索、理解和验证的问题。

判断标准

核心主题包括:Agent 设计模式、工具设计的艺术、Agent 评测、长运行 Agent。

下一步

从「Workflow vs Agent:先搞清楚你要什么」开始,再按当前任务选择下一篇。

常见误区

不要为了完成目录而跳过实践;能用自己的例子解释一个取舍,比读完更多标题更重要。

这条路径会练什么

从第一篇打开

每个章节都围绕一类真实决策展开。可以顺着走,也可以从正在处理的工作切入。

22篇札记
01Workflow vs Agent:先搞清楚你要什么预定义流程 vs 模型自主决策,Anthropic 定义的两大类 Agent 系统设计模式3 min02五种 Workflow 模式Prompt Chaining / Routing / Parallelization / Orchestrator-Workers / Evaluator-Optimizer设计模式3 min03从 Prompt 工程到上下文工程在每一轮推理时策展最优的 Token 组合,写好提示词只是其中一环方法论3 min04上下文的三板斧Compaction、结构化笔记、子 Agent 架构,长任务的三种上下文管理策略方法论3 min05ACI:Agent-Computer Interface工具是 Agent 和世界之间的契约。像设计人机界面一样设计 Agent 界面设计模式3 min06Milvus 作为 Agent 知识库工具把向量检索封成 search_knowledge:ToolMessage、记忆分层与调用/不调用的测试实战3 min07Think Tool:让 AI 先想后做在复杂工具链中给 Agent 一个暂停思考的空间,τ-bench 性能提升 54%深入3 min08用 Agent 优化 Agent 的工具Claude Code 实践:用 AI 写工具描述、跑评测、自动迭代优化实战3 min09为什么评测比训练更重要没有评测,修一个 bug 制造三个。Anthropic 的 Eval 方法论方法论3 min10三种 Grader:代码、模型、人工静态断言 vs LLM-as-Judge vs 人工校准,每种适合什么场景实战3 min11评测的坑:噪音、作弊与退化基础设施噪音可造成 6pp 误差、模型会识别考试、改 Prompt 可能让 Eval 掉 3%案例3 min12为什么 Agent 跑不了长任务一口气做太多、做完就收工,两种典型失败模式案例3 min13Initializer + Coding Agent初始化 Agent 搭环境、编码 Agent 增量推进,双角色 Harness 设计设计模式3 min14Managed Agent:脑手分离把思考和执行拆到不同进程,像操作系统一样虚拟化 Agent架构3 min15Session ≠ Context Window会话日志是持久的事件流、上下文窗口是临时的工作记忆,两者必须分离深入3 min16三类风险:滥用、失控、外部攻击Anthropic 的安全分类框架:用户滥用 / 模型 Misbehavior / Prompt Injection安全3 min17沙箱与凭证隔离生成的代码和密钥永远不在同一个容器里。结构性安全比靠提示词更可靠安全3 min18Contextual Retrieval:更好的 RAG在检索前先给 Chunk 加上下文,Anthropic 的 RAG 升级方案深入3 min19进阶全景图设计模式、工具、评测、长运行、安全,一张图串起来汇总3 min20做最简单的、能跑的东西Anthropic 的核心工程哲学:"Do the simplest thing that works"收官3 min21搭你的第一个评测集改动前后跑分对比演示;三档任务:攒十条真实用例、写通过标准跑基线、用分数说话实战3 min22AI 工程设计模式 · 30 道灵魂拷问每题附考察意图、答题框架与加分点:上下文工程 / 长任务 / grep vs RAG / ACI 工具设计 / 评测基建 / LLM-as-Judge / 沙箱隔离考察4 min