Agent 范式入门 · 词汇 + 三子学科
5 节 · 13 个 Agent vocabulary primitives(Agent Loop / Reasoning / Planning / Skills / Memory / Subagent / Multi-Agent 等)+ Prompt/Context/Harness Engineering 三子学科定位。Cross-roadmap discipline:只教 vocab,engineering 归 #8。
这一章是 Stage 2 · LLM 零件的最后一章,约 1.5 小时,全 Mode A 没有 Mode B 视频。我们把 Agent 圈子里那一堆术语 Agent Loop / Reasoning / Planning / Skills / Memory / Subagent / Multi-Agent / Prompt / Context / Harness Engineering 拉成一段可读懂的 vocabulary 入门。关键纪律按 cross-roadmap-check Section 4:本章只给你"什么是 X / 长什么样 / 看到能识别",不教任何 production engineering。harness 怎么设计、context 怎么 engineer、trajectory 怎么 eval,全归 #8 Agent 工程。读完进 #8 时,这些词不用再花时间扫盲。
为什么这章没 Mode B 视频,我们待会会展开。简短版:Agent 领域目前没有合格的独立教学视频,产品演示不等于系统讲解,优秀的资源都是文档加代码加论文。所以我们 Mode A 必须扛起,用 narrative 把 13 概念加 3 子学科串成一段可读的导览。DeepSeek Agent Harness PM JD 把 13 概念加 3 子学科 verbatim 列为 PM baseline,PM 都要懂的,你作为后续路书的 builder / researcher 当然更要懂。
为什么 vocabulary 优先?
让我用一个真实场景开篇。假设你在跟一位前沿实验室的 production engineer 聊天,他说:
"我们的 trajectory eval 表明 sub-agent handoff 的 context loss 是主要 failure mode。我们试过用 Reflexion 加 critic step,但 ReAct trace 里 reasoning 段过长导致 tool call 准确率反而降。最后我们改了 harness 让 Planner 用 Opus、Executor 用 Haiku,trajectory token cost 降了 6 倍,success rate 持平。"
如果你脑子里没 Agent vocabulary,这一整段话你听了等于没听,大概知道在讲 AI Agent,但每个词都模糊。如果你脑子里有 Agent vocabulary,这段话你能立刻 grounded:哦,他们在做 multi-agent 系统,用 trajectory 评估发现子 agent 之间传递上下文丢失,试过反思机制但思考过程太长拖垮工具调用,最后通过规划 / 执行分工加模型混搭降本。这就是 vocabulary 的入场价值。它不让你会做 Agent,那是 #8 的事;它让你听得懂 Agent 行业的日常表达。
行业的 vocab 是入场卡。听一段话要么 grounded 立刻有画面,要么脸盲听了等于没听。这一章把所有会在 #8 / 招聘 JD / 业界博客里高频出现的 Agent 术语扫一遍,让你不再脸盲。每个概念给三件事:一句精准定义、它跟你已学概念的关系、一个 LLM Agent 场景示例。不是字典式定义堆砌,是把每个词嵌入到你脑子里现有的 mental model 上,这样你能记住,也能在听别人讲 Agent 时立刻 retrieval。放到 Ch 1 的时间线上看,这一整套 Agent 词汇之所以现在突然成了入场卡,是因为 Agent 本身在 2024-2025 才从 2023 年那批跑几步就飞的玩具 demo(AutoGPT 那一波)长成真正可用的系统——工具化给了它真实能力、推理模型让它决策更稳(Ch 1 认知七)。词汇会爆发,是一个领域刚成熟的副产品。
1. Agent Loop 周边 · 6 个概念
Agent 系统的核心是循环。Ch 3 你拿到的是单次 LLM call 的 vocabulary(token / API / prompt / tool)。Agent 把单次 LLM call 升级为自主决定下一步动作的循环系统。这一节 6 个概念围绕这个循环展开。
1.1 Agent · 智能体
Agent 是能够基于目标、上下文、工具、状态自主决定下一步动作的软件系统。跟你已学概念的关系:Agent 把 Ch 3 学的 token/context、API/prompt、function/tool/mcp、embedding/rag 组装成一个会自己往前推进的循环。所以 Agent 不是新原语,是组合。它的所有底层 mechanism 都是你已经学过的,新的只是组合方式加循环结构。
具体场景:Claude Code / Cursor / Codex / Manus 都是 Agent。你跟 Claude Code 说"帮我重构这个 module",它自己决定:先 read_file 看看长什么样,提议方案,你 OK 之后 write_file,再 run_tests 验证。每一步它都在判断下一步该干嘛,这个判断循环就是 Agent 的本质。跟单纯 LLM 对话比,Agent 的关键区别是自主性加跟外部世界交互。LLM 对话只产生文字,Agent 用工具改变文件、改变数据库、改变世界。这种副作用能力加自主决定能力,把 LLM 从对话伙伴升级到自主执行者。
1.2 Agent Loop · Agent 的核心循环
具体说,Agent 的内部机制叫 Agent Loop:模型推理,工具调用,结果回填,再推理,直到完成。展开成 5 步:
1. 模型读 prompt(含可用工具列表 + 历史)
2. 模型输出:或者 final answer,或者 tool_use(要调某工具)
3. 如果 tool_use,你的代码执行那个工具
4. 工具结果作为 tool_result 塞回 prompt
5. 回到第 1 步,直到模型输出 final answer / 或达到终止条件跟已学概念的关系:Agent Loop 是 Ch 3 学的 context grows over time(每轮历史累积)加 tool use(协议循环)的组合应用。每转一圈,context 长一截,加了一次 tool_use 加 tool_result。所以 Agent Loop 直接继承 token 经济学的所有约束:转太多圈 context 爆炸,cost 失控。具体场景:你问 Claude "今天 Anthropic 股价怎么样",模型决定调 search_web 工具,工具返回 "Anthropic 是私人公司,无股价",模型据此回答 "Anthropic 没上市,你可能想问其他公司"。两步 loop,一个 turn 结束。跟 Ch 3 学的 tool use 一次循环比,Agent Loop 关键加了自主重复:模型自己决定要不要再调一个工具,自己决定什么时候 final answer,自己决定要不要停。这个自主决定循环走多久的能力,需要后面 1.4 节的 termination 机制保障。
1.3 Step / Turn / Trajectory · 三种粒度的 Agent 行为
这三个词初学者最容易混,但它们是不同粒度的同一类东西。Step 是 Agent 执行过程中的一个动作单位,一次模型调用是一个 step,一次工具调用是一个 step。Turn 是用户和模型之间的一轮交互,用户说一句加上 Agent 完成一系列 step 后返回结果等于一个 turn。Trajectory 是 Agent 从开始到结束的完整过程记录,包括所有 step、所有 tool 调用、所有结果、错误、最终输出。
让我用一个具体例子把三者拉开。你跟 Claude Code 说"帮我加一个 dark mode toggle",Claude Code 走 5 个 step:
- read tailwind config(step 1: tool call)
- read button component(step 2: tool call)
- 内部推理决定怎么改(step 3: LLM call)
- write new theme provider(step 4: tool call)
- write summary(step 5: LLM call)
这 5 个 step 加起来组成 1 个 turn,用户问了一个问题,Agent 给出了一个完整回应。如果你跟 Claude Code 连续问了 10 个问题,他帮你做了 10 件事,这 10 个 turn 合起来,每个 turn 内部 N 个 step,所有 step 的输入输出加时间戳加错误信息加最终答案,合起来构成 1 个 trajectory。类比:Step 是厨师切菜、翻炒、装盘的单个动作。Turn 是客人点了一道菜,厨师做完端上等于一个 turn。Trajectory 是一晚上厨师做的所有菜加客人反馈加失败重做的完整记录。
为什么要区分?因为 eval Agent 的粒度不一样。Step-level 看每一步是否合理。Turn-level 看一次回应是否解决用户问题。Trajectory-level 看长跨度任务是否完成。Trajectory 是 #8 trajectory eval 的对象,但本路书不教 eval engineering,你 grounded 在这三个词的语义就行。
1.4 Termination · 终止条件
回到 1.2 节,Agent Loop 是循环,循环必须能停,否则就是定时炸弹。Termination 是 Agent Loop 停下来的条件。常见有 5 种:
- 模型自己说"完成"(输出 final answer 不再调工具)
- 达到 max iterations(预设最多循环 N 次)
- 达到 budget 上限(token / 时间 / 工具次数 / 成本)
- 用户中断(用户主动停)
- 致命错误(unhandled exception)
为什么这件事关键?因为模型有时会陷入死循环,调工具看结果觉得不够再调一次,一晚上跑掉几千美元 token。这不是 hypothetical scenario,是 production Agent 系统真实事故的高频来源。Production Agent 必须有多重终止保护:max_iterations=20 加 max_cost=$5 加 timeout=10min,三个任一触发就停。这是 production Agent 的最低配置,缺一不可。这是为什么 1.2 节的 Agent Loop 那个简化流程里"直到达到终止条件"这一句不是装饰,它是 production Agent 的生死线。
1.5 Planner / Executor · 规划与执行的分工
很多 Agent 架构把思考下一步和执行下一步分成两个角色,这是 multi-step 任务的常用 pattern。Planner 负责把大任务拆解成步骤,可以是一个独立的 prompt,也可以是一个更强的模型(用 Opus 做 plan,用 Haiku 做 exec)。Executor 负责执行计划中的具体步骤,通常调用工具加简单决策,跑得快也便宜。跟已学概念的关系:Planner / Executor 是 Agent Loop 内的角色分工,不改变 loop 形态,改变谁来想、谁来做。
具体场景:Deep Research agent 经常用这模式。Planner 看用户问题"分析特斯拉 2025 Q3 财报",拆成 5 个子任务(查数据、找分析师评级、看股价、整理财务比率、起草 outline),Executor 一个个跑。Planner 看完结果再决定要不要补 step。这种分工的核心价值是 cost optimization 加 quality optimization 同时兼得。Planner 用强模型(Opus / GPT-4 / DeepSeek V3 高级)做战略层,这个层只需要少量 LLM call,成本可控;Executor 用便宜小模型(Haiku / GPT-4-mini / DeepSeek V3 轻级)做战术层,这个层 LLM call 多但单次便宜。整体 token cost 比单纯用强模型走全程低 5-10 倍,quality 持平甚至更好(因为 Planner 思考更长)。这是 #8 Agent 工程的核心 pattern,foundations 不深入。foundations 给你 vocabulary,深入设计归 #8。
1.6 ReAct · Reasoning + Acting
最后一个 Agent Loop 周边的概念:ReAct,现代 LLM Agent 的开创性范式。ReAct 是一种 Agent 模式:思考、行动、观察、再思考。模型每一步都先写一段我在想什么(reasoning),再决定动作(acting),看到工具结果(observation)后再开始下一轮思考。ReAct 来自 2022 paper(Yao et al.),是过去几年改变 LLM Agent 设计的关键论文。今天大部分 Agent 框架(LangChain / Agents SDK / claude-agent-sdk)都默认走 ReAct 或其变体。时间差值得一提:ReAct 2022 年就提出了,但 2023 年那批 agent demo 仍然跑几步就飞——直到 2024-2025 工具化与推理模型成熟,它才真正可用,这正印证 Ch 1 认知七:第一波炒作的失败常常只是配套工程还没到位,不代表方向错。跟 Agent Loop 的关系:ReAct 是 Agent Loop 的具体表现形式。Agent Loop 是抽象循环,ReAct 是其中思考要外显出来作为 prompt 的一部分的实现。
具体长这样。模型输出:
Thought: 用户问 Anthropic 股价,但 Anthropic 是私人公司。我应该先搜一下确认。
Action: search_web("Anthropic stock price")执行后:
Observation: Anthropic 是 private company,目前无公开股价
Thought: 确认了。回答用户。
Final: Anthropic 未上市,无公开股价。如果你关心 AI 公司股价,
可以看 OpenAI(也是 private)或上市的 Microsoft / Google。为什么把 Thought 外显出来?因为显式 reasoning 显著提升复杂任务的成功率。回到 Ch 2 学的 next-token prediction 本质,让模型先生成 thinking tokens,这些 thinking tokens 进入 context,后续 next-token prediction 就有了更丰富的 reasoning 基础。这就是为什么 think step by step 这种 prompt 有效,它在请求 ReAct 模式。ReAct 不是 magic,它的有效性来自一个简单事实:LLM 在 token-by-token 生成时,自己刚生成的 token 是下一个 token 的 context。让模型生成 explicit reasoning,后续 action 的 token prediction 就 condition 在那段 reasoning 上。这是 LLM 函数本质的自然应用。
2. Agent 的内部结构 · 4 个概念
Agent Loop 是骨架。Agent 的内部能力由 4 个概念定义:记忆、技能、推理与规划、多 Agent 协作。
2.1 Memory · 记忆
Memory 是 Agent 保存和复用历史信息的能力。Memory 分几层(本节给 vocabulary,不教 engineering):
| 层 | 是什么 | 存哪 |
|---|---|---|
| Short-term memory | 当前 context window 中的信息 | 模型直接看到 |
| Long-term memory | 跨 session 保留的信息(用户偏好 / 项目背景 / 历史决策) | 外部存储(DB / 文件 / 向量库) |
| Episodic memory | "发生过什么"的记录(某次任务的执行历史) | 数据库 / 日志 |
| Semantic memory | 稳定知识和事实(项目规则 / 业务定义) | 知识库 / 向量库 |
| Working memory | 当前任务中最重要的、需要随时关注的信息 | context 顶部 / system prompt |
跟你已学概念的关系:Short-term memory 约等于你在 Ch 3 学的 context window 内容,模型每次调用看到的那一段。Long-term memory 需要 embedding / RAG(Ch 3)作为检索机制,不可能把所有历史都塞进 context,所以要 selective retrieval。
具体场景四例对照着看。Claude Code 跨 session 记得你这个 repo 的代码风格,这是 long-term 加 semantic memory(稳定的项目知识)。Claude Code 记得上一次 commit 你说改了 dark mode 的几个 token,这是 episodic memory(某次具体任务的执行历史)。当前对话窗口里的内容,这是 short-term memory(正在进行的对话)。System prompt 顶部固定写 "user prefers concise answers",这是 working memory(当前任务的关键背景)。Memory engineering 怎么决定存什么、何时召回、怎么压缩、怎么 dedup,归 #8。foundations 让你识别这 5 种 memory 的差异即可。
2.2 Skills · 技能
Skills 是封装好的能力包,通常包括说明、适用场景、工具、约束、执行流程。比单纯的工具更高一层抽象,一个 skill 内部可能用多个工具配合加自己的 prompt 模板加校验逻辑。类比:工具像扳手、螺丝刀,Skill 像修自行车这件事,里面包括用扳手、用螺丝刀、知道顺序、知道何时停。
具体场景:Anthropic claude-agent-sdk 里有 Skill 这个 first-class 概念。一个 code-reviewer skill 包括:看 PR diff、跑 linter、用 prompt 模板生成 review comments、校验 comment 合理性。对 Agent 主 loop 来说,它调一个 skill 就像调一个 super-tool,但 skill 内部其实是多个 tool 加多步 LLM call 的组合。跟 Ch 3 学的 tool 比,Skill 关键加了组合性加复用性。Tool 是原子操作(read_file / search_web / send_email),Skill 是任务级能力(code-reviewer / pr-creator / bug-triager),一个 skill 完成一类业务任务,不是一个 mechanical action。#8 Agent 工程会深入 Skill 设计(粒度、composability、reuse),foundations 给你 vocabulary。
2.3 Reasoning / Planning · 模型的"思考能力"
这两个词在 Agent 圈子里常一起出现,但有细微差别。Reasoning 是推理,一步一步根据信息得出结论的能力(算术、逻辑、因果分析)。Planning 是规划,把一个目标拆分成可执行步骤的能力(更高层加涉及不确定性下的决策)。GPT-4 之后,所有主流模型都强调这两个能力。Reasoning models(如 OpenAI o1/o3、Claude 3.5 Sonnet thinking、DeepSeek R1)在生成 final answer 之前会先生成大段思考过程,显著提升复杂任务表现。
跟你已学概念的关系:Reasoning 加 Planning 不是新原语,是对模型本身能力的描述。它们影响你怎么写 prompt,给 reasoning 强的模型,可以省去 chain-of-thought 提示;给弱的模型,你要在 prompt 里手动写 think step by step。具体场景:你问 Claude "今天周三,3 天后是周几",对 reasoning 强的模型,直接答周六;对弱模型,可能错,需要 prompt 加 think step by step 才稳定。实战经验:写 production prompt 时,先测一遍你的目标模型的 reasoning 能力。如果模型 native reasoning 强,你的 prompt 可以更精简;如果弱,你需要明确写 think step by step、first plan then execute、show your reasoning before the answer。这种 prompt 适配是 production prompt engineering 的细活。面向 reasoning models 的 prompt 设计是 #8 的内容,foundations 不深入。
2.4 Subagent / Multi-Agent · 多 Agent 协作
最后一个 Agent 内部结构概念组:Subagent 和 Multi-Agent。Subagent 是被主 Agent 调用的专门 Agent,主 Agent 把某个任务交给 subagent,subagent 完成后把结果回传。Multi-Agent 是多个 Agent 协作完成一个任务的架构,可以是层级(supervisor 加 workers)、对等(辩论)、流水线(每 agent 负责一阶段)等多种 pattern。类比:Subagent 像专科医生,主治找心内科会诊;Multi-Agent 是医院的整套协作机制。
具体场景:Deep Research agent 经常用 multi-agent,一个 search agent 专搜资料加一个 critic agent 专审资料质量加一个 writer agent 专组装报告。三 agent 各管一摊,组合起来效果好于单 agent。原因:每个 sub-agent 的 prompt 加 tools 都针对单一任务 specialized,比一个 general agent 干所有事的效果好。跟 1.5 节的 Planner / Executor 比,Planner / Executor 是 2-agent 模式的特例(一个想一个做),Subagent / Multi-Agent 是更 general 的 N-agent 协作框架。Multi-agent coordination 的设计深度(handoff 协议、冲突解决、state sharing)归 #8,foundations 只让你听到这词知道是什么意思。
3. 三个子学科 · 你以后会反复听见
DeepSeek Agent Harness PM JD verbatim 把这三个独立列为子学科:
"Prompt Engineering · Context Engineering · Harness Engineering"
这意味着行业认这三个是各自独立的工程领域,不是单纯的 Agent 工程的小分支,是各自有 senior engineer 专门钻研的方向。本节给你这三个子学科的定位,深入工程归 #8 Agent 工程(foundations 已经在 Ch 3 教了 Prompt Engineering 入门,Context / Harness 不教)。
3.1 Prompt Engineering · 你已学过入门
Prompt Engineering 研究怎么写 prompt 才能让模型稳定输出你想要的。包括 prompt 结构、few-shot 示例选择、system prompt 编排、output format 控制、prompt cache 友好结构等。你已学:Ch 3 已经教过这层入门(production prompt 不是聊天而是 spec)。Prompt Engineering 不只是 Agent 用,任何 LLM 应用都用。进阶不在 foundations:prompt fine-tuning(基于反馈让 prompt 自适应)、structured output 的 schema design、safety prompt(对抗 jailbreak)等,归 #6 后训练和 #8 Agent 工程。
3.2 Context Engineering · Agent 长任务的核心挑战
Context Engineering 研究怎么选择、组织、压缩、检索、注入上下文,让 Agent 在长任务中保持 effective。为什么独立成学科?Agent 跑长任务 context 会爆。简单全塞会成本失控加模型 lose-in-middle(中间信息被淹没,关键信息找不到);简单截断会丢关键信息;简单 summarize 会丢细节。怎么 engineering 这一层是 Agent 工程的核心挑战之一。你已学:Ch 3 token economy 加 RAG primitive 是 prerequisites。你知道 context 是 token,知道 RAG 是怎么把外部知识塞进 context,Context Engineering 把这些 primitive 升级为 production-grade dynamic context management。进阶不在 foundations:多阶段 context 选择算法、dynamic context budget、context attention 优化、agent memory hierarchy 设计等,全部归 #8。
3.3 Harness Engineering · 把 Agent 推到 production 的整体工程
Harness Engineering 研究怎么把 LLM、工具、memory、loop 等零件组装成一个 robust 的 production Agent system,包括错误恢复、并发、安全护栏、可观测性、cost 控制等。类比:Prompt Eng 是给厨师写菜谱,Context Eng 是管理厨房的食材,Harness Eng 是整个餐厅的运营加消防加收银加订座加员工调度,最高复杂度的一层。你已学:Stage 3 的 Ch 5(state / data 加 failure / tradeoff)加 Ch 6(deploy / observe)是 prerequisites。Harness Engineering 把软件工程的所有 production discipline 应用到 Agent 系统的特殊性上。进阶不在 foundations:一切 production Agent system 的工程细节都属 Harness Eng,这是 #8 Agent 工程的主体内容。本路书的 6 章里所有 engineering 怎么做的内容全部归 Harness Eng。
4. 综合 · 一个 Agent 系统里这些词怎么连起来
到这里你拿到 13 个 vocabulary 加 3 个子学科定位。让我把它们串成一个具体场景,你看到的不是孤立词,是一个 working system 里它们怎么协作的。举一个 production research Agent 例子。用户输入:"写一份 Tesla 2025 Q3 财报分析"。系统怎么响应?
[ 用户提交任务 ]
↓
[ Planner Subagent ] ← Planner + Subagent + Reasoning
推理出 5 个子任务:
1. 查 Tesla Q3 财报原始数据
2. 找 analyst 评级
3. 看股价 reaction
4. 整理财务比率
5. 起草 outline
↓
[ Main Agent Loop 启动 · max_iter=30 ] ← Agent Loop + Termination + Budget
for each subtask:
↓
[ Step 1: Search Subagent 调 search_web tool ] ← Subagent + Tool
[ Step 2: 看结果(ReAct 写 Thought) ] ← ReAct + Reasoning
Thought: 找到了 Tesla IR 页面,这里有原始 10-Q
Action: read_url("...")
[ Step 3: 调 read_pdf 工具看财报 PDF ]
[ Step 4: Working memory 更新 ] ← Memory · Working
存 "Tesla Q3 营收 $25.2B, EPS $0.62" 到 system prompt 顶部
[ ... 20 step 后 ]
↓
[ context 即将爆,Context Engineering 子学科触发: ]
压缩前 15 step → 1 个 summary block ← Context Engineering
保留最新 5 step 全 fidelity
↓
[ Long-term Memory 写入: ] ← Memory · Long-term
"user 关注 Tesla 财报 · 偏好简洁数字分析"
↓
[ Skill: report-writer 综合最终报告 ] ← Skills
(内部用 Opus + 5 个工具 + 3 步 LLM call)
↓
[ Final Answer 返回用户 ]
[ Trajectory 全程记录 → trajectory eval ] ← Trajectory(进 #8 评测)读完这一整个流程,上面用 ← 标的每个术语你都该 grounded。看不清的回到对应小节重读。这就是 vocabulary 入门的终点,你不会做这个 system(那是 #8),但你能看懂这个 system 的描述,能跟设计 system 的人讨论,能读 system 的代码不脸盲。
5. 为什么 Agent 领域没合格 Mode B 视频
你读到这里可能会想:Agent 这么热的话题,为什么 foundations 不推荐一个视频学习站?这是一个值得诚实回答的问题。2026 现状,Agent 领域的优秀教学资源主要是文字加代码,不是视频。Anthropic claude-agent-sdk doc 加 Cookbook 是文字加代码,质量高,但没有真人讲解视频。OpenAI Agents SDK README 加 GitHub examples 同上。MCP spec 是协议文档纯文字。ReAct / Reflexion / Tree of Thoughts 等论文系列是学术论文。Anthropic Engineering Blog / OpenAI Cookbook / DeepSeek Blog 是高质量博客文章。
视频侧主要是产品 demo(Cursor 演示、Claude Code 演示、Manus 演示),这些是用法示范,不是系统讲解。把它们当 Mode B 推给学生,你看完后还是不知道 Agent 内部怎么工作。按 D26 reframe 的 Mode B 阈值(必须真人讲解加系统讲解加 pacing 友好),Agent 领域目前没有合格候选。所以本章全部 Mode A。如果未来出现高质量 Agent 系统讲解视频(类似 Karpathy 之于 LLM,或 3Blue1Brown 之于 transformer),我们再补 Mode B。Path B grounded reframe 的好处之一是:规则跟着资源生态演化,不预设虚假阈值。
收官 · 你现在在哪 + 下一站
回头看你这一章走了什么。你拿到了 Agent Loop 周边 6 个核心概念:Agent / Agent Loop / Step·Turn·Trajectory / Termination / Planner·Executor / ReAct。这是 Agent 系统的骨架 vocabulary。你拿到了 Agent 内部结构 4 个概念:Memory(5 种)、Skills、Reasoning·Planning、Subagent·Multi-Agent。这是 Agent 系统的肌肉 vocabulary。你拿到了 3 个子学科定位:Prompt Engineering(你已学入门)、Context Engineering(归 #8)、Harness Engineering(归 #8 主体)。这是 Agent 工程的分工 vocabulary。
Stage 2 · LLM 零件结束。你具备了读懂 LLM 在生产系统里的 API surface 加听懂 Agent 圈子的术语两层能力。这是从 prompt 玩家到 LLM 系统 builder 的关键 vocabulary baseline。下一章(Ch 5)进入 Stage 3 · 工程基底,从 prototype 到 production · 工程基底。我们把 LLM 系统从我电脑跑通推到线上服务可用。Production-quality 编程的 7 个维度、Sync/Async/Stateless/Stateful、DB/Cache/Queue 三件套、HTTP status/Retry/Idempotency、Latency/Throughput/Cost trade-off lens。
你完成了 foundations 的第 3 个心流断点 · Stage 2 圆满收官。合上书,去练:读一段 Anthropic claude-agent-sdk 的源码(或 OpenAI Agents SDK),你会发现每个文件名、每个类名、每个 prompt 模板都映射到这一章学的某个 vocabulary。这种听懂行业表达的体感,就是这一章的全部价值。
本章术语速查
Agent Loop 周边(6 个):Agent 自主决定下一步动作的软件系统 · Agent Loop 推理 → 工具 → 回填 → 再推理的循环 · Step 一个动作单位 · Turn 用户和模型一轮交互 · Trajectory Agent 完整执行记录 · Termination 循环停下条件(max iter / budget / timeout) · Planner 拆任务的角色 · Executor 执行步骤的角色 · ReAct Reasoning + Acting 模式
Agent 内部结构(4 个):Memory Agent 保存历史的能力 · Short/Long-term Memory 当前 context vs 跨 session · Episodic/Semantic Memory 发生过什么 vs 稳定知识 · Working Memory 当前任务的关键背景 · Skills 封装好的能力包 · Reasoning/Planning 模型的推理与规划能力 · Subagent 被主 Agent 调用的专门 Agent · Multi-Agent 多 Agent 协作架构
3 个子学科:Prompt Engineering(你已在 Ch 3 学过入门) · Context Engineering(foundations 不教 · 归 #8) · Harness Engineering(foundations 不教 · 归 #8)
完整词汇见 术语表 /glossary。
参考文献
Mode B · 必看视频
无。Agent 领域目前没有合格的独立教学视频(见 Section 5 解释)。本章全 Mode A。
Mode A · 引用出处
- DeepSeek Agent Harness PM JD · 13 PM baseline concepts + 3 子学科(Prompt / Context / Harness Engineering)verbatim · 用户 first-party 复制 2026-05-25 · 收录
teaching-system/research/foundations/synthesis.mdSection 8 Addendum - Anthropic · claude-agent-sdk 文档 · Skills first-class 概念来源
- Yao et al. · ReAct: Synergizing Reasoning and Acting in Language Models · 2022 · ReAct 范式开创性论文
深 dive 资源(可选 · 想往下走再看)
Agent 论文系列(姚顺雨等开创性工作):
- ReAct (Yao et al., 2022) · 把 reasoning 加 acting 结合
- Reflexion (Shinn et al., 2023) · 让 Agent 反思失败
- Tree of Thoughts (Yao et al., 2023) · 多路径搜索推理
- Tool Learning (Qin et al., 2023) · Agent 用工具的综述
Agent SDK 源码阅读(直接看顶级团队怎么做):
- Anthropic claude-agent-sdk · Python SDK source
- OpenAI agents-python · OpenAI Agents SDK
- Anthropic Cookbook · 大量 Agent pattern 范例
Agent paradigm reading lineage(更系统的论文阅读地图):
- 站内 姚顺雨代表作 · 7 篇论文阅读地图 · 论文研读类别
下一章 · Stage 3 起点
下一章(Ch 5)进入 Stage 3 · 工程基底,从 prototype 到 production · 工程基底。把 LLM 系统从我电脑跑通推到线上服务可用。