第 01 章

你站在 2026 · Agent 工程怎么走到今天

Agent 工程这门学科,怎么从 2022 年一篇论文里的小技巧,长成 2026 年前沿实验室抢着招的工程。带你走一遍它的技术演化和九次自我纠正,拿到一套判断新进展、向未来外推的方法,给整条路书一个时间坐标。

约 2 小时
开篇 · 给 Agent 工程一张地图,标着「你在这里」

这是 Agent 工程路书的第 1 章,约 2 小时,纯 Mode A。它不教任何具体 harness 技术,做一件别的章节不做的事:把 Agent 工程这门学科放回时间里,让你看清它怎么从一个写在论文里的小技巧,长成 2026 年前沿实验室抢着招人的一门工程。

你是从基础路书走过来的。在那条路的第 1 章,你已经走过整个 AI 的时间弧:Transformer 怎么成为地基、ChatGPT 怎么引爆、reasoning model 怎么开出推理这条新轴、Agent 怎么在 2024-2025 冒出来。你也在那一章学会了一个工具,叫墙与轴:每次进步都是撞一堵墙、再开一条正交的新轴。这一章不重走那条路,也不重教那个工具。它从那条路的终点接着往下讲:AI 刚长出能自己干活的苗头之后,Agent 工程这门学科自己是怎么一步步成形的。读完你会拿到一张专属于 Agent 工程的地图,带着它进后面 11 章,你遇到每个工程概念都知道它是被哪一堵墙逼出来的。

0. 你站在哪里

先给你两个时间点,中间隔着三年。2022 年 10 月,一篇叫 ReAct 的论文提出:让模型在回答前先写一句"我在想什么",再决定"我要做什么动作",看到结果后再想下一步。这在当时只是一个写 prompt 的小技巧,一篇学术论文里的一个 idea。2026 年的今天,你去翻 OpenAI、Anthropic、DeepSeek 的招聘页,会看到一个叫 Agent Harness 工程师的岗位,职责里明明白白写着 agent loopcontext engineeringtrajectory evaltool ecosystem。同一个东西,三年时间,从论文里的一行技巧变成了实验室抢着招的一门工程学科。这门学科是怎么长出来的,就是这一章要回答的。

要讲清楚这件事,得先说清楚这一章和基础路书第 1 章的分工,否则你会觉得我在重复。基础路书那一章讲的是整个 AI 的弧线,它的终点停在 2024-2025,reasoning model 出现了、Agent 这个词开始热了。这一章从那个终点接着往下钻,只讲 Agent 工程自己的弧线:模型有了能力之后,人们花了多久、撞了哪些墙,才知道怎么真正把它做成一个可靠的系统。墙与轴那个外推工具你已经在基础路书学过,这里直接拿来用,不再重新解释它怎么用。换句话说,基础路书教你 AI 整体怎么走到今天,这一章只教 Agent 工程这一支怎么走到今天。

为什么非要先讲历史再讲技术?因为 Agent 工程现在正处在一个特别容易让人误判的阶段。它足够成熟,成熟到有了专门的岗位、专门的工具、专门的论文;但它又足够年轻,年轻到三年前的"最佳实践"今天几乎全被推翻了。如果你不知道这条路是怎么走过来的,你很容易把某个今天流行的做法当成永恒真理,或者把某个看起来很酷的新东西当成方向,而事实上这个领域最值钱的能力,恰恰是分得清哪些是真进步、哪些是还没撞墙的幻觉。这一章按时间组织而不是按知识点组织,先带你走技术弧(Agent 工程怎么长出来的五个阶段),再带你走更值钱的认知弧(这个领域一次次纠正了自己的哪些判断),最后把墙与轴这个工具对准 Agent 的未来,教你怎么自己外推。

1. 技术弧 · Agent 工程怎么长出来的

Agent 工程的演化不是一条匀速直线,而是五个有因果关系的阶段:先有了循环的形状,再撞了第一批墙,然后两条独立的技术线并行推进、在某一天汇合,接着产品集中爆发,最后整门学科定型。我一个一个讲,每个阶段你只要抓住一件事:它解决了上一阶段留下的什么问题。

20222023202420252026① 循环② 玩具 + 种子③ 双链并进→汇合④ 产品爆发⑤ 学科化工具化链推理链function callingReAct 变 APIMCP工具标准化o1推理进权重R1推理开源化ReAct循环的形状AutoGPT玩具撞墙Devin后台自主o3 + Codex CLI两链汇合 · 原生用工具你在这 · 学科化harness 成 first-class 岗位每条竖线 = 1 年 · 时间从左到右 · 上下两轨 2025-04 汇合
Figure · Agent 工程自己的时间弧(区别于 #1 的 AI 通史)· 横轴真比例,每格 1 年 · 两条并行技术轨 —— 工具化链(function calling → MCP)‖ 推理链(o1 → R1)—— 在 2025-04 汇合于 o3 + Codex CLI,推开 2026 的学科化 · 对应正文 第 1 节

1.1 阶段一 · 循环的形状(2022)

一切从一个简单的观察开始。2022 年 10 月的 ReAct 论文注意到,如果让模型先把推理过程写出来、再让它根据推理决定一个动作、执行动作后把结果喂回去、然后再推理,这个"想—做—看—再想"的循环能让模型解决单靠一次回答解决不了的问题。这听起来朴素,但它确立了一件影响至今的事:Agent 的原子结构是一个循环,不是一次问答。你今天用的每一个 agent,无论是 Claude Code 还是 Codex,内核都还是这个 think-act-observe 的循环,只是外面包了厚厚的工程。ReAct 攻的是一堵很具体的墙:语言模型本身只会"想"(生成文字),不会"做"(改变外部世界);把推理和动作交错起来,模型第一次有了影响世界再根据反馈调整的能力。这个循环的形状,就是后面 Ch2 整章要讲的 agent loop 工程的起点。

1.2 阶段二 · 玩具与第一批教训(2023 – 2024 初)

有了循环的想法,加上 2023 年 3 月 GPT-4 把模型能力推上一个台阶,有人开始大胆设想:能不能让模型完全自主地跑这个循环,不用人插手?2023 年 3 月底诞生的 AutoGPT 就是这个设想的第一个产物,它是史上最快冲到 10 万 GitHub star 的项目,所有人都被"给个目标、AI 自己干完"的愿景点燃了。但它同时也是第一个把这条路上的墙撞得头破血流的玩具:它会陷进死循环出不来,会跑偏到莫名其妙的方向,会在你没注意时烧掉一大笔 API 费用,而且一旦出错你几乎没法 debug。AutoGPT 的失败不是方向错了,而是它证明了一件事:光有循环的想法远远不够,循环需要工程(什么时候停、花多少钱、出错怎么恢复)。这正是 Ch2 里 terminationbudget 为什么是生死线的历史由来。

这个阶段还埋下两个后来变得很重要的种子。一个是 2023 年 6 月 OpenAI 推出的 function calling,它把 ReAct 从一个写 prompt 的技巧变成了一个正式的 API 能力:模型被专门训练成能吐出结构化的工具调用,而不是靠你在 prompt 里描述格式。当时就有人一针见血地指出,这本质上是把 ReAct 这个模式 fine-tune 进了模型本身。另一个种子是 2024 年 3 月的 Devin,它自称第一个 AI 软件工程师,真正的突破在于它不是让你盯着屏幕看 agent 一步步跑,而是你交代完任务就可以走开、它在后台自己干,这种 set-and-forget 的后台自主形态,是后来 Codex Cloud、Cursor 后台 agent 这一整类产品的原点,也是 Ch12 里异步部署那一节的源头。

1.3 阶段三 · 两条链,与它们的汇合(2024 – 2025)

接下来发生的事如果不拆开看,会显得一团乱。其实是两条独立的技术线在并行推进。第一条是工具化链:function calling 解决了"模型怎么调一个工具",但很快暴露出新问题:每接一个新工具就要写一套自定义对接,接十个工具就是十套,这是个会指数爆炸的麻烦。2024 年 11 月 Anthropic 推出的 MCP(Model Context Protocol)就是来解这堵墙的,它想做工具接入界的 USB-C,让任何工具用同一套协议接进任何 agent。这条链的故事 Ch3 会展开。

第二条是推理链。2024 年 9 月 OpenAI 的 o1 做了一件影响深远的事:它把"先想再答"从一个 prompt 技巧(你在 prompt 里写"请一步步思考")变成了训练进模型权重的能力:模型被用强化学习训练成会自己生成一长串思考过程再作答。这件事对 Agent 的意义极大,因为长程任务最需要的就是稳定的规划和自我纠错能力,而这正是 reasoning model 带来的。2025 年 1 月 DeepSeek 的 R1 把这条路开源了、还把成本打了下来,于是整个行业都默认了推理这条轴。

这两条链在 2025 年 4 月 16 日这一天漂亮地汇合了。OpenAI 同日发布了 o3 和 Codex CLI:o3 第一次让 reasoning model 能在自己的思考链内部原生地调用工具(推理和工具不再是两件事),而 Codex CLI 是把这套能力包成 harness 产品同日落地。更值得记住的是 o3 在 SWE-bench 上的一个数据:它在"不带任何定制脚手架"的情况下就拿到了 69.1% 的成绩。这句"without custom scaffolding"后面会反复出现 —— 它是一个重要认知转折的最早证据,我们下一节细讲。

1.4 阶段四 · 产品爆发(2025)

能力一旦到位,产品就井喷了。这一年里 Claude Code 从内测走到正式发布、据报道用大约六个月冲到十亿美元年化收入(比 ChatGPT 还快);OpenAI 的 Operator 在 1 月作为浏览器自动化 agent 亮相,又在 8 月退役、能力并入 ChatGPT agent,这个生灭周期短到值得你记住,它是这个领域产品迭代有多快的活样本(别以为 Operator 还在);Manus 作为通用 agent 出圈,它底层用 e2b 的 Firecracker 微虚拟机当 agent 的虚拟电脑,这又是一条通向 Ch4 沙箱的线;OpenAI 的 Deep Research 在 2 月证明了 agent 不只能写代码,也能做几十分钟、读几百个来源的长程研究,它会是本书贯穿好几章的非编程例子。

这一年还有一件改变了 agent 形态边界的事。2024 年 10 月 Anthropic 第一个在前沿实验室里推出 Computer Use,让模型通过看截图、然后输出点击和键入来操作图形界面 —— GUI agent 元年。它一上来就撞到一堵硬墙叫 grounding(模型能不能准确知道屏幕上那个按钮的坐标),OSWorld 这类基准上的低分诚实地暴露了这堵墙。GUI agent 的 harness 怎么设计归 Ch3 和 Ch6,视觉理解本身归多模态路书。同期还有一件制度层面的事:agent 协议开始进入中立治理,A2A 在 2025 年 6 月进了 Linux Foundation,MCP 在 2025 年 12 月经由新成立的 Agentic AI Foundation 进入 Linux Foundation。一个领域的协议开始交给中立基金会托管,本身就是它在走向成熟的信号。

1.5 阶段五 · 学科化(2026 · 你在这里)

走到 2026 年初,你就站在 Agent 工程刚刚定型为一门独立学科的时刻。标志有几个。一是岗位:harness 工程师成了前沿实验室的 first-class 招聘方向,JD 里把 agent loop、context engineering、harness engineering 列成明确要求。二是度量:这个领域成熟到了能反过来审视自己的尺子 —— 2026 年 1 月 METR 发布了量化 agent 能力增长的时间视界报告,2026 年 2 月 OpenAI 甚至宣布停用一个曾经的标杆基准 SWE-bench Verified,因为审计发现它的题目有缺陷、还被模型背了答案。一个领域开始淘汰自己的旧尺子,说明它对"怎么算好"的理解已经迭代了好几轮。三是安全:OWASP 在 2025 年底专门出了一份 Agentic 应用的 Top 10 风险清单,对抗安全独立成了一门子学科。你现在学 Agent 工程,学的就是这门刚刚定型、还在快速演化的学科 —— 这既意味着没有太多历史包袱,也意味着你需要这一章给你的时间坐标,才不会把某个临时做法当成永恒。

2. 一个贯穿全书的命题 · Model + Harness = Agent

走完技术弧,你应该已经隐约感觉到一件事:Agent 的能力,不全在模型身上。我把这件事明确成一个命题,它是这整本书存在的理由。一个 agent 的本事 = 模型的能力 × 包在模型外面那层工程的质量,后者有一个专门的名字叫 harness(直译是马具,就是套在马身上让它能拉车干活的那套装备)。模型是马,harness 是让这匹马真能拉车的整套装备:循环怎么转、能调什么工具、出错怎么恢复、上下文怎么管、跑偏了怎么停。

为什么说 harness 是高杠杆,而不是可有可无的外壳?因为有一个反复被观察到的现象:同一个模型,换一套 harness,完成任务的成功率能差出好几倍。前面提到 o3 那句"without custom scaffolding"就是一个侧面 —— 它在讨论的恰恰是同一个模型在不同脚手架下表现差多少。DeepSeek 内部也有用规划和执行分工、强弱模型混搭把成本压到几分之一的案例。这些数字来自不同来源、口径不完全一样,所以我不会跟你坐实某一个精确倍数,但方向是确凿的:harness 是一个能让同一个模型表现天差地别的高杠杆工程层。这也直接给了你一个判断习惯,后面 Ch9 会专门训练 —— 看到一个 agent 表现差,先别急着怪模型笨,先问这是模型的问题还是 harness 的问题。

Agent 能力 = 模型能力 × Harness 质量下面两行,模型完全相同 —— 只有 harness 那个因子在变同一模型 + 弱 harness裸 while 循环✗ 常跑飞 / 早停同一模型 + 强 harness+终止/恢复/工具/上下文✓ 可靠完成任务成功率 →同一模型,只换 harness → 差数倍(有 6× 案例)示意 · solve-rate 数倍差距为多源收敛,非单一实验
Figure · 同一个模型(固定)接弱 harness(裸循环)vs 强 harness(+终止/恢复/工具/上下文),完成任务的成功率差数倍 —— harness 是和模型同等重要的高杠杆层 · 数倍差距为多源收敛(含 6× 案例),非单一 benchmark · 示意 · 对应正文 第 2 节

理解了这个命题,你就理解了这本书的结构。如果 agent 的智能全在模型里,那 Agent 工程就没什么可教的,你只要等更强的模型就行。但既然 harness 是高杠杆,那"怎么造一个好 harness"就是一门真学问,而它恰好可以拆成几个相对独立的工程问题:循环怎么转(Ch2)、工具生态怎么接(Ch3)、代码怎么安全地跑(Ch4)、怎么防住攻击者的劫持(Ch5)、上下文怎么管(Ch6)、记忆技能怎么沉淀(Ch7)、多个 agent 怎么协同(Ch8)、怎么度量好坏(Ch9)、失败怎么诊断(Ch10)、真实系统长什么样(Ch11),最后怎么把它们综合成一门工程并往未来外推(Ch12)。这就是你接下来要走的 11 站,每一站都是 harness 这台机器的一个零件。

3. 认知弧 · 这个领域已经自我纠正过九次

技术弧是表层,认知弧是里层,也是这一章最值钱的部分。一个领域成熟,靠的不是不断堆新知识,而是不断纠正自己曾经以为对的判断。Agent 工程这三年纠正过的判断里,我挑九个最重要的,每个都用同一个结构讲:曾以为什么、撞到什么墙、现在怎么理解、它教给你一个什么可迁移的 pattern。你要学的不是这九条结论本身,而是这个领域如何自我纠错的节奏 —— 内化了它,你对未来任何一次炒作或唱衰都会有免疫力。而且你会发现,这九次纠正全都长着同一个形状,这个形状就是你在基础路书学过的墙与轴。

认知一,从"把 prompt 串起来就能让模型自己干活"到"可靠性来自系统结构不来自巧妙的 prompt"。AutoGPT 那一波最初的信念是,只要把 prompt 一个接一个串好,模型就能自主完成复杂任务。撞的墙就是 AutoGPT 自己:裸串太脆,死循环、跑偏、烧钱、没法停。现在大家明白,把模型变成能干活的 agent,靠的是 harness 这层系统结构(循环、工具、终止、恢复、安全),不是更聪明的一句 prompt。这一条教你的 pattern 是,可靠性是工程结构给的,不是单点技巧给的,后面 Ch2 整章都在还这个债。

认知二就是上一节那个命题本身,从"agent 强不强全看模型"到"Model + Harness = Agent"。曾以为模型够强一切就解决了,撞的墙是同一个模型换 harness 成绩差几倍这个反复出现的事实,现在的理解是 harness 是和模型同等重要的高杠杆层。它教的 pattern 你已经拿到了:看到表现差,先分清是模型问题还是工程问题。这是贯穿全书的那条主线,Ch9 会把它训练成本能。

认知三,从"模型变强就是把预训练做得更大"到"推理是一条正交的新轴"。这一条直接接着你在基础路书学的 scaling 墙。曾经的信念是模型变强等于堆更多数据和参数,沿着预训练这一条轴一直走。撞的墙是预训练的边际收益在 2024 年前后明显放缓。但突破没有发生在把预训练曲线硬推得更陡上,而是 o1 和 R1 开了推理时算力这条全新的轴 —— 让模型在回答前想得更久。对 Agent 工程来说,这条新轴是引擎:reasoning model 让 agent 的长程规划和自我纠错第一次变得靠谱。这正是你在基础路书 Ch1 的认知弧里见过的「预训练撞墙 → 推理开新轴」那张 scaling 图最干净的一个实例,想再看那张图随时点回去。

这条认知的 pattern 极其重要,后面外推时你会反复用到:当一条增长曲线放缓,真正的突破往往不是把这条曲线推得更陡,而是找到一条与它正交的新轴。reasoning model 内部怎么训出来的归后训练路书,这里你只需要拿住"它开了一条新轴、解锁了 agent"这一层。

认知四,从"agent 就是给模型更大的 context、把所有东西都塞进去"到"context 是有限资源、需要工程"。早期直觉很自然:context window 越大,把越多历史和资料塞进去,agent 就越聪明。撞的墙有个名字叫 context rot —— 上下文越长,模型对中间信息的利用质量反而退化,加上长程任务里误差会累积,"多塞历史"经常让结果更差不是更好。于是 context engineering 成了一门独立子学科,核心是把 context 当有限资源来选择、压缩、检索、隔离。这一条的 pattern 是,"更多"不等于"更好",资源的有限性会逼出一门工程,Ch6 专门讲。

认知五,从"多个 agent 协同总比单个强"到"多 agent 要选择性地用"。曾以为把任务拆给多个 agent 协作总是更好,撞的墙是 sub-agent 之间会丢上下文、协同本身有开销、还特别难调试,很多场景下一个单 agent 配好的上下文反而更稳。现在的共识是,只有当任务能真正并行拆解、且子任务的上下文可以干净隔离时,多 agent 才值得。这一条的 pattern 是,架构复杂度必须由问题结构来证明其必要,不是默认越多越好,Ch8 会把两种相反的真实立场摆给你看。

认知六,从"agent 能跑起来出结果就行"到"不可度量就不可改进"。最初大家满足于 agent 能跑通、能出东西。撞的墙一是 AutoGPT 式的死循环烧钱,二是更隐蔽的:你根本不知道你的 agent 到底好不好,没有尺子就没法系统地改进它。现在的底线是两层,系统层要有 termination 和 budget(Ch2),度量层要有 trajectory eval(Ch9)。这一条的 pattern 是,先建可观测性再谈优化,看不见的东西你调不动。

认知七,从"写几个 eval 跑个分就知道 agent 好不好"到"eval 本身成了瓶颈、连尺子都会骗你"。这是上一条的延伸,也是 2025-2026 年最新的一次认知更新。曾以为度量是简单的,写几个测试用例跑个分就行。撞的墙有两面:一面是 agent 让评测的组合爆炸(一个任务几十步,每步都可能错,怎么算对),业界甚至有"知道一个模型行不行的成本已经超过造这个模型"的说法;另一面更扎心,基准会被污染、LLM 当裁判会有系统性偏见 —— 最硬的证据就是 2026 年 2 月 OpenAI 宣布停用 SWE-bench Verified,因为审计发现近六成难题的测试有缺陷、而且几个前沿模型能直接背出答案。现在 eval 从"会用裁判"升级到了"会验证裁判"。这一条的 pattern 是,度量工具本身也需要被度量,基准上的数字是方向信号、不是保证,Ch9 整章在还这个债。

认知八,从"接的工具越多 agent 越能干"到"工具要好好设计、要标准化、还要能被检索"。曾以为给 agent 接的工具越多它越万能,撞的墙是工具一多就碎片化(每个一套对接)、模型会选错工具用错工具、工具描述写不好模型根本读不懂。现在的理解是,工具的命名、描述、返回值是写给模型读的,要专门设计;接入要靠 MCP 标准化;工具多到放不进 context 时还要能检索。这一条的 pattern 是,接口是为它的消费者设计的,而 agent 的工具,消费者是模型,Ch3 会展开这个叫 ACI 的思想。

认知九,从"把代码关进沙箱就安全了"到"对抗安全是一个正交的维度"。曾以为给 agent 套个沙箱、防止它把机器搞坏,就算安全了。撞的墙是,沙箱只防得住向内的威胁(模型自己出错、跑坏了自己的环境),完全防不住向外的威胁 —— 攻击者用注入的内容劫持 agent,让它在一个完美的沙箱里照样把你的私有数据外泄出去。这种攻击有个很形象的说法叫致命三连(私有数据、不可信内容、外泄通道三者同时具备就危险),它连续两版被 OWASP 列为大模型应用的头号风险。这一条的 pattern 是,威胁模型要分正交的维度来想 —— 防自己出错和防别人攻击,是两件完全不同的事,Ch4 管前者、Ch5 管后者。

讲完这九条,我要把那个一直在背后的形状点出来。你回头看,这九次纠正没有一条是孤立的,它们全长着同一个样子:撞到一堵墙,然后不是把老办法用得更狠,而是找到或造出一条新的轴(一个新的工程层、一种新的算力、一门新的子学科)。prompt 撞墙开出 harness 这条轴,预训练撞墙开出推理这条轴,context 长度撞墙开出 context engineering 这条轴,朴素评测撞墙开出 eval 验证这条轴。这就是你在基础路书学的墙与轴,只不过这次它不是一个抽象工具,而是这个领域已经发生过九次的真实动作。把这一点想透,你就明白这一章为什么值钱:你学到的不是九条要背的事实,而是撞墙开新轴这个可以反复复用的认知动作,下一节我们就用它来看未来。

4. 外推 · 用墙与轴 + 一把量尺看明天

最后一节教你怎么站在 2026 往前看。注意,目标不是预测未来(具体预测会立刻过期、而且经常错),而是掌握外推的方法,这是比任何一条预测都耐用的能力。方法你已经有了,就是墙与轴 —— 既然这个领域每次真进步都是撞墙开新轴,那么外推未来的正确问法就不是"下一个模型多少参数",而是"现在挡在前面的墙是什么、什么样的新轴可能绕过它"。

那么站在 2026,Agent 工程前面有哪几堵明显的墙?我列五堵,不是要你记住它们,是给你练外推的素材,也是 Ch12 收官那一节会回收的。可靠性的墙:agent 在长任务上仍然会跑飞,几十步之后容易累积错误,这挡着它从一个助手变成一个能托付的同事。长程一致性的墙:跨越很长时间、很多步保持目标连贯仍然很难。多 agent 成本的墙:协同能扩大能力但 token 成本和复杂度也跟着涨,什么时候值得仍是真问题。评测的墙:我们其实还不太会衡量一个 agent 到底好不好,这正是认知七说的。安全的墙:能力越强,被对抗性劫持的风险面越大。

要把这种判断从感觉变成有刻度的东西,有一把量尺值得你记住,叫 METR 时间视界。它不量成功率,而是量一件更聪明的事:模型能以 50% 的可靠度完成的任务,换算成让一个人类来做要花多长时间。这个数字 2025 年初大概是一个小时(当时的前沿模型),到 2026 年 1 月的最新报告里,前沿模型已经到了大约 320 分钟、也就是五个多小时。更关键的是它的斜率:整体大约每七个月翻一倍,而且近一两年在加速,2024 年以来大约每三个月就翻一倍。这把尺子让你能把"agent 在变强"这种模糊印象,变成"我正站在一条很陡、而且在变得更陡的曲线上"这种有方向有加速度的坐标感。但你引用它的时候必须诚实带上一条:50% 的可靠度离生产可用还很远,生产环境通常要求接近 99%,所以时间视界是一个趋势信号,不是一个承诺 —— 这恰好又回到认知七那句话,数字是信号不是保证。

50% 可完成任务时长 ↑≈15 分≈1 小时≈5 小时202420252026≈ 每 7 月翻倍(2024 以来加速 ≈ 每 3-4 月)2025 初 ≈ 1 小时2026.01 · Opus 4.5 ≈ 320 分⚠ 50% 口径 ≠ 生产可用(~99%)· 时间视界是趋势信号,不是承诺 · METR 无显式预测
Figure · METR 时间视界 —— 模型能以 50% 可靠度完成的任务,换算成人类工时有多长 · 纵轴对数(指数增长)· ≈ 每 7 月翻倍,2024 以来加速到 ≈ 每 3-4 月 · Opus 4.5(2026.01)≈ 320 分钟 · ⚠ 50% 口径 ≠ 生产(~99%),是趋势信号非承诺 · 对应正文 第 4 节

所以你现在不需要去解这五堵墙,只需要养成一个习惯:遇到任何 AI 新闻、新产品、新论文,先别问它有多炫,先问它在攻哪一堵墙、用的是把老轴推得更远还是开了一条正交的新轴。一个只是把老轴推远一点的进展,和一个开了新轴的进展,意义完全不同,后者才是真正改变方向的。这个判断习惯,就是这条路书使命里"为前沿研究做准备"的种子 —— 前沿研究的本质,就是站在这条轨迹的最前端,辨认出下一堵墙、想象出下一条轴。

5. 这门课的边界 · 以及你将走的路

在你出发之前,有必要划清这门课教什么、不教什么,免得你在错的地方期待错的东西。这门课教的是 harness 工程 —— 怎么把一个模型变成可靠的 production agent。它假设你已经从基础路书拿到了 Agent 的词汇(agent loop、tool use、MCP、memory 这些词是什么意思),所以这里不再扫盲,直接讲这些东西怎么从概念长成工程。有几类相邻的知识明确归别的路书:reasoning model 内部怎么训练、推理怎么优化,归模型设计和后训练路书,这里只把 reasoning 当成一个能力来用;agent 的强化学习训练算法,归后训练路书;GUI agent 怎么看懂屏幕像素,归多模态路书,这里只管那个感知到动作的循环怎么搭;通用的分布式系统和模型部署,归系统设计路书。这条边界不是为了甩锅,而是为了让你清楚每个问题该去哪本书找答案。

带着这些,来看你接下来要走的路。这门课分四站:第一站就是这一章,给你坐标系;第二站搭一个能跑、能用工具、还安全的 harness(Ch2 循环、Ch3 工具与 MCP、Ch4 沙箱、Ch5 对抗安全);第三站让这个 agent 扛得住长任务(Ch6 上下文工程、Ch7 记忆技能与自我改进、Ch8 多 agent 协同);第四站学会度量它、读懂真实系统、并往未来外推(Ch9 评测、Ch10 失败模式、Ch11 真实源码巡礼、Ch12 综合与外推)。走完这四站,你应该能用 SDK 搭一个多工具 agent、自己写一个带终止和恢复的 production harness、给它配一套评测、读懂 Codex 这类真实系统的源码,并且看一份 agent 方案时能一眼挑出反 pattern 和关键取舍。这就是从"会用 agent 产品"到"会做 agent 工程"的距离,这一章给了你地图,接下来 11 章一站一站把它走完。

收官 · 你现在有了地图

回头看你这一章拿到了什么。你拿到了一条专属于 Agent 工程的技术弧:循环的形状(2022 ReAct)、玩具撞墙与两颗种子(2023-2024 AutoGPT、function calling、Devin)、工具化链和推理链在 2025 年 4 月的汇合、2025 年的产品爆发、以及 2026 年的学科定型。你拿到了一条更值钱的认知弧,九次自我纠正,每一条都教你一个可迁移的 pattern,而它们共享同一个形状 —— 撞墙开新轴。你还拿到了一把外推的方法和一把量尺:墙与轴让你问对问题,METR 时间视界给你有刻度的坐标感。

更重要的是,你不再是空降到 Agent 工程的终态。从下一章起你会开始学具体的工程 —— 怎么搭循环、怎么接工具、怎么管上下文、怎么防攻击、怎么评测。但你现在知道每一个工程概念是被哪一堵墙逼出来的:你学 termination 时会想起 AutoGPT 烧钱那堵墙,你学 context engineering 时会想起"更大 window 就行"那堵墙,你学对抗安全时会想起"沙箱了就安全"那堵墙。带着这张标着"你在这里"的地图,进下一章。

下一章 Ch2 进入第二站的核心,Agent Loop 工程。你已经知道循环是 Agent 的原子结构,下一章我们把这个朴素的循环,变成一个有终止保护、能从错误里恢复、能跨工具调用保持推理状态的 production harness。这是你亲手搭第一个真正能跑的 agent 的开始。

本章时间线速查

技术弧五阶段:2022.10 ReAct(确立 think-act-observe 循环 = agent 原子结构)· 2023 AutoGPT 玩具撞墙(死循环/烧钱/无终止)+ function calling 把 ReAct 变 API 原语 · 2024.03 Devin 开后台自主 coding agent 先河 · 2024-2025 工具化链(function calling → MCP 2024.11)‖ 推理链(o1 2024.09 → R1 2025.01 → o3 2025.04 原生用工具),两链汇于 2025.04 o3 + Codex CLI · 2025 产品爆发(Claude Code / Codex / Operator[已退役] / Manus / Deep Research / Computer Use)+ 协议进 LF(A2A 2025.06 · MCP 2025.12 经 AAIF)· 2026 学科化(harness 成 first-class 岗位 · METR 时间视界 2026.01 · SWE-bench Verified 退役 2026.02 · OWASP Agentic)

认知弧九纠正:prompt 串联 → 可靠性来自 harness 结构 · agent 全看模型 → Model+Harness=Agent · 预训练堆大 → 推理是正交新轴 · context 越大越好 → context 是有限资源 · 多 agent 总更好 → 选择性用 · 跑起来就行 → 不可度量不可改进 · 有 eval 就够 → eval 本身成瓶颈、裁判会骗你 · 工具越多越强 → tool design + 标准化 + 检索 · 沙箱了就安全 → 对抗安全是正交维度

外推:每次进步 = 撞墙 → 开正交新轴 · 遇新进展先问攻哪堵墙、老轴还是新轴 · 当前五堵墙:可靠性 / 长程一致性 / 多 agent 成本 / 评测 / 安全 · METR 时间视界(每 ~7 月翻倍、近年加速到 ~3 月 · Opus 4.5 ≈ 320min · 50% ≠ 生产)

本章关键术语

本章引入的 canonical 术语,点进术语表看更完整的解释:

  • Harness · 智能体马具 包在模型外、让它可靠干活的整层工程:循环 / 工具 / 终止 / 恢复 / 上下文
  • Model + Harness = Agent 本书命题:agent 能力 = 模型能力 × harness 质量,harness 是和模型同等重要的高杠杆层
  • METR 时间视界 模型以 50% 可靠度完成的任务换算成人类工时多长 · 量化 agent 能力增长的趋势锚(50% ≠ 生产)

参考文献

Mode A · 引用出处(正文 inline,集中列在此)

深 dive 资源(可选 · 想往下走再看)

说明:Agent 工程领域目前没有合格的人讲解系统教学视频(产品演示不等于系统讲解),所以本章及本路书大部分章节没有 Mode B 视频站,由我们的 Mode A 原创讲解扛起。这一判断和基础路书 Agent 词汇章一致,若未来出现像 Karpathy 之于 LLM 那样的合格 agent 工程教学视频,我们会补上。

下一章

下一章(Ch2)进入第二站核心 · Agent Loop 工程。你已经知道循环是 Agent 的原子结构,接下来我们把这个朴素的 think-act-observe 循环,变成一个有终止保护、能从错误里恢复、能跨工具调用保持 reasoning 状态的 production harness —— 你亲手搭第一个真正能跑的 agent 从这里开始。