第 12 章

Harness Engineering 综合 + 向未来外推(收官)

整条 Agent 工程路书的收官。这一章不再加新零件,它做两件事:把前十一章装成一门完整的学科——看一个 harness 由哪九层组成、在生产里要付什么代价(为什么 agent 贵、prompt caching 为什么是头号杠杆)、怎么反过来成为模型训练的一部分;然后站在 2026,用一把「墙与轴」的尺子识别这门学科撞着的五堵墙、对未来做一次有锚的外推。读完你不只会搭当前的 harness,还会用同一把尺子持续追踪它往哪走——这就是「前沿就绪」。前置:Ch2-11。

约 2.5 小时
开篇 · 把零件装成一门学科,再看它撞在哪、往哪走

这是 Agent 工程路书的第 12 章,约 2.5 小时,纯 Mode A,也是整条路书的收官。前面十一章,你学了十一个零件:循环、工具、沙盒、对抗安全、context、memory、自我改进、multi-agent、评测、失败模式、真实系统源码。这一章不再加新零件,它做两件收口的事:把这十一个零件装起来,看一个完整的 harness 到底长什么样、在生产里要付什么代价;然后站在 2026,看这门学科撞在哪几堵墙上、下一根轴可能往哪开。

第一件是综合:把分散的工程知识收口成一门有名字、有经济学、有部署形态、有训练接口的学科,Harness Engineering。第二件是外推:这件事我们在 Ch1 就埋下了工具。Ch1 给了你一把尺子,叫「墙与轴」,每次真进步,都是撞上一堵墙、然后开出一条正交的新轴;Ch1 还给了你一条 METR 的曲线,告诉你正站在一条又陡又在变陡的能力曲线上。这一章把同一把尺子拿出来用一次,识别 agent 工程当前的五堵墙,推一推下一根轴。说清楚这一点很重要:这一章不发明新的外推工具,它只是把 Ch1 的工具用一遍,这样外推才不会退化成无锚的未来畅想。

读完后,你能把学过的十一章重新看成一个 harness 的九个层、说清每一层的职责和它当前的墙;能算一笔 agent 的生产账(为什么贵、prompt caching 为什么是头号杠杆、fleet 怎么权衡);能讲清 harness 怎么反过来成为模型训练的一部分;最后能用墙与轴这把尺子,对这门学科的未来做一次有锚的外推,而不是猜。

7 节:0 综合 + 外推的双重任务 · 1 Harness Engineering 作为一门学科 · 2 生产经济学 · 3 agent 离开了终端 · 4 harness 也是训练产物 · 5 推理算力作旋钮 · 6 五堵墙 + 一把尺子。

边界:这一章是综合不是重讲,每个子主题只取它在全貌里的位置和它的当前墙,机制深挖都在它原来那章。三条跨路书硬线贯穿:RL 算法本身(怎么用轨迹更新权重)归后训练(#6),这一章只讲 harness 怎么产信号喂训练;推理算力的 scaling 理论归模型设计(#4),这一章只讲它作为 harness 旋钮怎么用;通用分布式 serving infra 归系统设计(#2),这一章只讲作为 harness 平台工程师怎么算 fleet 这笔账。

0. 这一章做两件事:综合,然后外推

先把这一章的双重任务讲清,你才知道它和前面十一章不是一类。前十一章每一章都在教你「怎么把某件事搭对」,这一章往后退一步,问两个收口的问题。第一个是综合的问题:把这十一个零件装到一起,一个完整的 harness 到底长什么样、它在生产里要付什么代价、它怎么接进模型训练?第二个是外推的问题:站在 2026 这个时间点,这门学科撞在哪几堵墙上、下一根轴可能往哪开?前者把分散的工程知识收口成一门学科,后者把已经发生的演化弧,延伸成可能的未来。

外推这件事最容易跑偏成科幻,所以这一章用一个刻意的约束来锚住它:不发明新工具,只用 Ch1 已经给你的那一把。Ch1 立过一个叫墙与轴的 meta-skill,每一次真正的进步,都不是把老办法推得更陡,而是撞上一堵墙、理解它的本质、然后开出一条正交的新轴;Ch1 还证明了,这门学科已经自我纠正过九次,每一次都是这个动作的一个已发生的实例。这一章的第六节,就是把同一个动作做一次未发生的应用:面对当前的五堵墙,逐个问下一根轴往哪开。Ch1 给你坐标,这一章给你外推,首尾正好合上。所以读这一章时,你脑子里要一直挂着 Ch1 那把尺子,它不是新东西,它是你早就有的工具,现在第一次拿来推未来。

1. Harness Engineering 是一门学科,不是十一个技巧

这一节是这一章的脊柱:把前十一章从一份章节清单,收口成一门有定义、有结构、有 doctrine 的工程学科。先说定义。把三家的说法合起来,harness 就是把一个无状态、健忘、会犯错的模型,变成一个能在真实环境里可靠地感知、规划、行动、自我修正的系统的那一整套工程。Anthropic 把它框为 prompts、tools、environment、orchestration 的总和;OpenAI 说得更激进,当工程团队的主要工作不再是写代码,他们的活就变成设计环境、规定意图、搭建反馈闭环;学界则把 harness 定义成强化学习环境五元组里的一个对象。三种说法指向同一件事:模型负责会不会想,harness 负责能不能可靠地做。

把这个定义落到结构上,就是这一章的收官高潮,把你学过的十一章,重新看成同一个 harness 的九个层。

11 章 = 同一个 harness 的 9 层(每层 → 一堵当前墙)控制层 · loop感知→推理→动作→终止 + 预算 + 崩溃恢复Ch2长程一致能力层 · tools模型能调的动作空间(GUI / MCP / code-exec)Ch3容纳层 · sandbox限制生成代码的爆炸半径(向内)Ch4安全·向内对抗层 · security防注入内容劫持 agent(向外)Ch5安全·向外供给层 · context每步窗口里放哪些 token(有限注意力)Ch6长程 + rot持久层 · memory/skills卸到窗外 + 从轨迹自演化Ch7可靠性协同层 · multi-agent分工 / handoff / 聚合(选择性用)Ch8成本/同步度量层 · eval + 失败不可观测变可观测 + 失败转修复Ch9-10eval 难实证层 · 真实系统以上全部在 Codex 里怎么落地Ch11模型负责「会不会想」,这 9 层负责「能不能可靠地做」
Figure · 收官高潮:你学的 11 章不是平行的 11 个话题,而是同一个 harness 的 9 层 —— 从控制层(loop)到实证层(真实系统),每一层标它来自哪章、它在系统里的职责、以及它对应的那堵当前墙 · 综合(装成一个 stack)和外推(每层的墙就是外推起点,见 第 6 节)在结构上焊在一起 · 对应正文 第 1.2 节

这张图值得你盯着看一会儿。你第一次会发现,自己学的十一章不是十一个平行的话题,而是同一个系统的九个层:最底下是控制层,也就是 Ch2 的循环;往上是能力层(工具)、容纳层(沙盒)、对抗层(安全)、供给层(context)、持久层(memory 与自我改进)、协同层(multi-agent)、度量层(评测与失败),最后是实证层,也就是 Ch11 在 Codex 里看到的全部落地。更关键的是,每一层都对应着第六节要讲的一堵当前墙,这不是巧合,而是这一章把综合和外推在结构上焊在一起的方式:你先把零件综合成一个 stack,每一层的那堵墙,就成了外推的起点。

这门学科有它的 doctrine,两家顶级团队都写下了收官级的总结。Anthropic 那篇讲长程 harness 的文章,把长任务的本质讲得最透:一个长程 agent 必须在一段段离散的会话里工作,而每一段新会话开始时,它对之前发生的一切毫无记忆,就像轮班的工程师,每个新班次来的人都不记得上一班干了什么。他们的解法是让 agent 把状态卸到文件系统上,一个初始化 agent 先建好进度文件和特征清单,后续每个会话读 git log 和进度文件、增量推进、再提交。这篇文章诚实地没有给任何经济学数字,它是纯定性的设计 doctrine,经济学的账要到下一节才算。OpenAI 那篇讲 harness engineering 的文章则给了另一半:他们用 agent 为主力建了一个真实产品,几周写出上百万行代码,做法是让 agent 自己审自己的改动、在一个循环里反复迭代直到所有 agent 审查者都满意。但他们也说出了一句最 load-bearing 的话,当代码产出的吞吐上去之后,瓶颈变成了人类 QA 的能力。这句话直接通向第六节的 eval 墙,先记住它。

2. 生产经济学:搭对之后,怎么在生产里活下去

前十一章多在讲怎么搭对,这一节补一件同样关键的事:搭对之后,在生产里怎么算账、怎么活下去。先看成本结构。agent 的账单从来不是一次 LLM 调用,而是一整条轨迹:Anthropic 实测,一个 agent 大约用掉聊天四倍的 token,一个 multi-agent 系统大约十五倍;在一个检索任务上,单是 token 用量就解释了八成的成绩方差。这就是为什么 agent 贵但有时值,多花的 token 在 token 起决定作用的任务上,买到了更高的分。这里有一个 2026 年的新陷阱要标注:Opus 4.7 的新 tokenizer 对同样的输入文本可能多产约 35% 的 token,所以跨模型版本比成本,要按实际 token 数,不能只看价目表,价不变不等于账单不变。

成本算清之后,真正的工程判断是在一个三角里找点。

质量速度成本更强模型 · 更多推理 · Best-of-N分级路由 · caching · 压缩更小模型 · 更短 context · streaming · caching先定 workload 底线再在三角里找点没有免费午餐
Figure · 生产 harness 在质量、速度、成本三个相互拉扯的目标间找点,没有免费午餐:追质量(更强模型 / 更多推理 / Best-of-N)涨成本和延迟;追速度(更小模型 / 更短 context)常掉质量;追省钱(分级路由 / 压缩 / 少 multi-agent)常掉质量或涨延迟 · 工程上的判断是:先定 workload 的可接受底线(要多准、能等多久、能花多少),再在三角里找点 · prompt caching 是少数能同时降本又降延迟的杠杆 · 对应正文 第 2.2 节

质量、速度、成本这三个目标互相拉扯,没有免费午餐。想要质量,常靠更强的模型、更多的推理、更多的并行采样、更长的 context,但这些全都涨成本、涨延迟。想要速度,常靠更小的模型、更短的 context、流式、缓存,但这些常掉质量。想要省钱,常靠分级路由、缓存、压缩、少用 multi-agent,但这些常掉质量或涨延迟。工程上正确的姿势不是盲目追最强最快最便宜,那个点不存在,而是先定这个 workload 的可接受底线:这个任务要多准、用户能等多久、单次能花多少,然后在三角里找一个满足底线的点。这正好是 Ch2 那条简单优先、Ch8 那条能用单 agent 别上多 agent 的原则,在经济学层的统一表达:复杂度和成本,要由 workload 的价值来 justify。

在这个三角里,有一个杠杆值得单独讲,因为它是控制 agent 成本的头号工程手段:prompt caching。它对 agent 尤其关键,因为 agent 的循环每一轮都要重发同一个前缀,系统提示、工具定义、加上不断增长的历史。缓存的机制是,provider 把这个前缀的注意力键值缓存下来,命中就跳过预填充、只算新增的后缀,这是 provider 侧的特性,不是客户端能自己做的小技巧。Anthropic 的缓存读取只要基础价的 0.1 倍,也就是九折再九折;在多轮循环加一个长系统提示的场景下,输入成本能降五到十倍。但这里有一个最贵的失效模式,你必须记住:缓存命中在前缀上,任何变动元素之后的内容都不再缓存,所以最经典的错误,是在系统提示的顶部塞一个时间戳,那会让整个缓存当场失效、静默降级成全价。原则是稳定的放前面(系统提示、工具定义、静态长 context、旧对话史),变动的放后面(当前的用户消息),并且一定要用 SDK 的用量对象监控命中率,否则放错了断点你都不知道自己在按全价付钱。

最后是 fleet 经济学,也就是同时管一支并发 agent 舰队的账,这是纯粹的 harness 平台命题。它的核心是一个延迟和闲置成本之间的连续权衡:预热的池子响应快但闲置烧钱,快照恢复省钱但有冷启动延迟。并行能用吞吐买质量,但会把成本乘上 N。这里要守住一条 #8 和 #2 的边界:作为 harness 平台工程师,你要算的是这支舰队的 token、延迟、可靠性账,选 warm 还是 cold 池策略;而底层的 K8s 调度和 autoscaling 怎么造,那是系统设计(#2)的事,这一章不碰。

3. Agent 离开了终端:async、headless、background

2026 年 agentic coding 最有定义性的转变,不是模型更强了,而是 agent 离开了终端。前面讲的 harness 多半还假设你坐在那看它打字,但部署形态已经变了:agent 从内联(你在编辑器里看它补全,人在内循环)转向了后台异步,它在云沙盒里跑几分钟到几小时,从一个 GitHub issue、一条 Slack 消息、一张工单触发,只在最后交回一个 PR,人只审产物。这条时间线 Ch1 已经 pin 过源头:从 2024 年底的 Devin,到 2025 年的 Codex Cloud 和 Cursor 后台 agent,再到 2026 年 3 月的 Claude Code Remote Tasks。这是 harness 形态的改变,不是模型的改变,它的核心价值是并行:周五下午排五个范围清晰的工单,周一早上收五个 PR 来审,你从和模型结对,变成了管一队 junior 工程师。

这种部署形态的架构核心,是 Best-of-N 和 Planner-Worker-Judge。Best-of-N 是并行采样:生成 N 个独立的解,用一个 judge、reward、或投票选最优,这是第五节要讲的并行推理算力在部署层的落地。把它做到极致的活案例是 Cursor 的 FastRender:他们用一个三层架构,Planner 拆目标、Worker 隔离执行、Judge 评质量并决定要不要继续,最多两千个并行 agent 跑了将近一周,烧掉数以万亿计的 token、价值数百万美元,生成了上百万行代码。这个案例之所以是这一章综合的活标本,是因为它把 Ch8 的 multi-agent、Ch9 的 judge、本章的 fleet 经济学、和下一节的并行推理算力,在一个真实系统里全焊到了一起。

但部署形态的当前墙,是信任。我们还不能把端到端的关键工作交给一个没有人在环的 agent,所以 2026 年多数团队仍然默认监督。自主姿态因此成了一个关键的设计决策,而不是营销话术:从监督式结对(Claude Code、Cursor、Codex 桌面版,逐步审批),到受限的异步,到完全委托、只审最终状态(Devin)。选哪一档,要匹配你团队的 review 文化,而不是盲目追最高自主,更高的自主不等于更好。这堵信任墙,本质上是第六节那堵可靠性墙在部署层的直接后果:之所以人还得在环,是因为 agent 还不够可靠到能放手。而 METR 的那条曲线会给这堵墙一个最精确的量化版本,马上就讲。

4. Harness 也是训练产物:#8 和 #6 的接口

这一节讲一个精妙的接口:harness 不只是生产时跑模型的东西,它还反过来是模型训练的一部分。Ch4 从沙盒侧、Ch7 从自我改进侧都碰过这条线,这一节把它收口。一个强化学习训练环境,本质上等于沙盒加奖励加重置:隔离来自 Ch4 的沙盒,有状态的重置来自 Ch4 的 ephemeral 快照,可复现意味着同样的初态加同样的动作得到同样的观测和奖励,而奖励就是 Ch9 那个可验证的 eval 信号。学界有句话点得很准:我们正在从问答数据集,转向创造环境,而环境是一种新型的数据。优化也因此分层:prompt 优化、harness 优化、然后才是用强化学习更新权重,前两层是 #8 的事,第三层是 #6 的事。

这里有一个最反直觉、也最 load-bearing 的洞见:训练用的 harness 和生产用的 harness,是两个不同的工程产物。训练 harness 是故意宽的,最大化动作空间,让优化器去发现策略;生产 harness 是故意窄的,最小权限、默认拒绝、观测一切,也就是 Ch4 和 Ch5 教的那一套。这会带来两个对称的失败模式。一是在训练里过度上锁:把生产的 allowlist 搬进训练图省心,结果模型在窄边界里表现好、一出界就崩,因为它从来没学过怎么从一个工具错误里恢复,生产 harness 一直替它重试了。二是在生产里欠围栏:用开放式的 harness 训出一个 demo 惊艳的 agent,然后用同一个 harness 怼真实系统,于是第一次有提示注入的载荷流过工具输出时,这个 agent 就乖乖地把密钥泄露了出去,因为 harness 里没有任何东西告诉它不该这么做,这正是 Ch5 的致命三连。有个被低估的技巧能缓解第一个失败模式:在训练环境里故意注入一定比例的工具错误,让模型学会恢复,这样它到生产里遇到不稳定的 API 才不会废掉。

这条接口还有一个动态的含义,它把 Ch1 那个模型加 harness 等于 agent 的命题升级了:harness 是模型被训练时所处的契约的一部分。模型是在某一套特定的 harness 配置下被后训练出来的,你换一个 harness,不同的工具 schema、不同的循环结构、不同的记忆布局,模型就跑到了分布之外。所以投资训练 harness 的团队,在两三个模型代际之后,会少背很多生产 harness 债。这就形成了 #8 和 #6 之间一个活的闭环:#8 的 harness 产出轨迹和信号(无梯度),#6 的强化学习消费它来更新权重,新一代模型又回到 #8 的 harness 里。但硬线必须守住:环境的工程,造沙盒、设重置、接 verifier、产轨迹,是 #8;强化学习算法怎么用这些轨迹更新权重、reward model 怎么训,是 #6。这一章只讲到信号交接的接口为止,不讲梯度怎么走。

5. 推理算力作 harness 旋钮

推理期算力是 harness 的一个旋钮:你可以让 harness 在一个任务上花更多的推理来换质量。它有两种花法。串行,是延长单条推理链或反复反思,它依赖前后结构、不能并行、因此限制吞吐,但能做错误修正。并行,就是 Best-of-N,采样 K 条独立的轨迹再用一个 selector 选一条,它吞吐友好,但需要一个可靠的 verifier(连回 Ch9 的 eval 和上一节的 Judge 层)。两种都遵循可预测的递减曲线、都会饱和,而且收益和任务强相关:推理任务收益最大、事实召回最小。这里要守住和 #4 的边界,这些 scaling 曲线背后的公式和 verifier 怎么训,是模型设计(#4)的事;这一章只取「它有可预测的递减、且任务相关」这个工程结论,拿来做决策。

但对 agent,有一个 2026 年的反直觉发现必须讲:串行地堆推理有一个天花板。CMU 的一项研究发现,在通用任务上,agent 的表现在三到七轮之间见顶,超过之后,累积的 context 污染反而让结果下降,他们叫它 context ceiling。机制上要区分清楚:推理模型受益于更多思考,因为它的思考空间是有界且自洽的;而 agent 系统累积的是外部状态(工具输出、失败的尝试、环境响应),这些会变得自相矛盾或不堪重负。这正好把 Ch6 的 context rot 坐实成了机制和数字,rot 是长度上的退化,context ceiling 是交互轮次累积的污染,两者同源,合起来就是一句话:更多不等于更好。

所以推理算力这个旋钮,该怎么拧?串行更长的推理,适合有界、自洽的子问题,且要在三到七轮的上限内,过了 context ceiling 就反伤。并行的 Best-of-N,适合你有可靠的 selector、任务能独立采样、且任务价值高到付得起 N 倍 token。更前沿的做法是自适应分配,用每一步的不确定性动态决定花多少算力,比均匀分配能省一半 token。收口成一句话就是:把算力花在能改变决策的地方,而不是无脑多塞。作为 harness 工程师,你要判断的是什么时候该让循环花更多推理、什么时候是浪费;至于推理的理论,留给 #4。

6. 向未来外推:五堵墙,和一把你早就有的尺子

到这里,综合的部分讲完了,该做外推了。这一节是整章、也是整条路书的收官 payload,而它用的工具,是 Ch1 早就给你的那一把:墙与轴。agent 工程现在撞在五堵墙上,每一堵都对应着前面那个 harness stack 的某几层。

5 堵当前墙 → 可能的正交新轴(墙与轴 meta-skill,Ch1 立)可靠性墙层:持久+控制+度量可能的新轴:自我验证 / 形式护栏 / trust-gated 渐进自主长程一致性墙层:供给+持久+控制可能的新轴:原生长记忆(→#4)/ 更聪明压缩蒸馏 / 自适应推理multi-agent 成本/同步墙层:协同+控制可能的新轴:运行时自主 delegate / A2A 标准化 / 异步协同eval 难墙层:度量可能的新轴:抗污染私有 benchmark / 可验证 judge / metrics 做成 agent 可读安全墙(两面未解)层:容纳+对抗可能的新轴:架构级安全 6 pattern / Rule-of-Two / 拆 trifecta 的腿METR:50% 可靠的时间视界在涨,但离生产要的 99% 还差一个数量级 —— 这是可靠性墙的量化版
Figure · Layer C 外推:agent 工程当前撞在五堵墙上,每堵墙对应 harness stack 的某几层,也各有一条可能的正交新轴 · 复用 Ch1 立的「墙与轴」meta-skill —— 遇到任何新进展先问:它攻这五堵墙的哪堵?是把老轴推更陡,还是开了一条新轴? · 学生带走的不是未来预言,而是这个可复用的外推动作 · 对应正文 第 6 节

第一堵是可靠性墙,最根本的一堵:agent 还不够可靠到能放手,信任是后台 agent 的头号未解难题,Claude Code 在 2026 年 4 月那次质量事故,三个看似无害的改动叠成一次广泛退化,证明了 harness 级的可靠性和模型的智能同等重要。第二堵是长程一致性墙:离散会话、无跨窗记忆、context rot、context ceiling,当前的解法是把状态卸到文件系统这种外部 artifact 上,但那是工程绕路、不是根治,模型本身仍在每个窗口边界失忆。第三堵是 multi-agent 的成本和同步墙:十五倍 token,而第一成本不是钱、是 context 碎片化,加上同步阻塞的瓶颈。第四堵是 eval 难墙:SWE-bench Verified 在 2026 年 2 月因为污染和缺陷退役,而更深的问题是 OpenAI 那句和 GDPval 那句合起来的,智能变便宜了,知道什么是好的反而成了瓶颈。第五堵是安全墙,两个正交的面都没解:向内的沙盒出口五个月被绕过两次,向外的提示注入连着两版都是 OWASP 头号风险。

这五堵墙每一堵都配了一条可能的正交新轴,但这一章想让你带走的,不是这几条具体的轴,它们可能对、可能错。想让你带走的是那个动作本身:遇到任何一个新进展,先问它攻的是这五堵墙的哪一堵,是把老轴推得更陡,还是开了一条新轴。这就是 Ch1 立的墙与轴 meta-skill,这一章只是把它用了一次。

而那条能力曲线,Ch1 用它给你立坐标,这一章用同一条曲线给你做量化外推。

50% 可完成任务时长 ↑≈15 分≈1 小时≈5 小时202420252026≈ 每 7 月翻倍(2024 以来加速 ≈ 每 3-4 月)2025 初 ≈ 1 小时2026.01 · Opus 4.5 ≈ 320 分⚠ 50% 口径 ≠ 生产可用(~99%)· 时间视界是趋势信号,不是承诺 · METR 无显式预测
Figure · METR 时间视界 —— 模型能以 50% 可靠度完成的任务,换算成人类工时有多长 · 纵轴对数(指数增长)· ≈ 每 7 月翻倍,2024 以来加速到 ≈ 每 3-4 月 · Opus 4.5(2026.01)≈ 320 分钟 · ⚠ 50% 口径 ≠ 生产(~99%),是趋势信号非承诺 · 对应正文 第 4 节

METR 度量的不是解题率,而是模型能以 50% 可靠度完成的任务、对人类要花多长时间。到 2026 年初,前沿模型的这个时间视界大约是五个小时,而且这条曲线在加速,近一两年的倍增周期已经从历史的七个月缩到了大约三个月。但这里要做两条最诚实的标注,它们正好呼应 Ch1 认知弧那条「数字是信号不是保证」。第一,METR 自己没有给任何「几年后能做周级任务」的明确预言,所以任何这类外推都是我们基于趋势的延伸,不是 METR 的承诺,置信区间仍然很宽。第二,也是最重要的,50% 可靠不等于生产可用,生产要的是大约 99%。能力(时间视界)在涨,但从 50% 可靠到 99% 可放手,还差着一个数量级。这条,正好就是第一堵可靠性墙的量化版:这条又陡又在加速的曲线,撞的就是那堵可靠性墙。

7. 学完去哪:角色组合,以及「前沿就绪」

这条路书一开始就承诺,完成它你会成为一个能把模型变成可靠 production agent 的 Agent 工程师。现在你可以兑现这个承诺了,而且可以按你想去的方向组合。如果你想做 Agent 全栈工程师,这条 #8 加上基础(#1)、系统设计(#2)、轻量的数据工程(#3)就是你的主干。如果你想做 Agent 算法研究员,你需要补模型设计(#4)和后训练(#6),而 #8 给你的是一个不可替代的 harness 视角,你会比只懂训练的人更清楚,你训出来的模型最终要活在什么样的 harness 里。如果你想做 Agent 产品经理,#8 让你能和工程师用同一套词汇讨论该不该上多 agent、这个自主姿态合不合适、这堵墙能不能绕。

但这条路书真正想给你的,比任何一个岗位都更长久,那就是「前沿就绪」这四个字的精确含义。它不只是说你现在会搭一个当前的 harness,那个会过时,Codex 的代码下个月就变了。它说的是,你毕业时带走了两样东西:一套能把模型变成可靠 agent 的工程能力,和一把能持续追踪这门学科往哪走的尺子。当 2027、2028 年出现一个你今天还没听过的 agent 新进展时,你不会慌,你会本能地问:它攻的是那五堵墙的哪一堵?是把老轴推更陡,还是开了一条新轴?能问出这个问题,你就不只是这门学科今天的从业者,你是它的持续追踪者。这,就是「前沿就绪」。

综合 · 你毕业了

回头看这一章,也回头看整条路书。这一章你把十一个零件装成了一门学科:你看见自己学的十一章其实是同一个 harness 的九个层,从控制层一直到实证层;你算清了一笔 agent 的生产账,知道了 prompt caching 为什么是头号杠杆、质量速度成本的三角怎么找点、fleet 怎么权衡;你理解了 harness 怎么反过来成为模型训练的契约,以及训练 harness 和生产 harness 为什么是两个产物;你看清了推理算力作为一个旋钮该怎么拧、agent 为什么有个 context ceiling;最后,你用 Ch1 给你的那把墙与轴的尺子,识别了五堵当前墙、对未来做了一次有锚的外推。

再往回看整条 #8。第一站,你拿到了 agent 工程的时间坐标,知道了它怎么从一篇论文里的小技巧长成今天的学科。第二站,你搭起了一个能跑、能用工具、安全、抗劫持的 harness。第三站,你让它扛住了长任务,会管 context、有记忆、能自我改进、能在该用时调动多个 agent。第四站,你学会了度量它、诊断它的失败、读懂真实系统怎么做、并把这一切综合成一门学科、再向未来外推。从一个只会调通 prompt、听得懂 agent 术语的人,到一个能搭、能防、能评、能读真实系统、还能用墙与轴持续追踪这门学科的 Agent 工程师,这就是这条路书承诺过、现在兑现了的能力跃迁。

这条路书的使命叫有教无类:不论你过去是什么背景,只要你有真实的学习意愿和正常的学习能力,你都能顺着它建起扎实的知识体系,既够做前沿研究,也够胜任顶尖实验室的前沿岗位。这条路书把渐进式设计做到了它能做到的最好,而你,读到这里,付出了真实的努力。两者缺一不可,而现在,两者都到齐了。合上书,去搭一个你自己的 harness 吧,不是为了交作业,是因为你现在真的能了。这门学科还在飞快地变,但你已经有了那把尺子,不管它往哪走,你都追得上。

毕业快乐。

本章关键术语

下面是这一章引入的收口性术语;这一章本质是把前面学过的全部串成一门学科,所以新词不多。加粗是术语,带链接的词可点进术语表

  • Harness Engineering · harness 工程 把无状态、健忘、会犯错的模型变成能在真实环境里可靠感知→规划→行动→自我修正的系统的那一整套工程;模型负责会不会想,harness 负责能不能可靠地做
  • Harness Stack · harness 九层 把前 11 章重组成同一个 harness 的九层(控制 / 能力 / 容纳 / 对抗 / 供给 / 持久 / 协同 / 度量 / 实证),每层对应一堵当前墙
  • 质量×速度×成本三角 生产 harness 的核心权衡,没有免费午餐;工程姿势是先定 workload 底线再在三角里找点
  • Prompt Caching · 提示缓存 缓存循环每轮重发的前缀的注意力键值,读取 0.1× 基础价,agent 输入成本降 5-10×;头号失效模式是前缀顶部放变动元素(如时间戳)杀掉整个缓存
  • 训练 harness ≠ 生产 harness 训练 harness 故意宽(最大化探索),生产 harness 故意窄(最小权限);两个对称失败模式:训练过度上锁 / 生产欠围栏
  • Context Ceiling · 上下文天花板 agent(非纯推理模型)的表现在 3-7 轮见顶,之后累积 context 污染反而下降;与 Ch6 的 context rot 同源,更多不等于更好

整条路书的术语在术语表 /glossary里按类别汇总。

参考文献

Mode A · 引用出处(正文 inline,集中列在此)

深 dive 资源(可选 · 想往下走再看)

  • Taxonomy of RL Environments for LLM AgentsHidden Technical Debt: Agent Harness(Lee Hanchung)· 第 4 节 , 环境五元组 · 「environments = new type of data」· 训练 harness ≠ 生产 harness(wide/narrow on purpose)· harness 是模型训练的契约
  • Cursor FastRender / Nubank × Devin(2026 · 厂商披露,数字打折)· 第 3 节 , Planner-Worker-Judge 两千并行 agent · 舰队迁移六百万行代码,production-economics 活案例

说明:本章纯 Mode A,是 #8 的收官章。生产经济学的数字(token 倍数、缓存折扣、Opus 4.7 多产约 35% token、fleet 成本)都是点时刻值、跨版本剧烈波动,引用前按自己的 workload 与版本自测。OpenAI Harness Engineering 的 verbatim 句经二次核实(其页面反爬),引用前建议人工开页核对。METR 数字核到一手,但 METR 本身无显式未来预言,本章任何关于「数天 / 数周级任务进入射程」的话都明确标注为基于趋势的外推、不是预言,且 50% 可靠 ≠ 生产要的 99%。Cursor FastRender、Nubank、context ceiling 3-7 轮等为单一来源 / 厂商披露,按 workload 自测。Layer C 复用 Ch1 的墙与轴 meta-skill 与 MetrHorizonViz(D34 首尾呼应)。

路书完结 · 写给完成 Agent 工程的你

你读到了整条 #8 Agent 工程路书的最后一行。十二章,从「你站在 2026」的时间坐标,到搭一个能跑、安全的 harness,到让它扛住长任务,到度量、诊断、读真实系统、综合成学科、向未来外推,你走完了。

这不是终点,是一个新起点。这门学科还在飞快地变,Codex 的代码、METR 的曲线、五堵墙的形状,都会变。但你带走的两样东西不会过时:一套把模型变成可靠 agent 的工程能力,和一把墙与轴的尺子。去搭,去防,去评,去读真实系统,去追这门学科往哪走。

如果你还想往别的方向走,基础路书是你的地基,系统设计(#2)、数据工程(#3)、模型设计(#4)、后训练(#6)各自是一条新的路。但那些是别的故事了。这一条,到这里,完结。