第 01 章

你站在 2026 · AI 怎么走到今天

纯 Mode A · 技术弧 7 节点(Transformer 2017 → ChatGPT 2022 拐点 → Agent 2025)+ 认知弧 8 个被纠正的判断 + 外推 meta-skill。给整条路书一个'站在现在回望、向未来推演'的时间坐标锚。

约 1.5 小时
开篇 · 这一章给你一张地图,标着「你在这里」

这是 foundations 路书的第 1 章,约 1.5 小时,纯 Mode A。它不教任何具体技术,做一件别的章节不做的事:把你放回时间里

后面 6 章会教你 LLM 是什么、Agent 怎么工作、production 怎么搭。但在学这些概念之前,你需要先知道一件事:这些概念不是凭空出现的,是这个领域用十年时间、撞了一堵又一堵墙、纠正了一个又一个错误认知,才一步步走到今天的。

你是一个 vibe coder,2023 年开始用 ChatGPT,2024 年用 Cursor,2025 年用 Claude Code。对你来说 AI 好像"一直就是这样"。但你习以为常的每一件事,都曾经是不可能、玩具、或奇技淫巧。读完这一章,你会拿到一张地图,看清 AI 从哪里来、现在站在哪、可能往哪去,然后带着这个坐标系进后面的章节,你遇到每个概念都知道它为什么在这个时间点出现

你的时间错觉

让我先点破一个你可能没意识到的错觉。你现在打开 ChatGPT,跟它聊一小时,它记得你前面说的话,能帮你查资料、写代码、调工具,你觉得这很自然,AI 本来就该这样。但这种本来就该这样的感觉,恰恰是学习这个领域最大的认知陷阱,因为你看到的是十年演化的终点快照,不是它走过来的路。

举几个你习以为常但其实来之不易的事。你能直接跟 AI 对话而不是写一段精确指令,这个交互范式 2022 年底才被 ChatGPT 确立;在那之前,能力相近的 GPT-3 已经存在两年,但几乎没有普通人用得上它。你能让 AI 调用工具去搜网页、读文件、跑代码,这个能力 2023 年中才成为标配;在那之前,主流假设是模型该把所有知识都记在脑子里。你能用 AI 写一个完整的小项目而不只是补全一行代码,这种 agent 形态 2024-2025 年才真正可用;2023 年第一批 agent demo(AutoGPT 那一波)炒得很热,但基本是玩具,跑几步就飞、很快就让人失望了。

这些你当成空气的能力,每一个背后都是一次认知的转弯。如果你不知道这条路怎么走来的,你就只是一个会用 2026 年 AI 的人;如果你知道,你就成了一个理解 AI 为什么是今天这样、并能推测它明天会怎样的人。这两者的差距,正是这条路书一开始就立的那句话 —— 会用不等于懂。懂的最深一层,是懂这件事是怎么一步步变成现在这样的

这一章不按知识点组织,按时间组织。我先带你走一遍技术弧(2017 到 2026 发生了什么,每个节点的核心事实是什么),再带你走一遍更值钱的认知弧(我们一次次以为对的事后来怎么被纠正,证据是什么),最后教你一个 meta-skill:怎么站在今天这个时间点,用过去的轨迹推演未来。

1. 技术弧 · 2017 到 2026 的七个节点

先讲技术线。我不做编年史,只挑七个真正改变方向的节点。下面这张图是这一节的脊柱,你可以边读边对回来看自己走到哪:

201720262017 Transformer可并行的地基2018-20 GPT 系列scaling 假设2022.11 ChatGPT引爆拐点2023 GPT-4涌现之争2023-24 工具化RAG+function2024-25 推理+Agento1 新轴2025-26 你在这Agent 工程每条竖线 = 1 年 · 时间从左到右
Figure · AI 演化七节点 · 横轴是线性时间(每格 1 年)· 注意 2017-2020 稀疏、2022 后骤然密集 —— 这就是加速 · ③ 是引爆拐点,⑤(知识:权重→检索)与 ⑥(scaling:训练→推理)是两次范式转移 · 编号对应正文 第 1 节

① 2017 · Transformer 架构诞生。 Google 一篇论文 "Attention Is All You Need" 提出了 Transformer。要理解它为什么是地基,先看它解决的痛点:在它之前,处理语言的主流模型(RNN、LSTM)必须一个词一个词顺序处理,读到第 100 个词时,第 1 个词的信息已经衰减得差不多了,而且这种顺序依赖让它没法在 GPU 上大规模并行。Transformer 的核心机制 attention 让每个词同时看句子里所有其他词,直接算出谁跟谁相关 —— 比如一句话里的"它"指代前面哪个名词,attention 能一步连过去,不受距离影响。这个改动当时看只是一次架构优化,事后看是整个 LLM 时代的地基:能并行就能在成千上万块 GPU 上 scale,没有这一步,后面的一切都不会发生。

② 2018-2020 · GPT 系列与 scaling 假设。 OpenAI 用 Transformer 下了一个赌注:不设计复杂的任务专用结构,只是把模型做大、数据喂多,看会怎样。三代的规模跳跃很说明问题 —— GPT-1(2018)1.17 亿参数,GPT-2(2019)15 亿(OpenAI 当时以"可能被滥用"为由没有立刻全部公开),GPT-3(2020)1750 亿。GPT-3 带来一个让所有人意外的发现,叫 in-context learning:你不重新训练模型,只在 prompt 里给几个例子,它就能学会一个新任务。举个当年的真实例子,prompt 里写"英译法:sea otter → loutre de mer,cheese →",模型直接接出 fromage,没有任何额外训练。这第一次硬证据表明,规模本身会涌现出现学现用的能力,而不只是记住更多东西。但此时 GPT-3 还只活在开发者的 API 调用里,普通人完全不知道它的存在。

③ 2022 年 11 月 · ChatGPT,真正的拐点。 OpenAI 把一个经过 RLHF(基于人类反馈的强化学习)调教过的 GPT-3.5 套上聊天界面、免费开放,结果是史上最快达到 1 亿用户的产品 —— 5 天破百万,约 2 个月破 1 亿。这个数字的分量,要跟别的现象级产品比才看得出来:

ChatGPT~2 个月TikTok~9 个月Instagram~30 个月← 越短 = 采用越快
Figure · 达到 1 亿用户耗时 · ChatGPT ~2 月 vs Instagram ~30 月 · GPT-3 早两年存在却几乎无消费者触达 → 引爆点是 chat UI + RLHF + 免费,不是裸能力

这里藏着一个关键认知点:改变世界的不是模型能力本身,因为能力相近的 GPT-3 早就在了。引爆来自三件事叠加 —— RLHF(2022 年 InstructGPT 工作)让模型学会听懂人话、按人的偏好回答,chat 界面让普通人零门槛可用,免费让规模引爆。技术能力是必要条件,但产品形态和可及性才是引爆点。这件事给整个行业上了一课,也是为什么这条路书反复强调工程和产品跟模型能力同等重要。

④ 2023 · GPT-4 与涌现之争。 GPT-4(2023 年 3 月)能力大幅跃升,还能看图(多模态)。微软一篇论文用了 "Sparks of AGI"(AGI 的火花)做标题,引发激烈争论:模型到底真的涌现出了智能,还是只是更大规模的统计拟合?对立的一方是更早的 "stochastic parrots"(随机鹦鹉)论,认为模型只是在统计上拼接见过的文字,没有真正理解。这场争论本身比答案更重要 —— 它逼着整个领域去认真定义什么算理解、什么算推理,这两派的张力下一节会展开。

⑤ 2023-2024 · 工具化转向。 一个重要的认知转弯发生了。大家原本假设模型应该把所有知识记在权重里,越大越无所不知。但现实撞到三堵墙:模型有训练数据截止时间,不知道训练之后发生的事;它会编造事实(hallucination);它不知道你公司的内部信息。解法不是把模型做得更大,而是给它外挂能力 —— function calling(OpenAI 2023 年 6 月推出)让模型能调用外部工具,RAG(检索增强生成,概念来自 2020 年的研究,2023 年大规模产品化)让模型先查真实资料再回答。知识从全塞进权重,转向按需检索加工具获取,这是 Agent 时代的技术前提。

⑥ 2024-2025 · 推理模型与 Agent 崛起。两件大事并行。一是 OpenAI 的 o1(2024 年 9 月)开启 reasoning models,让模型在回答前先生成大量思考过程,用推理时的算力换正确率 —— 在 AIME 2024 竞赛数学上,不专门思考的 GPT-4o 只解出约 13% 的题,o1 能到 70% 以上(下一节认知二会用这个数字讲清"新轴"的意义)。这开了一条全新的能力轴:不只是训练时把模型做大,还可以推理时让它想更久。二是 Agent 从 2023 年的玩具 demo,经过工具化和推理能力的成熟,2024-2025 年真正可用了,Claude Code、Codex、Cursor 这些能自主跑多步任务的工具进入日常工作流。同期 DeepSeek 用 V3 和 R1(2024 底到 2025 初)证明了效率路线:V3 训练成本约 550 万美元,而 GPT-4 一类模型估计要上亿美元,且 DeepSeek 开放权重,证明小成本也能做出对标顶尖的能力。

⑦ 2025-2026 · 你在这里。 Agent 工程成为一门独立学科,MCP(Model Context Protocol,2024 底由 Anthropic 推出)开始统一工具生态。前沿实验室(OpenAI、Anthropic、DeepSeek、DeepMind)的招聘 JD 里,Agent harnesscontext engineering、evals、code taste 全部成了入场 baseline。你现在学 foundations,就站在这个时间点 —— AI 从能聊天长成能自主干活的转折刚刚完成、Agent 工程方法论正在成形的时刻。

2. 认知弧 · 我们一次次纠正了什么

技术线是表层,认知线是里层,也是这一章最值钱的部分。一个领域的成熟,不靠不断累加新知识,而靠不断纠正旧的错误认知。我挑八个这十年里被纠正过的重要判断,每个都用同一个结构讲清:我们曾以为什么,撞到了什么墙,证据是什么,现在怎么理解。你要学的不是这八条结论本身,是这个领域如何自我纠错的 pattern —— 内化了这个 pattern,你对未来任何一次炒作或唱衰都会有免疫力。

认知一 · 从"它只是随机鹦鹉"到"它做的事比拼接复杂得多"。 ChatGPT 出来后,一派有影响力的批评来自 Bender 等人 2021 年的 "stochastic parrots" 论文,核心论证是:模型只是根据训练语料的统计规律拼接文本,本身没有指向意义的理解,像鹦鹉学舌。这个判断撞到的墙是 in-context learning 和涌现能力 —— 一个纯粹拼接见过文字的系统,不该能靠 prompt 里几个例子就学会一个训练时没专门教过的新任务,但 GPT-3 做到了。现在领域的共识更微妙:模型确实是 next-token prediction 机制,但这个机制在足够规模下产生了远超记忆的泛化能力;它到底算不算理解仍是开放问题,但它只是查表拼接这个简单否定已经站不住了。这一条教你的 pattern 是:对一个新事物的简单贬低,往往低估了规模带来的质变。

认知二 · 从"scaling 快到头了"到"墙会移动,新轴会打开"。从 GPT-2 那一代起,几乎每隔一阵就有人断言模型不可能再大、提升即将见顶,而这个断言一次次被证伪。两篇关键研究撑着乐观派的信心:Kaplan 等人 2020 年的 scaling laws 发现,模型能力随参数量、数据量与算力以可预测的幂律平滑增长,等于给"做大就会变强"一个量化保证;Hoffmann 等人 2022 年的 Chinchilla 再修正一步,指出给定算力预算下存在一个最优的参数量与数据量配比,此前不少模型其实是喂数据不足的大模型,把数据补够比一味堆参数更划算。于是连着好几年,扩大预训练规模这条路一路兑现,乐观派每次都赢。

真正的墙出现在 2024 年前后:纯靠继续放大预训练,边际收益明显放缓,投入翻倍也换不回过去那种能力跃升。按"scaling 到头了"的老剧本,这就该是天花板了。但突破没有发生在把预训练曲线硬推得更陡上,而是换了一条轴。OpenAI 的 o1(2024 年 9 月)让模型在给出答案前先生成大量思考过程,用推理时的算力去换正确率。这条新轴有多硬,一个数字就够:在 AIME 2024 这套高难数学竞赛上,不专门思考的 GPT-4o 只解出约 13% 的题,而 o1 单次作答约 74%,允许多次采样投票后约 83%。同一个底座模型,只是被允许想得更久,正确率就翻了五倍不止。这才是正交新轴的字面意思——不是更大的预训练,而是一种过去根本没被当成变量的算力。

训练时算力 →能力 ↑预训练 scaling~2024 放缓推理时算力(o1)= 新轴换一种算力,不是更多训练“scaling 到头了”反复落空
Figure · 预训练 scaling 放缓(墙)时,推理时算力从墙处岔出一条新轴 —— 是换了一种算力,不是更多训练 · 示意趋势非真实数据

记住这条的 pattern,它在外推时格外值钱:当一条增长曲线放缓,真正的突破往往不是把这条曲线推得更陡,而是找到一条与它正交的新轴。

认知三 · 从"hallucination 是个能修掉的 bug"到"它是机制内在的,只能管理"。最早大家把模型一本正经地胡说八道当成阶段性毛病:训练数据再多些、再干净些,这问题自然会消失。2023 年 6 月的一件真事戳破了这个预期。纽约一位律师在一桩状告航空公司的案子(Mata 诉 Avianca)里,用 ChatGPT 检索判例,并把结果直接写进了正式法庭文书,其中"Varghese 诉中国南方航空"等好几个判例引述得有模有样,案号、引文、裁判要旨一应俱全。唯一的问题是,这些判例根本不存在,全是模型编出来的。更说明问题的是,这位律师事后承认,他追问过 ChatGPT 这些案子是不是真的,模型回答得斩钉截铁:是真的。法官最终对涉事律师作出了处罚。

这件事撞破的墙是:hallucination 不是训练不足的 bug,而是 next-token prediction 这套机制投下的影子。模型的本职是预测下一个最可能的 token,在训练数据稀疏、或它其实不知道答案的地方,它不会停下来说不知道,而是顺着语言的统计规律拼出一段读上去天衣无缝的内容。在"像不像一个合理的下一个 token"这个尺度上,一个编造的案号和一个真实的案号并没有区别。正因如此,业界的姿态从修掉它转向了管理它:用 RAG 给模型外挂真实资料、用 grounding 要求它给出可核查的来源、用 verification 在关键事实上事后查证。

这一条的 pattern 是:有些问题不是能打补丁的缺陷,而是某种工作机制的固有影子。对这类问题,正确的工程姿态是设计系统去约束它、给它装上护栏,而不是寄望下一版更新把它根除。

认知四 · 从"模型越大越好"到"效率和后训练同样决定胜负"。 一度的直觉是参数量就是一切,谁的模型大谁强。撞到的墙来自几个方向:Chinchilla 研究显示给定算力下一味做大反而浪费,存在最优配比;模型蒸馏让小模型能继承大模型的能力;2024-2025 年 DeepSeek 等用远低的成本做出对标顶尖的模型。现在的理解是原始规模只是一个维度,后训练质量(RLHF、RLVR)、推理效率、数据质量同样甚至更决定一个模型好不好用。这一条教你的 pattern 是:当一个指标被当成唯一目标时要警惕,真实世界的优劣几乎总是多维的。

认知五 · 从"定制模型靠 fine-tune"到"大多数场景 RAG 加 prompt 就够了"。 早期一个普遍假设是想让模型适配你的业务就得 fine-tune,在你的数据上再训练一遍。撞到的墙是 fine-tune 成本高、容易过拟合、模型一升级又得重训。现实演化出来的优先级是:绝大多数定制需求,用 RAG 检索你的资料加精心设计的 prompt 就能解决,又快又灵活;fine-tune 退居到少数真正需要改变模型行为风格的场景。这一条教你的 pattern 是:面对一个新需求,先问能不能用更轻的手段解决,重武器留到证明确实必要时再上。

认知六 · 从"prompt engineering 是奇技淫巧"到"它是正经工程学科"。 ChatGPT 早期,提示词技巧被很多人当成会过时的小聪明,觉得模型变强了这些 trick 自然就不需要了。撞到的墙是:随着 Agent 任务变长、context 变复杂,怎么组织给模型的信息成了决定系统成败的核心问题,远不是几个 trick 能概括。它演化成了 context engineering,一门关于在有限 context 里放什么、怎么放、何时压缩的严肃工程。DeepSeek 的招聘 JD 把 Prompt Engineering、Context Engineering、Harness Engineering 并列为三门子学科。这一条教你的 pattern 是:一个看似要被淘汰的技巧,如果它解决的是结构性问题,往往会进化成一门学科而不是消失。

认知七 · 从"Agent 是炫酷玩具"到"Agent 工程是核心领域"。 2023 年 AutoGPT 那一波 agent demo 炒得火热,但实际一用就发现问题:跑几步就跑飞、不可靠、烧钱、没法 debug,热度很快退潮,不少人断言 agent 是伪命题。撞到的墙后来被几件事突破:工具化让 agent 有了真实能力,推理模型让它决策更稳,harness 工程(怎么管理 agent 的循环、记忆、错误恢复)逐渐成熟。到 2025 年,Claude Code 这类 agent 工具已经是工程师日常,Agent 工程成了前沿实验室的核心招聘方向。这一条教你的 pattern 是:第一波炒作的失败不代表方向错,可能只是配套的工程基础还没到位,区分方向错和时机未到是高级判断力。

认知八 · 从"盯着 AGI 什么时候到"到"按能力逐项看"。 从 ChatGPT 起,公共讨论一直纠缠 AGI(通用人工智能)还有几年。这个问题的麻烦在于 AGI 没有公认定义,讨论容易变成立场之争而非事实判断。更成熟的视角是放弃单一的 AGI 时间表,转而逐项看具体能力:写代码到了什么水平、长任务可靠性到哪、多模态理解到哪、自主决策的边界在哪。这一条教你的 pattern 是:当一个宏大叙事让讨论变得无法证伪时,把它拆解成可观察、可度量的具体维度,这是工程判断力对抗叙事泡沫的基本功。

3. 外推 · 怎么站在今天推演明天

学完前两节,你手里有了技术弧和认知弧。最后一节教你怎么用它们 —— 不是预测未来(预测会立刻过期且常常错),而是掌握外推的方法,这是一个比任何具体预测都耐用的 meta-skill。

外推的核心方法藏在认知弧里。这个领域每一次真正的进步,都遵循同一个节奏:撞到一堵墙,理解这堵墙的本质,找到一条结构性的解法,而这条解法常常是一条全新的轴而不是把老轴推得更远。把这十年的几次大突破按这个节奏排开,pattern 一目了然:

沿老轴前进结构性新轴先理解墙的本质RNN 不能并行Transformer能力强但用不上ChatGPT(RLHF+UI)知识锁在权重RAG + 工具预训练放缓推理时算力
Figure · 每次真正进步的节奏:撞墙 → 理解墙的本质 → 找到结构性新轴 · 这个 pattern 重复过四次

看清这个节奏,你外推未来就有了方法:不是去猜下一个大模型多少参数,而是去问现在挡在前面的墙是什么、这堵墙的本质是什么、什么样的新轴可能绕过它。那么站在 2026,前面有哪些墙?我列几个当前明显的,不是要你记住答案,是给你练外推的素材。可靠性的墙:Agent 在长任务上仍然会跑飞,几十步之后容易累积错误,这限制了它从助手变成可托付的同事。成本的墙:推理模型想得越久越贵,大规模部署的经济性仍是真问题。评测的墙:我们其实还不太会衡量一个 Agent 到底好不好,没有好的 sensor 就没法系统改进,这正是为什么 evals 成了入场 baseline。记忆与上下文的墙:Agent 跨越长时间、多任务保持连贯仍然很难。对齐的墙:能力越强,确保它按人的意图行事的难度越大。

你现在不需要解这些墙,只需要建立一个习惯:遇到任何 AI 新闻、新产品、新论文,先问它在攻哪堵墙、用的是老轴还是新轴。一个只是把老轴推得更远的进展,和一个开了新轴的进展,意义完全不同,后者才是真正改变方向的。这个判断习惯,就是 mission 里为前沿研究做准备的种子 —— 前沿研究的本质,就是站在这条轨迹的最前端,辨认下一堵墙、想象下一条轴。

收官 · 你现在有了地图

回头看你这一章拿到了什么。你拿到了一条技术弧,从 2017 的 Transformer 到 2026 的 Agent 工程,七个真正改变方向的节点,每个都带着它的核心事实:attention 让训练可并行、in-context learning 的惊讶、ChatGPT 两个月破亿背后的三件事、o1 用推理算力开新轴、DeepSeek 的效率证明。你拿到了一条更值钱的认知弧,八个被纠正过的判断,每一个都有它的原始论证和反例,教你一种这个领域自我纠错的 pattern。你还拿到了一个外推 meta-skill:用墙与轴的节奏,把过去的轨迹延伸到对未来的推理。

这一章是整条 foundations 路书的视角锚。从下一章起,你会开始学具体概念 —— LLM 的心智模型、token 经济学、Agent 词汇、production 工程、系统判断力。但你不再是空降到这些概念的终态,你知道每一个概念是这条路上哪一次撞墙的产物:你学 RAG 时会想起这是知识锁在权重里那堵墙的解法,你学 reasoning 时会想起这是预训练放缓后开的新轴,你学 evals 时会想起这是可靠性和评测那两堵墙逼出来的入场券。

带着这张标着"你在这里"的地图,进下一章。下一章(Ch 2)进入 Stage 1 的核心 · LLM 心智模型加工程通识词汇 —— 我们把 AI 是什么从一个模糊的时代印象,收敛成一个你能在脑子里跑、能用来预测行为的精确模型。

本章时间线速查

技术弧七节点:2017 Transformer 架构(attention 让训练可并行,LLM 地基)· 2018-2020 GPT 系列(GPT-3 1750 亿参数 + in-context learning 涌现)· 2022.11 ChatGPT(2 个月破亿 · 引爆来自 RLHF + chat UI + 免费,不是裸能力)· 2023 GPT-4 多模态 + Sparks of AGI vs 随机鹦鹉之争 · 2023-2024 工具化(function calling + RAG,知识从权重转向检索)· 2024-2025 推理模型(o1 推理算力新轴)+ Agent 崛起 + DeepSeek 效率路线(V3 约 550 万美元)· 2025-2026 Agent 工程成学科 + MCP 统一生态(你在这)

认知弧八纠正:随机鹦鹉 → 规模带来质变 · scaling 到头 → 墙移动新轴开 · hallucination 是 bug → 机制内在只能管理 · 越大越好 → 效率与后训练同样决定 · 定制靠 fine-tune → RAG 加 prompt 优先 · prompt 是奇技淫巧 → 进化成 context engineering 学科 · Agent 是玩具 → 工程到位后成核心领域 · 盯 AGI 时间表 → 按能力逐项看

外推 meta-skill:每次进步 = 撞墙 → 理解墙本质 → 找结构性新轴 · 遇新进展先问攻哪堵墙、老轴还是新轴 · 当前的墙:可靠性 / 成本 / 评测 / 记忆上下文 / 对齐

参考文献

Mode A · 引用出处(正文 inline,集中列在此)

  • "Attention Is All You Need"(Vaswani et al, 2017)· Transformer 架构原始论文 · arxiv.org/abs/1706.03762
  • "Language Models are Few-Shot Learners"(Brown et al, 2020)· GPT-3 论文 · in-context learning 的来源 · arxiv.org/abs/2005.14165
  • "Training language models to follow instructions"(Ouyang et al, 2022)· InstructGPT / RLHF · ChatGPT 背后的关键技术 · arxiv.org/abs/2203.02155
  • "On the Dangers of Stochastic Parrots"(Bender et al, 2021)· 随机鹦鹉论的原始出处 · 认知一的反方
  • Scaling Laws(Kaplan et al, 2020)+ Chinchilla(Hoffmann et al, 2022)· scaling 假设的两篇关键研究 · 深入归 #5 预训练路书
  • OpenAI o1 · "Learning to Reason with LLMs"(2024)· 推理时算力新轴的来源 · AIME 2024:GPT-4o ~13% → o1 ~74%(单次)/ ~83%(多次采样投票)· openai.com/index/learning-to-reason-with-llms
  • Mata v. Avianca, Inc.(S.D.N.Y. 2023)· 律师提交 ChatGPT 编造的判例被法院处罚 · 认知三 hallucination 机制内在性的真实案例
  • DeepSeek Agent Harness PM JD · Prompt / Context / Harness Engineering 三子学科定位 · 收录 teaching-system/research/foundations/synthesis.md

深 dive 资源(可选 · 想往下走再看)

AI 演化全景:

  • Andrej Karpathy · Intro to Large Language Models · 1h · 这个视频我们在 Ch 2 会作为必看 Mode B,它本身也带很强的演化视角
  • "Sparks of AGI"(Microsoft Research, 2023)· GPT-4 涌现之争的代表性论文 · 读时注意它的争议性

下一章

下一章(Ch 2)进入 Stage 1 核心 · LLM 心智模型加工程通识词汇。你已经有了时间坐标,现在把 AI 是什么收敛成一个精确的、可预测行为的心智模型,并补全 25 个 SWE 通识词汇。这是你从会用 AI 的人变成懂 AI 系统的 builder 的第一步