第 01 章

你站在 2026 · AI 系统怎么走到今天

AI 系统设计这门工程,怎么从单卡训练一个模型,长成 2026 年要把模型服务给几亿人的 warehouse-scale 工程。带你走一遍它的技术弧和四次撞墙纠正,拿到「墙与轴」这把外推尺,给整条路书一个时间坐标。前置:完成 #1 基础。

约 2 小时
开篇 · 给 AI 系统设计一张地图,标着「你在这里」

这是系统设计路书的第 1 章,约 2 小时,纯 Mode A。它不教任何一项具体的 serving 技术,做一件别的章节不做的事:把 AI 系统设计这门工程放回时间里,让你看清它怎么从「在一个集群上训练一个模型」,长成 2026 年「把一个模型可靠地服务给几亿人」的 warehouse-scale 工程。

你是从基础路书走过来的。在那条路上你已经建立了 latency、throughput、cost 这组权衡的直觉,也知道了 GPU、缓存、队列这些零件大致是什么。这一章不重教这些,它从那里接着往上走:当一个模型大到一张卡装不下、当用它的人多到一个进程扛不住,会冒出一整类新的工程问题 —— 这类问题,就是这条路书要回答的。读完你会拿到一张专属于 AI 系统设计的地图,带着它进后面 11 章,你遇到每个系统概念都知道它是被哪一堵墙逼出来的。

0. 你站在哪里

先给你两个画面,中间隔着五年。2020 年,OpenAI 训练 GPT-3,一个一千七百五十亿参数的稠密模型,本质上是把一个大模型放在一个大集群上训出来,工程的主战场是「怎么把这一次训练跑完」。2022 年 11 月底,ChatGPT 上线,五天冲到一百万用户、两个月冲到约一亿,工程的主战场一夜之间换了地方 —— 不再是训练那一次,而是「怎么把这一个已经训好的模型,持续地、便宜地、不宕机地,服务给源源不断涌进来的人」。同一类技术,五年时间,重心从训练一个模型,搬到了服务一个模型。这门关于「怎么把模型服务到规模」的工程怎么长出来的,就是这一章要回答的。

要讲清楚这件事,得先说清楚这一章和基础路书的分工,否则你会觉得我在重复。基础路书教你 latencythroughputcost 是一组要权衡的旋钮,教你单机上一个 LLM 应用大概怎么搭。这一章从那里往上钻一层,只讲一件事:当规模把这些旋钮逼到极限 —— 模型大到单卡装不下、请求多到单机扛不住、集群大到必然有机器坏 —— 会逼出一整门工程。基础路书给你的是单机视角的零件和直觉,这一章开始讲多机、生产规模、高可用的真实系统。

为什么非要先讲历史再讲技术?因为 AI 系统设计现在正处在一个特别容易让人误判的阶段。它足够成熟,成熟到有了专门的岗位、专门的开源系统、专门的论文;但它又足够年轻,年轻到三年前的「最佳实践」今天已经被换了一轮。如果你不知道这条路是怎么走过来的,你很容易把某个今天流行的做法当成永恒真理。这一章按时间组织而不是按知识点组织,先带你走技术弧(这门工程怎么长出来的五个节点),再带你走更值钱的认知弧(这个领域撞过哪些墙、纠正了哪些判断),最后把基础路书教过的「墙与轴」这个工具对准 AI 系统的未来,教你怎么自己外推。

1. 技术弧 · 从训练一个模型到服务一个模型

AI 系统设计的演化有一条清晰的主线:工程的重心,从「训练这一次」一路向「服务无数次」迁移。我把它拆成五个节点,每个节点你只要抓住一件事:它把重心往 serving 那头推了多远。

2020GPT-3单卡谱系训练175B · 一个大集群2022ChatGPT上线即危机亿级用户 serving2023vLLMPagedAttentionKV cache 分页2024PD 分离 + 1Mprefill/decode 拆MoE warehouse2025DeepSeek 开源完整 infra 栈开源给全行业2026DeepSeek V41.6T · FP4前沿仍在走工程重心:服务模型(serving)训练模型(training)
技术弧 · 从「训练一个模型」到「把一个模型服务给几亿人」——工程重心逐年向 serving 迁移

1.1 起点 · 训练一个大模型(2020)

故事从 GPT-3 开始。2020 年 5 月,OpenAI 发布这个一千七百五十亿参数的模型,它是「稠密模型 + 大集群」这个训练时代的标志:所有参数在每次前向都参与计算,工程的核心挑战是怎么把这么大一次训练在一个集群上跑完。这个时代里,系统设计基本等同于训练基础设施,而服务还不是一个让人头疼的问题,因为用的人还不多。记住 GPT-3 是稠密的,后面 DeepSeek 那个稀疏的 MoE 模型会和它形成鲜明对照 —— 那是这条弧上一个重要的转折。

1.2 撞墙时刻 · ChatGPT 把 serving 推上主战场(2022)

2022 年 11 月 30 日,ChatGPT 上线。它五天到一百万用户、约两个月到一亿,是当时增长最快的消费级应用。这件事对 AI 系统设计的意义,不在于模型本身,而在于它第一次让整个行业撞上了一堵新墙:一个模型训好只是开始,真正的工程地狱是把它持续服务给亿级用户。训练是一次性的投入,而服务是每一次对话都要付的账,且永不停歇。从这一刻起,推理服务从一个附属问题,变成了系统设计的主战场,而这条路书的主脊(Ch4 到 Ch7)讲的就是这场仗怎么打。

这堵墙背后有一个值钱的经济学事实,值得你现在就记住。有一份被反复引用的成本分析指出,在任何有规模的部署里,推理的总成本会远超训练成本 —— 因为模型训一次,却要被服务亿万次。换个说法:训练像是盖一栋楼的一次性造价,服务像是这栋楼此后每天的水电运营,楼用得越久、住的人越多,运营成本的累积就越是把那次造价远远甩在后面。这就是为什么这门工程的重心会不可逆地倒向 serving。

模型生命周期 →训练一次性服务每次便宜 · 次数天文数字 · 永不停···
成本墙 · 训练一次是一根一次性的尖峰;服务无数次,累积面积远超训练——所以规模之战在推理

1.3 serving 成为一门工程 · vLLM 与连续批处理(2022 – 2023)

撞了墙就得有人来解。2023 年,一个叫 vLLM 的开源系统成了这门工程的里程碑。它出自 UC Berkeley 的 Sky Computing Lab(就是做出 Spark 和 Ray 的那个谱系,Ion Stoica 的组),核心贡献叫 PagedAttention,发表在系统领域顶会 SOSP 2023。它的想法非常漂亮:把操作系统管理虚拟内存的「分页」机制,搬来管理 LLM 推理时那块最吃显存的 KV cache,从而几乎消灭了显存碎片、还能让多个请求共享缓存。这是一个典型的「用经典系统智慧解新问题」的样本,vLLM 也因此成了开源推理引擎的事实标准 —— 你在 Ch7 会逐行走读它。

这里要诚实地把功劳分清楚。让 GPU 不闲着的另一项关键技术叫连续批处理(动态地把请求拼成一批喂给 GPU,不必等一整批都结束),它的首创其实是更早的 Orca 论文(OSDI 2022,论文里管它叫「迭代级调度」),不是 vLLM。vLLM 的历史地位,是把 PagedAttention 这个原创贡献和连续批处理这类已有技术组合成了一个赢得整个生态的开源引擎。把这件事看清楚很重要:系统设计领域的进步,常常不是某一个孤立的天才发明,而是把对的几块拼成一个真正好用的系统。

1.4 规模再上一层 · 分离与稀疏(2024)

到 2024 年,serving 这门工程又往前迈了两步,都是为了在更大规模上更省。第一步叫 prefill/decode 分离。一次推理其实有两个阶段:并行处理你那段 prompt 的 prefill,和逐个吐字的 decode,这两个阶段的资源脾气截然相反,塞在一起会互相拖累。2024 年,微软的 Splitwise 和一篇叫 DistServe 的论文(OSDI 2024)把这两个阶段拆到不同机器上各自优化 —— 这是 Ch6 的核心思想,它的源头在这里,而不是后来更出名的 DeepSeek。第二步是上下文窗口的量变:2024 年 2 月 Gemini 1.5 成为第一个广泛可用的百万 token 上下文窗口的模型。这件事很重要,但它的意义常被误解 —— 它不是说「上下文的问题解决了」,而是说那堵墙被往后推了,没有消失,这一点下一节的认知弧会讲透。

1.5 学科化 · 完整 infra 栈被开源(2025 · 你在这里)

走到 2025 到 2026,你就站在 AI 系统设计刚刚定型为一门成熟工程的时刻。一个标志性的事件来自 DeepSeek。2024 年 12 月,他们发布 DeepSeek-V3 的技术报告,这是一个六千七百一十亿参数、但每次只激活约三百七十亿的稀疏 MoE 模型(和开头那个稠密的 GPT-3 正好两极),报告里有一整节专门讲基础设施:两千零四十八张 H800、约两百七十九万 GPU 小时、FP8 混合精度训练、用一套叫 DualPipe 的方法把通信藏进计算。更关键的是 2025 年 2 月,他们办了一场「开源周」,一天放一个组件,把 FlashMLA、DeepEP、DeepGEMM、DualPipe、EPLB、3FS 这套完整的生产级 infra 栈开源给了全行业。一个领域成熟到可以把自己最核心的基础设施摊开给所有人看,本身就是它定型的最强信号 —— 这条路书后面会反复引用这套真实系统作素材。

与此同时,另一条开源推理引擎 SGLang 也成熟起来,它的 RadixAttention 用一棵基数树自动复用前缀缓存,是 vLLM 的有力竞争者,连 DeepSeek 都官方推荐用它来部署自己的模型。两条引擎并存,意味着这门工程已经有了自己的生态。你现在学 AI 系统设计,学的就是这门刚刚定型、还在快速演化的工程 —— 这既意味着没有太多历史包袱,也意味着你需要这一章给你的时间坐标,才不会把某个临时做法当成永恒。

就在你读到这里的此刻,这门工程仍在快速往前走。2026 年 4 月,DeepSeek 又开源了 V4,一个约一万六千亿参数、用上更激进的 FP4 精度、上下文长到一百万 token 的新旗舰;英伟达的卡也从本章讲到的 Hopper 世代,一路走到了 Blackwell、Rubin 好几代之后。这恰恰是这一章要给你时间坐标的原因:具体的型号和数字每隔几个月就会变,但「领域怎么走到今天」的脉络、和后面要讲的「撞墙开新轴」那套方法不会变,握住后者,你才追得动前者。

2. 认知弧 · 这个领域纠正过的四个判断

技术弧是表层,认知弧是里层,也是这一章最值钱的部分。一个领域成熟,靠的不是不断堆新技术,而是不断纠正自己曾经以为对的判断。AI 系统设计这几年纠正过的判断里,我挑四个最重要的,每个都用同一个结构讲:曾以为什么、撞到什么墙、现在怎么理解、它教给你一个什么可迁移的 pattern。你要学的不是这四条结论本身,而是这个领域如何自我纠错的节奏 —— 而且你会发现,这四次纠正全都长着同一个形状,这个形状就是你在基础路书学过的墙与轴。

撞到的墙开出的新轴单卡装不下模型分布式 / 并行(切到多机)训练完才发现服务才是主场推理服务成独立工程(serving)卡间搬数据比算还慢集合通信 + 通信-计算重叠几千卡跑几周必有故障容错 + SRE 成一等工程
墙与轴 · 系统设计的四次纠正——每堵墙不是把老办法用更狠,而是开一条正交的新轴(同 #1 Ch1)

认知一,从「模型不够强就买更大的机器」到「单卡装不下,必须切到多机」。最初的直觉很自然:模型变大了,那就用一台更强的机器、一张更大显存的卡。撞的墙是物理的 —— 一个六千多亿参数的模型光权重就约 1.3TB,这个世界上不存在能装下它的单卡,连把它加载进来用于服务都做不到,更别说训练。所以现在分布式不是一个可选的优化,而是默认的前提:你必须把模型本身切开,分散到很多张卡上协同。这一条教你的 pattern 是,当规模撞上单点的物理上限,出路不是找一个更大的单点,而是切开、分布。它是后面 Ch2 整章的由来。

认知二,从「训练才是主战场」到「服务才是规模的主场」。早期大家的注意力都在训练:谁的模型更大、训得更好。撞的墙就是 ChatGPT 那一刻 —— 模型训一次,却要服务亿万次,成本和工程的重心其实在推理这一头。于是推理服务从训练的附属,独立成了一门有自己的论文、自己的开源系统、自己的岗位的工程。这一条的 pattern 是,要分清一次性成本和重复性成本,真正的工程重心往往在那个会被重复无数次的环节,这正是这条路书把主脊放在 serving 上的理由。

认知三,从「堆更多 GPU 就能更快」到「卡间搬数据比算还慢,通信是新瓶颈」。把模型切到多机之后,新的直觉是「卡越多越快」。撞的墙是通信 —— 卡和卡之间搬运数据(梯度、激活、中间结果)的开销,经常比计算本身还大,堆卡到一定程度,加的卡几乎全耗在等数据上。于是一整套技术围绕这堵墙长出来:高效的集合通信、把通信藏进计算的重叠(DeepSeek 的 DualPipe 就是一个极致样本)、以及对 NVLinkInfiniBand 这些互联带宽的精打细算。这一条的 pattern 是,当你把一个系统拆成很多个协作单元,瓶颈往往从「单元算得多快」变成「单元之间通信多贵」,这是 Ch3 的主题。

认知四,从「单机可靠就够了」到「规模之下,故障是常态,容错是一等工程」。小规模时,你默认机器是可靠的,坏了是意外。撞的墙是大数定律 —— 当你用几千张卡连续跑几周,某张卡、某条网络、某个节点在这段时间里出故障几乎是必然事件,「机器可靠」这个假设彻底失效。于是可靠性工程(容错、检查点可观测性、SRE)从一个运维杂务,升级成了和性能并列的一等设计维度:DeepSeek-V3 那次两百多万 GPU 小时的训练做到「零不可恢复的回滚」,本身就是一项了不起的系统工程成就。这一条的 pattern 是,规模会把小概率事件变成必然事件,所以系统设计必须从「假设不出错」转向「假设一定会出错、并能扛住」,这是 Ch10 的内核。

讲完这四条,我要把那个一直在背后的形状点出来。你回头看,这四次纠正没有一条是孤立的,它们全长着同一个样子:撞到一堵墙,然后不是把老办法用得更狠(买更大的机器、堆更多的卡),而是开出一条正交的新轴(分布式、独立的 serving 工程、通信优化、容错工程)。这就是你在基础路书学的墙与轴,只不过这次它不是一个抽象工具,而是这个领域真实发生过的四次动作。把这一点想透,你就明白这一章为什么值钱:你学到的不是四条要背的事实,而是撞墙开新轴这个可以反复复用的认知动作,下一节我们就用它来看未来。

3. 外推 · 用墙与轴看明天

最后一节教你怎么站在 2026 往前看。注意,目标不是预测具体的未来(具体预测会立刻过期),而是掌握外推的方法。方法你已经有了,就是墙与轴 —— 既然这个领域每次真进步都是撞墙开新轴,那么外推未来的正确问法就不是「下一代卡有多少显存」,而是「现在挡在前面的墙是什么、什么样的新轴可能绕过它」。

那么站在 2026,AI 系统设计前面有哪几堵明显的墙?我列几堵,不是要你记住,是给你练外推的素材,也是 Ch12 收官那一节会回收的。内存墙仍在:模型和上下文都在变大,单位算力能摸到的内存和带宽始终是紧约束 —— 注意百万 token 上下文的出现没有拆掉这堵墙,只是把它往后挪了,长上下文的服务成本和质量退化依然是真问题。能耗与散热的墙:集群规模逼近数据中心的供电和散热上限,电力开始成为比芯片更硬的约束。规模可靠性的墙:集群越大,维持它稳定运行本身就越难。网络带宽的墙:模型越稀疏、越分布式,卡间通信的压力越大,互联带宽经常先于算力成为瓶颈。还有一堵新墙,是这条路书 Ch11 专门要讲的 —— 当生产里跑的不再是一个模型、而是成千上万个 agent 会话时,怎么把 agent 当一个服务运营在规模上,是一类刚刚浮现、还没定型的系统问题。

所以你现在不需要去解这些墙,只需要养成一个习惯:遇到任何 AI 系统的新闻、新芯片、新框架,先别问它的参数多炫,先问它在攻哪一堵墙、用的是把老轴推得更远(更大的卡、更多的机器)还是开了一条正交的新轴(一种新的分离、一种新的精度、一种新的调度)。一个只是把老轴推远一点的进展,和一个开了新轴的进展,意义完全不同,后者才真正改变方向。这个判断习惯,就是这条路书使命里「为前沿研究做准备」的种子 —— 前沿系统研究的本质,就是站在这条轨迹的最前端,辨认出下一堵墙、想象出下一条轴。

4. 这门课的边界 · 以及你将走的路

在你出发之前,有必要划清这门课教什么、不教什么,免得你在错的地方期待错的东西。这门课教的是 AI 系统设计 —— 怎么把训练好的模型服务到生产规模,以及一切 AI 系统站立其上的分布式和性能基石。有几类相邻的知识明确归别的路书,这条边界不是为了甩锅,而是为了让你清楚每个问题该去哪本书找答案。

模型和算子本身的算法 —— attention 的各种变体、MoE 的架构、KV cache 的算法级优化(比如 MLA)、怎么手写一个 GPU kernel —— 归模型设计路书,这一章只把它们当成要服务的对象和性能特征来看。训练的整套组装 —— 用多少数据、什么配比、scaling law、预训练 recipe —— 归预训练和数据工程路书;这条路书只教训练和推理共享的那层分布式基石(并行、通信、性能、存储),训练侧专属的组装会 cross-link 过去。单个 agent 的 harness 怎么工程化 —— agent loopcontext engineering、工具生态、单个 sandbox —— 归 Agent 工程路书(#8 已经完整讲了);这条路书的 Ch11 只讲一件 #8 不讲的事:把成千上万个 agent 当一个生产服务运营在规模上。

带着这些,来看你接下来要走的路。这门课分五站。第一站就是这一章,给你坐标系。第二站打地基:为什么一台机器不够、怎么把模型切到多机(Ch2 并行、Ch3 集合通信),这层基石训练和推理都站在上面。第三站是主脊,把模型服务到生产规模:一次请求的解剖(Ch4)、把吞吐做上去(Ch5)、服务集群与分离(Ch6)、读一个真实的 serving 系统 vLLM(Ch7)。第四站练性能心智:rooflineprofiling(Ch8)、用精度换吞吐(Ch9)。第五站学会让系统不倒、并往未来外推:可靠性与成本(Ch10)、把 agent 当服务运营(Ch11)、系统判断力与外推收官(Ch12)。走完这五站,你应该能推理一个 LLM serving 系统的性能和成本旋钮在哪、读懂 vLLM 和 DeepSeek-V3 这类真实系统、对一个新的 serving 需求做容量估算、并且看一份系统方案时能一眼挑出关键的取舍。这就是从「会用模型」到「会把模型服务到规模」的距离,这一章给了你地图,接下来 11 章一站一站把它走完。

收官 · 你现在有了地图

回头看你这一章拿到了什么。你拿到了一条专属于 AI 系统设计的技术弧:训练一个大模型(2020 GPT-3)、ChatGPT 把 serving 推上主战场(2022)、vLLM 让 serving 成为一门工程(2023)、分离与稀疏把规模再推一层(2024)、完整 infra 栈被 DeepSeek 开源、整门工程定型(2025)。你拿到了一条更值钱的认知弧,四次自我纠正,每一条都教你一个可迁移的 pattern,而它们共享同一个形状 —— 撞墙开新轴。你还拿到了一把外推的方法:墙与轴让你对任何新进展都问对问题。

更重要的是,你不再是空降到 AI 系统设计的终态。从下一章起你会开始学具体的工程 —— 怎么把模型切到多机、怎么让多机协同、怎么把吞吐做上去、怎么让系统不倒。但你现在知道每一个工程概念是被哪一堵墙逼出来的:你学并行时会想起「单卡装不下」那堵墙,你学集合通信时会想起「卡间搬数据比算还慢」那堵墙,你学容错时会想起「规模之下故障是常态」那堵墙。带着这张标着「你在这里」的地图,进下一章。

下一章 Ch2 进入第二站,从最根本的第一性原理开始:为什么一台机器连服务一个大模型都不够。你会看到一个六千多亿参数的模型有多大、为什么必须切开,以及切开它的四种方式各自意味着什么。这是你真正开始理解「分布式」这两个字的起点。

本章时间线速查

技术弧五节点:2020.05 GPT-3(1750 亿稠密 · 训练一个大模型的时代)· 2022.11 ChatGPT 上线(5 天百万 / 2 月亿级 · serving 成主战场)· 2022-2023 serving 成工程(Orca 连续批处理 OSDI'22 · vLLM/PagedAttention SOSP'23 · 把 OS 分页搬给 KV cache)· 2024 分离与稀疏(Splitwise/DistServe 开 prefill-decode 分离 · Gemini 1.5 首个广泛可用的 1M 上下文)· 2024.12 – 2025.02 学科化(DeepSeek-V3 报告 第 3 节 Infrastructures · 671B MoE / 2048×H800 / FP8 / DualPipe · 开源周放出 3FS/DeepEP/FlashMLA/DeepGEMM/EPLB · SGLang/RadixAttention 并起)· 2026.04 DeepSeek-V4 开源(约 1.6T MoE / FP4+FP8 / 1M context · 硬件已到 Blackwell/Rubin 世代)

认知弧四纠正:模型不够强就买更大机器 → 单卡装不下必须切多机(分布式)· 训练才是主战场 → 服务才是规模主场(serving 独立成工程)· 堆更多 GPU 就更快 → 卡间通信是新瓶颈(集合通信 + 重叠)· 单机可靠就够 → 规模下故障是常态(容错 + SRE 成一等)

外推:每次进步 = 撞墙 → 开正交新轴 · 遇新进展先问攻哪堵墙、老轴还是新轴 · 当前几堵墙:内存 / 能耗散热 / 规模可靠性 / 网络带宽 / agent-fleet 运营

本章关键术语

本章引入的 canonical 术语,点进术语表看更完整的解释:

  • KV cache LLM 推理时缓存已算过的注意力键值,避免每出一个 token 都重算历史;它主宰 decode 阶段的显存,是 serving 的头号资源对象
  • PagedAttention vLLM 的签名贡献:把操作系统的虚拟内存分页搬来管理 KV cache,消灭显存碎片 + 允许跨请求共享
  • prefill / decode 一次推理的两个阶段:并行处理 prompt 的 prefill(算力密集)vs 逐 token 自回归的 decode(显存/带宽密集);二者资源脾气相反,是 Ch6 分离的根因

参考文献

Mode A · 引用出处(正文 inline,集中列在此)

深 dive 资源(可选 · 想往下走再看)

说明:AI 系统设计领域目前没有合格的人讲解系统教学视频(会议 talk 偏深、产品演示不成体系),所以本章及本路书大部分章节没有 Mode B 视频站,由 Mode A 原创讲解扛起。若未来出现合格的系统化教学视频,我们会补上。深 dive 的会议论文(SOSP / OSDI / ISCA)与课程(MIT 6.824 分布式 / CMU 15-442 / GPU MODE)在各章末按需列出。

下一章

下一章(Ch2)进入第二站 · 分布式基石。你已经知道「单卡装不下」是这门工程的第一堵墙,下一章我们就从第一性原理把它砸实:一个六千多亿参数的模型到底有多大、为什么没有单卡装得下、以及切开它的四种并行(data / tensor / pipeline / expert)各自切的是什么、各自要付什么代价。这是你真正开始理解「分布式」的起点。