Night Office

CABINET  / The Physical Stack of AI / AI Infra

云计算

6.7k 字


Physical Stack of AI 系列 · 第一章

这是”AI时代的基础设施”(Physical Stack of AI)系列的第一章。AI 应用几乎都部署在云上而非用户本地设备,云计算是这整套物理技术栈交付给用户的方式:芯片、电力、能源金属,最终都要经过云计算这一层,才能变成用户能调用的智能。

Cloud Computing

在探讨 AI Infra 之前,必须先理解计算资源的交付模式。传统的 IT 基础设施依赖于本地部署 (On-Premises),企业需自行采购物理服务器、构建网络环境并维护由电力、制冷组成的物理层。在物理层之上,建设一套 IT 服务。这种模式要求企业承担高额的 CapEx,并面临资源利用率低、扩容周期长的问题。

云计算 (Cloud Computing),就是一种拼好机。云服务公司包下了物理服务器建设和 IT 服务开发的成本,客户直接通过网络访问这些 IT 服务,不再自己管理物理的机房。同时,由于有了虚拟化与编排技术的支持,IT 服务可以和物理硬件解耦,实现计算资源的池化 (Pooling),超大集群的物理机房上建立了一整个池子的计算资源,然后灵活按需地分配给客户。

这样,云计算将企业的 CapEx 转化为 OpEx,并通过 Multi-tenancy 将闲置资源的成本在广义用户群中摊薄,转移了报表上的负债。

为什么在Everything You Need to Know about AI的第一章,不从Transformer讲起,而是从基础设施,尤其是云计算讲起?因为AI应用绝大多数都是部署在云上,而非用户本地设备上的,这是因为模型的参数量直接决定了对显存的需求。用户的本地设备通常仅能流畅运行3B至8B的量化模型,这与市面上的消费模型(比如DSV3是671B)存在代际差。近期备受关注的 OpenClaw/Clawdbot,使用的主流方式也从最初的买Mac Mini变成了请求云端算力。

以及,AI 的核心价值在于处理重负载、异步的复杂任务,而非简单的实时交互。点外卖这种追求毫秒级的瞬时响应和确定性的任务,人类通过手指点击屏幕的效率远高于等待 AI 思考、规划并调用工具。而人类最不愿意做的“繁重劳动”。它们通常是异步的、耗时的,需要消耗巨大的算力进行长链条的推理,这种重计算过程,天然适合在云端那个庞大的计算池中完成,而非阻塞用户本地设备的资源。

Fundamentals

借助云计算的核心概念,我们了解一下 CS 领域的基础知识。

计算单元:虚拟机与容器

你会在云平台上创建的单元,叫做虚拟机 (Virtual Machine, VM),如果你看到创建一个实例 (Instance) ,也可以简单地先把它就理解为创建一个虚拟机。

虚拟机可以理解为一台没有实体的计算机,它运行在物理宿主机 (Host) 之上。简单来说,你手里的 Macbook 就是一台物理宿主机,而如果上面安装了虚拟化软件,通过软件打开的窗口就是一个新的虚拟计算机。进一步来说,在宿主机的存储系统中,虚拟机表现为一组文件 (通常包含配置文件、磁盘镜像文件如 .vmdk.qcow2)。在宿主机的操作系统中,运行中的虚拟机表现为一个占用内存和 CPU 时间片的进程。

虚拟机通过 Hypervisor 获取资源,Hypervisor 负责校验指令并将其翻译为对物理硬件的安全操作。当虚拟机操作系统 (Guest OS) 尝试执行特权指令时,现代 CPU 的硬件辅助虚拟化技术 (如 Intel VT-x) 会拦截这些指令,将其控制权交还给 Hypervisor,这种机制确保了单个虚拟机的崩溃或恶意操作无法突破逻辑边界影响宿主机或其他虚拟机。

虚拟机和物理机一样,是有大小的,以“4核 10G 100G”的云主机为例:

  • 4核:指 4 vCPU。物理 CPU 的一个超线程 (Hyper-Thread) 通常映射为一个 vCPU。
  • 10G:指 10GB RAM,就是内存。
  • 100G:指 100GB Disk,就是存储空间。这些概念和物理机也是一一对应的。

虚拟机在 2010s 之后有了下一个版本:容器 (Containers) 。它支持应用之间共享操作系统,跳过了 Guest OS 这一步,容器内的应用进程共享一个 Host OS,直接运行在宿主机的 Kernel 上,没有自己的 Kernel,也没有虚拟硬件,所以容器比传统的虚拟机更加轻便。

虚拟机与容器对比(图源: NetApp)
虚拟机与容器对比(图源: NetApp)

核心资源:CPU

这些虚拟出的资源,其背后就是一块块CPU。我们先简单看一眼 CPU (Central Processing Unit),在下一章(CPU 一章)中,我们会详细解析其结构、组成原理以及在AI时代的应用。

CPU的设计目标是降低指令执行的延迟 (Latency),擅长处理逻辑复杂、依赖性强、分支众多的串行任务,它包括:

  • 控制单元 (Control Unit):占据芯片面积的很大比例。它负责指令解码、复杂的分支预测 (Branch Prediction) 和乱序执行 (Out-of-Order Execution) 调度。这使得 CPU 能够高效处理复杂的逻辑判断,比如 if-else。
  • 算术逻辑单元 (ALU):负责实际的数学运算 (加减乘除)。在通用 CPU 中,ALU 在芯片总面积中的占比相对较小,这限制了其并行计算能力的上限。
  • 高速缓存 (Cache):CPU 配备大容量的多级缓存 (L1/L2/L3),用于减少数据存取延迟。

深度学习之后,海量的矩阵乘法运算成为了训练和推理时的刚需。这类运算没有那么复杂的逻辑链条,但是有巨大的数据量,所以需要极高的并行(而非串行)吞吐量。CPU 复杂的控制逻辑和以低延迟为核心的设计在此时显得效率低下,且算力密度不足。

一个实际的例子

在 Manus 或 Genspark 等 AI Agent 应用中,我们指挥 Agent 执行任务时,会看到一个 “Agent 的电脑”。事实上,这个电脑也是一个运行在云端宿主机上的虚拟机,或配置了桌面环境的容器。它拥有独立的操作系统、文件系统和浏览器环境。该虚拟机内部运行着 GUI,操作系统将图像渲染至虚拟帧缓冲区,随后通过流媒体技术 (如 WebRTC) 将画面实时编码并传输至用户的浏览器端。

你甚至可以接管这个电脑,替 Agent 进行操作,这是因为当你点击屏幕时,坐标数据通过网络发送至云端,云端服务调用操作系统底层 API (如 Linux uinput) 生成虚拟的鼠标点击事件,而 AI Agent 亦通过相同 API 发送指令。操作系统不区分输入来源,仅按时间顺序处理指令,因此用户可以实时介入并接管控制权。

Peak在采访中提到,为了增强Manus虚拟机的延展性,他们没有使用Docker,而是使用Firecracker做了全套虚拟机,从而在Linux之外还支持Windows系统。Manus的每一个对话就是一个虚拟机沙盒(Sandbox),甚至可以同时开多个沙盒在云端同时运行,这赋予了Manus在执行Wide Research等并行任务时强大的Scalability.

Youtube: Introducing Manus: The General AI Agent
Youtube: Introducing Manus: The General AI Agent

核心特征

根据 NIST 的定义,云计算具备五项本质特征,可以根据这些概念来校准我们对于云的理解:

  • On-demand Self-service: 用户可根据需求自动配置计算能力。比如,我可以直接在网页上,或者通过 CLI,或者自己写个程序调 API,来调用云平台的资源管理器,声明所需资源规格,就可以自动完成部署了。
  • Broad Network Access: 就是说可以通过各种网络链接,比如 Internet, VPN 等等。
  • Resource Pooling: 就是说拼好机。Pooling 是一个非常经典的思想和商业模式。
  • Rapid Elasticity: 资源可以弹性地配置和释放。对于用户而言,可用资源在逻辑上表现为无限,且可在任何时间以任何数量购买。这解决了传统架构中为应对峰值流量而不得不预留大量闲置资源的问题。
  • Measured Service: 就是说用多少收多少费,方便算账。

服务分层

我们可以将 IT 堆栈由底向上分解为九个层级:

网络存储服务器虚拟化操作系统中间件运行时数据应用
  1. 网络 (Networking):在计算节点之间传输数据的通信基础设施,比如网线、光纤、交换机和路由器。
  2. 存储 (Storage):数据持久化保存的介质与系统,比如物理硬盘 (HDD/SSD) 及存储抽象服务。
  3. 服务器 (Servers):提供原始算力的物理硬件单元,主要包含 CPU、RAM 和主板等。
  4. 虚拟化 (Virtualization):连接物理硬件与操作系统,将物理资源抽象为虚拟环境,比如 Hypervisor。
  5. 操作系统 (Operating System):比如 Linux 和 Windows。
  6. 中间件 (Middleware):简化各组件之间的连接与管理的软件层,为应用程序提供操作系统无法直接提供的通用服务,例如 Web 服务器 (Nginx, Apache)、消息队列 (Kafka, RabbitMQ) 以及数据库管理系统。
  7. 运行时 (Runtime):应用程序代码的执行环境,比如 Java 需要 Java 虚拟机,Python 需要 Python 解释器。
  8. 数据 (Data):各种数据记录。
  9. 应用 (Applications):直接面向最终用户的软件程序,例如 CRM 系统。

基于这些分层,云服务模式如下:

  • 如果提供物理层 (网络、存储、服务器) 至虚拟化层,而操作系统及以上都由客户来管理,那么这叫 IaaS (Infrastructure as a Service)
  • 如果提供物理层、操作系统到 Runtime, 而用户只进行数据存储和应用开发,那么这叫 PaaS (Platform as a Service),比如 Managed SQL、Serverless 计算环境。用户无需关心操作系统的安全补丁,仅需关注业务代码与数据架构。
  • 如果直接给用户提供到应用这一层,那么这是我们听得最多的 SaaS (Software as a Service),用户连个网就能用,比如腾讯文档。

技术演进

云技术的演进本质上是计算粒度不断细化与抽象程度不断提高的过程。

  1. 物理机时代 (1960s - 1990s):操作系统直接管理物理硬件,无虚拟化层。
  2. 虚拟化时代 (1999 - 2010s):引入 Hypervisor 层,允许在同一物理硬件上运行多个独立的 Guest OS,实现了 IaaS 层的资源池化与隔离。
  3. 容器化时代 (2013 - ):利用 Linux 内核特性,在操作系统层面实现进程级隔离。相比虚拟机,容器去除了 Guest OS 的开销,启动速度达到秒级。
    • Docker (2013): 标准化了容器镜像格式。解决了应用在不同环境中运行一致性的问题。
    • Kubernetes (2014): 解决了大规模容器集群的编排与调度问题。
    • Serverless (2014 - ):抽象层进一步上移,开发者仅需关注函数逻辑 (FaaS)。云服务商负责底层基础设施的配置、管理和自动伸缩。
    • AI Infra:算力需求发生了结构性的变化,对GPU和AI芯片的需求飞速增长,使云行业产生了新的竞争格局。本系列的 AI Infra 一章会详细展开。
K8s的技术细节很多,这里只做最简单的介绍。从示意图可以看出来,K8s本质是一个系统。由Control Plane调度着多个Worker Node,而Worker Node里包含多个Pod。Pod是容器的集合,一个Pod内的容器共享某些资源(比如IP、端口)。
K8s的技术细节很多,这里只做最简单的介绍。从示意图可以看出来,K8s本质是一个系统。由Control Plane调度着多个Worker Node,而Worker Node里包含多个Pod。Pod是容器的集合,一个Pod内的容器共享某些资源(比如IP、端口)。

这一章节的内容,为 AI 时代的 Infrastructure 的构建奠定了基础。在接下来的章节里,我们会详细进入芯片和AI Infra,讨论的问题包括:

  • CPU的物理结构是什么,这如何决定了其执行任务的特点?
  • AI时代,为什么GPU这个 “Graph” Processing Unit变成了明星?
  • 为什么CPU仍然非常重要?NPU/TPU等AI芯片又是怎么一回事?
  • 为什么AI Infra这么重要,以至于哪怕是做AI应用的也必须了解?

商业世界

讲完了技术解析,我们可以从资本市场的视角来看看行业格局。24年后海内外各大云厂商CapEx快速增长是有目共睹的事实。列几个主要厂商的名字:AWS,Azure,GCP,阿里云,华为云,腾讯云。它们的业务各有特点,感兴趣的可以翻它们的官网。

个人快速看行业喜欢直接看两个信息:一是组织架构(人),二是财报本身(钱)。组织架构和人员变动在这里当然就不能细说了,但财报的数字还是可以看一看的。SCF里,Cash Flow from Investing Activities - PP&E 这一个条目,虽然是整个集团的PPE开支,但很大程度上反映了云计算这一重资产项目开支的变化。可以看到,阿里和腾讯在2025年上半年的PP&E,与2024年同期相比都是飞涨的状态,相信这样的状态会持续到2026.

阿里巴巴2026财务年度中期报告,截至2025年9月30日
阿里巴巴2026财务年度中期报告,截至2025年9月30日
腾讯2025财务年度中期报告,截至2025年6月30日
腾讯2025财务年度中期报告,截至2025年6月30日

还有一个比较好玩的商业信息,是这些算力中心/数据中心的物理选址。在本文开头我们提到,如果你本地部署IT设施,你需要一个由电力、制冷组成的物理层来支撑它的运行。云计算时代虽然把物理层的管理交给了云服务商,但物理层依然存在。超级算力中心主要在西部,用来处理高吞吐、对延迟不敏感的业务,因为那里电费便宜、而且省空调降温费。清华的大数据工程master好像也是在贵州培养的。

  • 阿里的布局最为庞大。其超级算力枢纽,也是训练重镇,在张北和乌兰察布,这里气温低,风能/太阳能丰富;以及广东河源,服务大湾区。为了保证低延迟,在各大城市也有布局。在杭州大本营,阿里拥有仁和、千岛湖等多个高规格数据中心,千岛湖还会利用湖水制冷。阿里云于2025年启动的“通义千问专属算力集群”扩建工程,也是在杭州、乌兰察布、河源三地同步新增超10万张GPU/ASIC芯片部署,全部采用浸没式液冷技术,PUE低至1.09,专用于大模型训练、推理及行业模型微调。
  • 腾讯的布局不仅是为了云,也是为了支撑其庞大的游戏和社交业务,因此极其强调网络稳定性。贵安七星数据中心是腾讯最著名的“挖山”数据中心,主体藏在山洞里,安全性极高,主要存储腾讯最核心的数据。在清远、仪征和怀来的计算中心,分别服务华南、华东和华北业务。
  • 华为的布局最符合国家队色彩。贵安(童话小镇)是华为云的全球总部和冷存储中心。乌兰察布(草原云谷),华为在此建设了超大规模的 AI 算力中心,主要承接大模型训练任务(昇腾芯片集群)。芜湖作为“东数西算”长三角的枢纽节点,是华为最新的重点投资方向,用于连接东部算力需求。

参考资料: