AI Infra 权威指南
从 GPU 微架构到万卡集群的 AI 基础设施全链路指南:硬件与软件、训练与推理、数据与平台、度量与实践,共 4 部分 18 章 + 4 附录。
📖 本书大纲
AI Infra 权威指南
本书内容整理自开源项目 openwikis(作者 hezhiyong,CC BY-NC 4.0 许可)。
原创来源声明:本书内容提取自 aizyhe/openwikis 仓库
infra/目录下的《AI Infra 权威指南》(PDF 版,v1.0.1,2026-06-25),由 PDF 提取整理为 Markdown 章节。原仓库:openwikis。
关于本书
大模型的爆发式增长将 AI Infra 推到了技术舞台的中央。当单个模型的参数规模突破万亿、训练集群的 GPU 数量达到十万量级时,基础设施的能力直接决定了大模型的天花板——从 GPU 微架构的指令级优化到跨机架的网络拓扑设计,从 CUDA Kernel 的精细调优到容错性训练系统的工程化,AI Infra 已成为一门横跨硬件、系统软件和分布式工程的综合学科。
本书旨在成为 AI Infra 领域的系统性权威参考。全书共 18 章,按体系层次划分为四个部分,涵盖从底层硬件到集群实践的全链路内容,以 NVIDIA、Google、Meta、Microsoft 等一线公司的公开技术报告和开源系统为核心参考资料。
- 第一部分「硬件与软件」(第 1-5 章):概述 AI Infra 的定义、从单机到万卡集群的演进史与 Scaling Law 需求,建立技术栈全景与核心设计原则;深入 GPU 微结构设计原理(SIMT 范式、SM 结构与 Warp 调度、内存层次、Tensor Core 与 MMA 指令、Block 调度与 Occupancy),并覆盖 GPU 间互联与拓扑配置;系统比较 AI 加速器生态(AMD ROCm、Google TPU、国内外自研芯片与架构创新芯片)与异构计算编程模型;随后讲解 CUDA 编程模型与高性能 Kernel 优化(Roofline 分析、融合 Kernel、Triton 语言与 FlashAttention 等注意力算子),以及 ML 编译器(PyTorch 2.0 编译栈、JAX/XLA、TensorRT)与自动调优——从手写算子的精细调优到编译器自动生成,构成完整的算子计算优化体系。
- 第二部分「训练与推理」(第 6-11 章):从数据并行(DDP、FSDP)到模型并行(张量并行、流水线并行、序列并行、专家并行与 5D 组合),覆盖多维并行策略与自动切分算法,深入 NCCL 集合通信库的内部机制与通信算法,剖析 NVLink、NVSwitch、InfiniBand、RoCEv2 等高性能网络协议,讲解大规模训练的系统工程实践(容错与故障恢复、分布式检查点、混合精度、可观测性与千卡实战);训练之外,覆盖推理算法优化(KV Cache、PagedAttention、Continuous Batching)与服务架构设计,以及模型量化(GPTQ、AWQ、SmoothQuant、KV Cache 量化)与稀疏化、知识蒸馏等压缩技术。
- 第三部分「数据与平台」(第 12-15 章):涵盖 RAG 与向量检索(文档分块、嵌入模型选型、向量检索引擎、多路召回、重排序与评估)、AI 存储系统与数据工程(检查点存储、训练存储方案、数据质量与多模态数据飞轮)、AI 集群网络拓扑与调度系统(三网分离、SLURM/K8s GPU 调度、Gang 调度、多租户 QoS、功耗与液冷)、云原生 AI 平台与 MLOps 实践(GPU 容器运行时、Kubeflow、Ray、实验跟踪、ML CI/CD 与平台安全治理)。
- 第四部分「度量与实践」(第 16-18 章):涵盖贯穿全栈的性能工程与成本优化方法论(性能指标体系、MFU 分析、端到端性能剖析、通信瓶颈定位、内存墙与 HBM 带宽优化、TCO 模型与竞价实例经济学);第 17 章提供全链路 Infra 计算手册,覆盖模型参数量分析、训练推理 FLOPs 计算、显存规划、通信带宽分析、成本估算等逐层计算公式与端到端案例;第 18 章以大规模 AI 集群建设为主线,从硬件选型、网络互联到平台调度、可观测性和运维实践,提供端到端的集群架构指南。
本书结合作者在阿里以及京东的实际工作经验,在讲解原理时注重代码级实现细节,在讨论架构时强调工程取舍背后的权衡逻辑。附录提供术语表、GPU 与硬件规格、论文索引与开源项目索引。
目录
第一部分 硬件与软件
第二部分 训练与推理
第三部分 数据与平台
第四部分 度量与实践
附录
- 附录 A 术语表(见下方内嵌内容)
- 附录 B GPU 与硬件规格(见下方内嵌内容)
- 附录 C 论文索引(见下方内嵌内容)
- 附录 D 开源项目索引(见下方内嵌内容)
附录正文位于本页底部,向下滚动即可阅读。
作者信息
- 作者:hezhiyong
- 邮箱:aizyhe@126.com
- GitHub:https://github.com/aizyhe/openwikis
- 版本:v1.0.1
- 日期:2026-06-25
提取说明
- 本书正文由
infra/AI Infra权威指南.pdf(950 页,约 29.8 MB)经 PDF 文本提取整理为 Markdown,按 18 章 + 4 附录切分。 - 代码块已加围栏;PDF 中的数学公式与表格排版在提取后可能略有错位,以原 PDF 为准。
- 原书还提供完整目录 TOC.md 与在线 PDF 下载。
附录 A 术语表
本附录整理了 AI Infra 领域核心术语的中英文对照、缩略语全称和简要解释,按硬件、编译器、分布式训练、网络与通 信、推理服务、量化、存储及其他核心术语八大类别组织为表A-1至表A-8。训练与推理涉及的并行、显存、通信术语之间 存在层层依赖关系,如图A-1所示。 显存优化层 推理优化层 KV Cache 分页管理 Continuous Batching 连续 ZeRO-3 参数分片 Activation Checkpointing 批处理 激活检查点 并行策略层 DP 数据并行 TP 张量并行 PP 流水线并行 通信支撑层 NCCL 集合通信库 RDMA 远程直接内存访问 图A-1 分布式训练术语关系 A.1 硬件与架构 表A-1 硬件与架构术语 英文术语 中文翻译 缩略 解释 语 Tensor Core 张量核心 - NVIDIA GPU 中专用于矩阵乘法的计算单元,支持 FP16/BF16/FP8/INT8 混合精度 Streaming Multiprocessor 流式多处理器 SM NVIDIA GPU 的基本计算单元,一个 GPU 包含数十到数百个 SM High Bandwidth Memory 高带宽存储器 HBM 3D 堆叠的显存技术,提供远高于传统 GDDR 的带宽(H100: 3.35TB/s) NVLink NVLink 互联 - NVIDIA 专有的 GPU 到 GPU 高带宽互联技术(H100: 900GB/s 双 向) NVSwitch NVSwitch 交换芯 - NVIDIA 的 GPU 间全连接交换芯片,允许单节点内所有 GPU 全互 片 联 Multi-Instance GPU 多实例 GPU MIG H100/A100 的特性,将一块物理 GPU 分割为多个独立 GPU 实例 Total Board Power 整板功耗 TBP GPU 在满负载下的额定功耗(H100 SXM: 700W, B200: 1000W) Heat Sink Module 散热模块 HSM GPU 的被动/主动散热组件 Thermal Design Power 热设计功耗 TDP 与 TBP 含义相近,表示散热系统需要处理的最大热功率 Compute Unified Device 统一计算设备架构 CUD Architecture A NVIDIA 的并行计算平台和编程模型 英文术语 中文翻译 缩略 解释 语 Single Instruction Multiple 单指令多线程 SIMT NVIDIA GPU 的执行模型,类似 SIMD 但线程级灵活 Threads Non-Uniform Memory Access 非统一内存访问 NUM 多路 CPU 按内存与处理器的距离分区管理内存,GPU 训练须配 A 置亲和性绑定 Compute Express Link 计算快速链接 CXL 支持内存池化与设备共享的高速互连标准,用于扩展大容量内存 Reliability Availability 可靠性可用性可服 RAS 对硬件故障的检测、隔离与恢复能力,是万卡集群稳定训练的基 Serviceability 务性 础 Power Distribution Unit 配电单元 PDU 为机架供电的电源分配设备,决定单机架 GPU 的功率上限 A.2 编译器 表A-2 编译器术语 英文术语 中文翻译 缩略语 解释 Accelerated Linear Algebra 加速线性代数 XLA Google 开发的 ML 领域专用编译器(JAX/TF 后端) Multi-Level Intermediate 多级中间表示 MLIR LLVM 旗下的编译器基础设施框架(Dialect 体系) Representation Stable High-Level Optimizer 稳定高层优化 StableHL OpenXLA 社区标准化的 ML 操作集 器 O Intermediate Representation 中间表示 IR 编译器内部的数据结构,表示待优化和翻译的程序 Just-In-Time Compilation 即时编译 JIT 运行时动态编译(如 JAX jit, PyTorch Dynamo) Ahead-Of-Time Compilation 提前编译 AOT 部署前离线编译(如 TensorRT 引擎构建) Operator Fusion 算子融合 - 将多个连续算子合并为单 Kernel Graph Capture 图捕获 - 拦截 Python eager 执行并构建计算图(Dynamo 的核心 能力) A.3 分布式训练 表A-3 分布式训练术语 英文术语 中文翻译 缩略 解释 语 Data Parallelism 数据并行 DP 每个 GPU 持有完整模型副本,处理不同数据批次 Tensor Parallelism 张量并行 TP 将单层权重切分到多个 GPU,如 Megatron-LM 风格 Pipeline Parallelism 流水线并行 PP 将模型按层切分到多个 GPU,分批处理 micro-batch Sequence Parallelism 序列并行 SP 将长序列样本切分到多 GPU,与 TP 配合使用 Expert Parallelism 专家并行 EP MoE 模型中不同 Expert 分布到不同 GPU Fully Sharded Data 全分片数据并行 FSDP PyTorch 的 ZeRO-3 等价实现,分片模型参数、梯度和优化器状 Parallelism 态 Zero Redundancy Optimizer 零冗余优化器 ZeRO DeepSpeed 的内存优化技术,分 ZeRO-1/2/3 三级 Gradient Accumulation 梯度累积 GA 多个 micro-batch 的梯度求和后再更新参数,模拟大 batch size Activation Checkpointing 激活检查点 AC 不存储中间激活值,反向传播时重新计算(内存换计算) 英文术语 中文翻译 缩略 解释 语 Model FLOPS Utilization 模型 FLOPS 利用 MFU 有效 FLOPS / 理论峰值 FLOPS,衡量训练计算效率 率 Model Bandwidth Utilization 模型带宽利用率 MBFU 有效 HBM 带宽 / 理论峰值带宽 Micro-Batch Size 微批次大小 MBS 单步中每个 GPU 处理的最小数据单元 Global Batch Size 全局批次大小 GBS MBS × GA × DP_Size,一次权重更新的总样本数 Context Parallelism 上下文并行 CP 将长序列在上下文维度切分到多 GPU,用于超长上下文训练 DualPipe 双向流水线 - DeepSeek-V3 提出的双向流水线并行调度策略,消除流水线气 泡 Ring Attention 环形注意力 - 序列并行中通过环形通信传递 KV 实现分布式注意力计算 Checkpoint 检查点 CKPT 保存训练中间状态(权重、优化器、调度器),用于中断后恢复 Timeline 时间线 - 训练日志中记录的关键事件序列,用于瓶颈排查与故障定位 A.4 网络与通信 表A-4 网络与通信术语 英文术语 中文翻译 缩略语 解释 NVIDIA Collective Communications NVIDIA 集合通信 NCCL GPU 间高性能通信库,支持 AllReduce 等集合操作 Library 库 Remote Direct Memory Access 远程直接内存访问 RDMA 绕过 CPU 直接访问远程节点内存的技术 RDMA over Converged Ethernet 融合以太网上的 RoCE 在以太网环境下实现 RDMA 的协议(RoCEv2) RDMA InfiniBand 无限带宽 IB 高性能计算互连标准,NVIDIA 的 NCCL 首选后端 GPU Direct RDMA GPU 直接 RDMA GDR GPU 显存与 NIC 之间直接数据传输,无需 CPU 中转 Scalable Hierarchical Aggregation 可扩展分层聚合协 SHAR Mellanox IB 交换机的网络内计算(In-network Protocol 议 P Computing)技术 Priority Flow Control 优先级流控制 PFC RoCEv2 中避免丢包的链路层流量控制机制 Explicit Congestion Notification 显式拥塞通知 ECN RoCEv2 中检测网络拥塞并通知发送端的机制 Data Center Quantized Congestion 数据中心量化拥塞 DCQC RoCEv2 的端到端拥塞控制算法 Notification 通知 N Oversubscription Ratio 超额认购比 - 网络下行总带宽 / 上行总带宽,衡量网络阻塞程度 Rail-Optimized Topology 轨道优化拓扑 - NVIDIA DGX SuperPOD 的网络架构设计模式 A.5 推理服务 表A-5 推理服务术语 英文术语 中文翻译 缩略语 解释 Time To First Token 首 Token 延迟 TTFT 从请求到达到第一个输出 Token 生成的延迟 Time Per Output Token 每 Token 延迟 TPOT 除首 Token 外,每个后续 Token 的平均生成时间 Inter-Token Latency Token 间延迟 ITL 两个连续 Token 生成之间的时间间隔 英文术语 中文翻译 缩略语 解释 Key-Value Cache KV 缓存 KV 注意力机制中已计算 Key 和 Value 的缓存,避免重复计算 Cache Grouped Query 分组查询注意力 GQA 多个 Query 头共享一组 Key-Value 头(Llama 2 70B 采用) Attention Multi-Query Attention 多查询注意力 MQA 所有 Query 头共享单一 Key-Value 头 Multi-head Latent 多头潜在注意力 MLA DeepSeek-V2/V3 提出的低秩 KV Cache 压缩技术 Attention PagedAttention 分页注意力 - vLLM 的 KV Cache 分页管理技术,提高显存利用率 Continuous Batching 连续批处理 - 动态批次处理,请求到来即处理,无需等待凑批 In-flight Batching 飞行中批处理 - 等价于 Continuous Batching Speculative Decoding 投机解码 - 用小模型快速生成候选 Token,大模型并行验证 Requests Per Second 每秒请求数 RPS 推理服务吞吐指标 Tokens Per Second 每秒生成 Token TPS 推理服务吞吐的另一种度量 数 Goodput 有效吞吐 - 排除错误与无效输出的实际可用吞吐,比 RPS/TPS 更贴近业务价值 Chunked Prefill 分块预填充 - 将长 prompt 的预填充阶段拆分为多个 chunk,与解码交替执行以降低 首 Token 延迟 A.6 量化 表A-6 量化术语 英文术语 中文翻译 缩略语 解释 Post-Training Quantization 训练后量化 PTQ 对已训练好的模型进行一次性量化(无需重新训练) Quantization-Aware Training 量化感知训练 QAT 训练过程中模拟量化误差,使模型适应低精度 Floating Point 16 半精度浮点 FP16 IEEE 754 16 位浮点数,1 符号+5 指数+10 尾数 Brain Floating Point 16 脑浮点 16 BF16 Google 提出的 16 位浮点格式:1 符号+8 指数+7 尾数 Floating Point 8 8 位浮点 FP8 8 位浮点数:E4M3(前向)或 E5M2(反向) Integer 8 8 位整数 INT8 8 位整数量化,推理常用 Integer 4 4 位整数 INT4 4 位整数量化,极端压缩 Per-Tensor Quantization 逐张量量化 - 整个张量使用一个缩放因子和零点 Per-Channel Quantization 逐通道量化 - 每个通道独立缩放因子,精度更高但开销更大 Group Quantization 分组量化 - 将张量分组(如 128 元素一组),每组独立量化参数 GPTQ GPT 量化 GPTQ Frantar 等人提出的基于 OBQ 的 LLM 权重量化算法 AWQ 激活感知权重量化 AWQ Activation-aware Weight Quantization,保护重要通道 A.7 存储 表A-7 存储术语 英文术语 中文翻译 缩略语 解释 Parallel File System 并行文件系统 PFS 支持多客户端并发读写的分布式文件系统(Lustre, GPFS, WekaFS) 英文术语 中文翻译 缩略语 解释 NVMe over Fabrics 网络 NVMe NVMe- 通过网络远程访问 NVMe 存储的协议 oF Non-Volatile Memory Express 非易失性内存标准 NVMe 基于 PCIe 的闪存存储协议,延迟远低于 SATA SSD Object Storage 对象存储 - 面向海量非结构化数据的存储系统(S3, MinIO, Ceph RGW) Metadata Server 元数据服务器 MDS 并行文件系统中管理文件元数据(目录结构、权限)的服务 器 Object Storage Target 对象存储目标 OST Lustre 中实际存储文件数据的服务器 Input Output Operations Per 每秒输入输出操作 IOPS 存储设备随机读写性能指标,检查点读写等小 IO 场景的关 Second 数 键参数 A.8 其他核心术语 表A-8 其他核心术语 英文术语 中文翻译 缩略 解释 语 Mixture of Experts 混合专家 MoE 模型架构,每次仅激活部分参数(如 Mixtral 8×7B) Reinforcement Learning from Human 基于人类反馈的强化 RLHF 通过人类偏好数据训练奖励模型并优化 LLM Feedback 学习 Direct Preference Optimization 直接偏好优化 DPO 无需奖励模型的 RLHF 替代方案 Generative Pre-trained Transformer 生成式预训练 Transformer GPT OpenAI 提出的 Decoder-only 预训练模型架构 Large Language Model 大语言模型 LLM 参数规模极大的语言模型(通常 > 1B 参数) Scaling Law 缩放定律 - 模型性能随参数/数据/计算量增长的幂律关系 (Kaplan et al., 2020) Chinchilla Law Chinchilla 定律 - DeepMind 提出的最优训练 Token/参数比例约为 20:1 Tokens Per GPU Second 每 GPU 每秒 Token TGS 训练吞吐的基础度量 数 Total Cost of Ownership 总拥有成本 TCO 硬件、软件、人员、运维的全生命周期成本 Power Usage Effectiveness 电能使用效率 PUE 数据中心总功耗 / IT 设备功耗
附录 B GPU 与硬件规格
本附录汇总 2025-2026 年主流 AI 加速器的技术规格、理论性能数据和标准化基准测试结果,为集群选型和性能期望提供 参考依据。 B.1 NVIDIA GPU 规格 B.1.1 NVIDIA H100 SXM5 如表B-1 所示,H100 SXM5 是 Hopper 架构旗舰,核心规格如下。 表B-1 H100 SXM5 规格 参数 规格 架构 Hopper (GH100) 制程 TSMC 4N (4nm) SM 数量 132(共 16896 个 CUDA Core、528 个 Tensor Core) 计算精度与峰值
- FP32 (CUDA Core) 67 TFLOPS
- FP16/BF16 Tensor Core 989.5 TFLOPS (without sparsity)
- FP16/BF16 with sparsity 1979 TFLOPS (2:4 structured sparsity)
- FP8 Tensor Core 1979 TFLOPS (without sparsity)
- FP8 with sparsity 3958 TFLOPS
- INT8 Tensor Core 1979 TOPS (without sparsity)
- FP64 Tensor Core 67 TFLOPS显存 80 GB HBM3 HBM 带宽 3.35 TB/s HBM 位宽 5120-bit NVLink 900 GB/s(双向聚合),NVLink 4.0 NVSwitch NVSwitch 3.0,8 卡全互联 互连带宽(NVLink) 450 GB/s(单向) PCIe PCIe Gen5 ×16(单向 64 GB/s,双向约 128 GB/s) TDP 700 W 外形规格 SXM5(夹层卡) 多 GPU 扩展 最多 8 卡/节点 via NVSwitch B.1.2 NVIDIA H200 SXM5 如表B-2 所示,H200 在 H100 基础上主要升级显存容量与带宽。 表B-2 H200 SXM5 规格 参数 规格 架构 Hopper(GH100,同 H100) 显存 141 GB HBM3e HBM 带宽 4.8 TB/s HBM 位宽 6144-bit 其他 计算核心与 H100 相同,主要升级显存容量和带宽 适用场景 LLM 推理(更大 KV Cache 容量),长上下文训练 B.1.3 NVIDIA B200 SXM6 如表B-3 所示,B200 是 Blackwell 架构旗舰,核心规格如下。 表B-3 B200 SXM6 规格 参数 规格 架构 Blackwell (GB100) 制程 TSMC 4NP SM 数量 296(双 die 各 148 个 SM,共约 37888 个 CUDA Core) 计算精度与峰值
- FP32 (CUDA Core) 约 80 TFLOPS
- FP16/BF16 Tensor Core 约 1125 TFLOPS (without sparsity)
- FP16/BF16 with sparsity 约 2250 TFLOPS (2:4 structured sparsity)
- FP8 Tensor Core 约 2250 TFLOPS (without sparsity)
- FP8 with sparsity 约 4500 TFLOPS
- FP4 Tensor Core 约 4500 TFLOPS (without sparsity)
- FP4 with sparsity 约 9000 TFLOPS 显存 192 GB HBM3e HBM 带宽 8 TB/s HBM 位宽 8192-bit NVLink 1.8 TB/s(双向聚合),NVLink 5.0 PCIe PCIe Gen5 ×16(同 H100,见前述表) TDP 1000 W 外形规格 SXM6 关键创新 FP4 精度、第二代 Transformer Engine、NVLink 5.0 B.1.4 NVIDIA GB200 NVL72 如表B-4 所示,GB200 NVL72 将 72 个 B200 组织为单一 NVLink 域。 表B-4 GB200 NVL72 规格 参数 规格 架构 Grace-Blackwell Superchip 计算组成 72 个 B200 GPU + 36 个 Grace CPU (ARM-based) 参数 规格 机架尺寸 单个 NVL72 机架 总计算能力 FP8 约 720 PFLOPS(稠密),FP4 约 1440 PFLOPS(稀疏,官方公布) 总 HBM 容量 约 13.5 TB HBM3e 总 HBM 带宽 约 576 TB/s NVLink 总带宽 130 TB/s(全互联) 机架总功耗 约 120 kW 散热方式 液冷(要求) NVLink 域 72 个 B200 全互联(单一 NVLink 域,无需 IB 通信) 适用场景 万亿参数模型训练,超大规模推理 数据来源:NVIDIA GB200 NVL72 官方产品页(2026-01)。 B.1.5 NVIDIA GB300 NVL72 如表B-5 所示,GB300 NVL72 面向推理工厂场景,核心规格如下。 表B-5 GB300 NVL72 规格 参数 规格 组成 72× Blackwell Ultra GPU + 36× Grace CPU NVLink 总带宽 130 TB/s GPU 内存 20 TB HBM3E(单机柜),每 GPU 288 GB GPU 内存带宽 最高 576 TB/s CPU 内存 17 TB LPDDR5X,带宽 14 TB/s CPU 核数 2,592 Arm Neoverse V2 核 FP4 Tensor Core 1440 PFLOPS(稀疏)/ 1080 PFLOPS(稠密) FP8/FP6 Tensor Core 720 PFLOPS INT8 Tensor Core 24 POPS FP16/BF16 Tensor Core 360 PFLOPS TF32 Tensor Core 180 PFLOPS FP32 6 PFLOPS 网络 每 GPU 1× ConnectX-8 SuperNIC 800 Gb/s 定位 AI reasoning / test-time scaling,对标推理工厂,2025 H2 上市 数据来源:NVIDIA GB300 NVL72 官方产品页(2026-01)。 B.1.6 NVIDIA HGX B300 如表B-6 所示,HGX B300 是 8 卡级 DGX 平台的 Blackwell Ultra 方案。 表B-6 HGX B300 规格 参数 规格 组成 8× Blackwell Ultra SXM FP4 Tensor Core 144 PFLOPS(稀疏)/ 108 PFLOPS(稠密) FP8/FP6 Tensor Core 72 PFLOPS FP16/BF16 Tensor Core 36 PFLOPS INT8 3 POPS TF32 18 PFLOPS FP32 600 TFLOPS 总内存 2.1 TB HBM3E NVLink GPU-to-GPU 1.8 TB/s(双向聚合) 总 NVLink 带宽 14.4 TB/s 网络带宽 1.6 TB/s Attention 性能 2× 相对 Blackwell 定位 相对 B300 单卡提升 FP4 稠密 1.5×、注意力 2× 数据来源:NVIDIA HGX 平台官方产品页(2026-01)。 B.1.7 NVIDIA L40S 如表B-7 所示,L40S 是面向推理与中小规模训练的 PCIe 加速卡。 表B-7 L40S 规格 参数 规格 架构 Ada Lovelace (AD102) 显存 48 GB GDDR6(非 HBM) 显存带宽 864 GB/s FP16/BF16 Tensor Core 约 362 TFLOPS (with sparsity) FP8 Tensor Core 约 733 TFLOPS (with sparsity) INT8 Tensor Core 约 733 TOPS TDP 350 W NVLink 无(仅 PCIe) 外形规格 双槽 PCIe 卡 适用场景 推理服务、视觉模型、中小规模训练 B.1.8 NVIDIA H800 SXM 如表B-8 所示,H800 是 NVLink 带宽受限的中国特供版本。 表B-8 H800 SXM 规格 参数 规格 架构 Hopper(GH100,同 H100) SM 数量 132(共 528 个第四代 Tensor Core) 参数 规格 计算精度与峰值
- FP16/BF16 Tensor Core 989 TFLOPS(与 H100 相同)
- FP8 Tensor Core 1,979 TFLOPS 显存 80 GB HBM3 HBM 带宽 3,350 GB/s NVLink 约 400 GB/s(双向聚合,较 H100 减半) MIG 2.0 TDP 700 W 网络 ConnectX-7 400 Gb/s 定位 中国特供版 H100,NVLink 带宽受限以符合 BIS 出口管制 B.1.9 NVIDIA H20 SXM 如表B-9 所示,H20 削减计算、保留互联并提升显存以符合出口管制。 表B-9 H20 SXM 规格 参数 规格 架构 Hopper(GH100,同 H100) SM 数量 78(较 H100 减少 41%) 计算精度与峰值
- FP16/BF16 Tensor Core 148 TFLOPS(较 H100 减少 85%)
- FP8 Tensor Core 296 TFLOPS(较 H100 减少 85%) 显存 96 GB HBM3 HBM 带宽 4,000 GB/s(较 H100 提升 19%) NVLink 900 GB/s(完整,双向聚合) 定位 中国特供版,保互联切计算增内存 B.2 AMD 与 Intel GPU 规格 B.2.1 AMD MI300X 如表B-10 所示,MI300X 是 AMD 对抗 H100 的旗舰加速卡。 表B-10 MI300X 规格 参数 规格 架构 CDNA 3 计算单元 304 CU FP32 81.7 TFLOPS FP16/BF16 1,307 TFLOPS(稀疏口径);BF16 稠密 653.7 TFLOPS FP8 2,614 TFLOPS INT8 2,614 TOPS 参数 规格 FP64 81.7 TFLOPS (Vector), 163.4 TFLOPS (Matrix) 显存 192 GB HBM3 HBM 带宽 5.3 TB/s HBM 位宽 8192-bit 互连 Infinity Fabric 4.0(896 GB/s 双向聚合) PCIe PCIe Gen5 ×16(同 H100,见前述表) TDP 750 W 外形规格 OAM (OCP Accelerator Module) B.2.2 AMD MI325X 如表B-11 所示,MI325X 在 MI300X 基础上升级显存容量与带宽。 表B-11 MI325X 规格 参数 规格 架构 CDNA 3(refresh) 显存 288 GB HBM3e HBM 带宽 6 TB/s 计算核心 与 MI300X 相同(FP16 峰值 1307 TFLOPS),显存容量与带宽较 MI300X 提升 1.5 倍 定位 对标 H200 的大容量显存推理方案 B.2.3 AMD MI350X 如表B-12 所示,MI350X 采用 CDNA4 架构,对标 Blackwell 系列。 表B-12 MI350X 规格 参数 规格 架构 CDNA4(第 4 代) 制程 TSMC 3nm + 6nm IOD 流处理器 16,384 Matrix Cores 1024 计算单元 256 CU 晶体管 1850 亿 FP16/BF16 2.3 PFLOPS(稀疏 4.6) OCP-FP8 4.6 PFLOPS(稀疏 9.2) MXFP6/MXFP4 9.2 PFLOPS FP32 144.2 TFLOPS FP64 72.1 TFLOPS 显存 288 GB HBM3E,8 TB/s,8192-bit,256 MB LLC TBP 1000 W 互连 Infinity Fabric 7 链路,153 GB/s scale-up;1× scale-out 128 GB/s 参数 规格 外形 OAM 模块,PCIe 5.0 x16 特性 MXFP4/MXFP6/MXFP8、全片 ECC、Page Retirement、SR-IOV 数据来源:AMD MI350X 官方产品页(2026-01)。 B.2.4 AMD MI355X 如表B-13 所示,MI355X 是 MI350X 的高性能版本,面向高端训练。 表B-13 MI355X 规格 参数 规格 架构 CDNA4 制程 TSMC 3nm + 6nm IOD 流处理器 16,384 Matrix Cores 1024 计算单元 256 CU 晶体管 1850 亿 峰值频率 2400 MHz FP16/BF16 2.5 PFLOPS(稀疏 5) OCP-FP8 5 PFLOPS(稀疏 10.1) MXFP6/MXFP4 10.1 PFLOPS FP32 157.3 TFLOPS FP64 78.6 TFLOPS 显存 288 GB HBM3E,8 TB/s,256 MB LLC TBP 1400 W 互连 Infinity Fabric 7 链路,153 GB/s scale-up;1× scale-out 128 GB/s 外形 OAM 模块,PCIe 5.0 x16 特性 MXFP4/MXFP6、全片 ECC、Page Retirement、SR-IOV 数据来源:AMD MI355X 官方产品页(2026-01)。 B.2.5 Intel Gaudi 3 如表B-14 所示,Gaudi 3 是对标 H100 的训练与推理加速器。 表B-14 Gaudi 3 规格 参数 规格 架构 Gaudi 3(双 die) 制程 TSMC 5nm BF16/FP8 峰值 1835 TFLOPS 参数 规格 INT8 3670 TOPS 显存 128 GB HBM2e 显存带宽 3.7 TB/s 互连 集成 RDMA RoCEv2 以太网(In-network Computing) 散热与功耗 约 900 W(整卡,风冷/液冷可选) 定位 对标 H100 的训练/推理加速器,x86 服务器双卡部署 B.3 Google TPU 规格 B.3.1 TPU v5p 如表B-15 所示,TPU v5p 面向超大规模训练,关键规格如下。 表B-15 TPU v5p 规格 参数 规格 单个 TPU v5p 芯片
- BF16 约 459 TFLOPS
- INT8 约 918 TOPS 每 Pod 最大规模 8,960 个芯片 互连 ICI(Inter-Chip Interconnect),3D-Torus 拓扑,约 4.8 Tbps 单向 显存 (HBM) 95 GB HBM2e per chip 最大每 Pod 总显存 约 850 TB 最大每 Pod BF16 峰值 约 4.1 EFLOPS Pod 总功耗 约 9 MW(8960 chips) 使用方式 GCP Cloud (TPU v5p Pod slice) B.3.2 TPU v5e 如表B-16 所示,TPU v5e 兼顾训练与推理,性价比优先。 表B-16 TPU v5e 规格 参数 规格 BF16 约 197 TFLOPS (per chip) INT8 约 393 TOPS 显存 16 GB HBM2e per chip 最大 Pod 256 个芯片(单切片) 定位 训练+推理兼具,性价比优先 B.3.3 TPU v6e Trillium 如表B-17 所示,TPU v6e Trillium 在算力与显存上均大幅提升。 表B-17 TPU v6e Trillium 规格 参数 规格 架构 Trillium(v6e) BF16 约 918 TFLOPS(per chip,约 4.7 倍于 v5e) INT8 约 1836 TOPS 显存 32 GB HBM per chip 最大 Pod 256 个芯片(单切片) 互连 ICI(Inter-Chip Interconnect) 定位 v5e 的算力与显存双升级,训练+推理兼顾(2024 年 10 月 GA) B.3.4 TPU v7 Ironwood 如表B-18 所示,TPU v7 Ironwood 是迄今最强的 Google TPU。 表B-18 TPU v7 Ironwood 规格 参数 规格 架构 Ironwood(v7),双 Chiplet 设计(每 Chiplet 含 1 个 TensorCore + 2 个 SparseCore + 96GB HBM) BF16 2,307 TFLOPS(per chip,FP8 4,614) 显存 192 GB HBM per chip HBM 带宽 7,380 GB/s per chip ICI 1,200 GB/s 双向 per chip 最大 Pod 9,216 个芯片(8×16×72 3D-Torus) 每 Pod BF16 峰值 约 21.3 EFLOPS 每 Pod 总显存 约 1.8 PB 定位 迄今最强 Google TPU,2025 年发布,面向超大规模训练 数据来源:Google Cloud 官方产品页(2025-2026)。 B.4 标准化性能基准 B.4.1 MLPerf Training MLPerf Training 当前版本为 v6.0(2026)。其 LLM 训练基准已从 GPT-3 175B 与 BERT-large 演进为以 C4 数据集为基础 的预训练任务:GPT-3 175B 于 v4.1 后退役,BERT-large 于 v5.0 后退役;v6.0 的 LLM 基准为 DeepSeek-V3(671B MoE)、Llama3.1-405B、Llama3.1-8B、GPT-OSS 20B 预训练,外加 Llama-2-70B 微调、DLRM-dcnv2 推荐与 FLUX.1 文生图。以下三个表(表B-19 至表B-21)为 2023-2024 年历史数据,保留作代际参考。 GPT-3 175B 训练基准(2023,单位:分钟),结果如表B-19 所示。 表B-19 GPT-3 175B 训练基准 系统 GPU GPU 数量 训练时间 扩展效率 NVIDIA Eos H100 10,752 3.4 min 93% 系统 GPU GPU 数量 训练时间 扩展效率 Google Cloud TPU v5p 6,144 约 10 min - Azure H100 3,584 约 15 min - BERT-Large 训练基准(2023,单位:分钟),结果如表B-20 所示。 表B-20 BERT-Large 训练基准 系统 GPU GPU 数量 训练时间 NVIDIA H100 256 0.43 min Intel Gaudi 2 256 1.89 min MLPerf Training v3.1(BERT, time to train),结果如表B-21 所示。 表B-21 MLPerf Training v3.1 BERT 大规模提交 系统 GPU GPU 数量 训练时间 备注 NVIDIA H100 3,584 10.5 min 2023 年最快 NVIDIA A100 4,096 22.4 min 每卡性能约 50% H100 Intel Gaudi 2 384 46.7 min 首秀中规中矩 Google Cloud TPU v5p 2,048 — 未参与(仅内部使用) B.4.2 MLPerf Inference Llama2-70B 推理基准(MLPerf Inference v6.0,offline,closed,单位 tokens/s),结果如表B-22 所示。 表B-22 Llama2-70B 推理基准(v6.0 offline) 系统 吞吐 (tokens/s) 精度 NVIDIA GB300 NVL72(72×GB300-288GB) 1,126,850 FP4 AMD MI355X 定制集群 1,042,110 FP4 NVIDIA GB200 NVL72(72×GB200-186GB) 888,054 FP4 NVIDIA DGX B300(8×B300-270GB) 112,954 FP4 对比 v4.0(2024-04)H100×8 约 22,000、H200×8 约 31,000 tokens/s,8 卡单机从 H100 到 B300 吞吐提升约 5 倍; NVL72 机柜级方案达到百万级 tokens/s 量级。 Llama3.1-405B 推理基准(MLPerf Inference v6.0,offline,closed,单位 tokens/s),结果如表B-23 所示。 表B-23 Llama3.1-405B 推理基准(v6.0 offline) 系统 吞吐 (tokens/s) 精度 NVIDIA GB300 NVL72 19,512 FP4 NVIDIA GB200 NVL72 15,462 FP4 NVIDIA DGX B300(8×B300-270GB) 1,952 FP4 Llama3.1-8B 推理基准(MLPerf Inference v6.0,offline,closed,单位 tokens/s),结果如表B-24 所示。 表B-24 Llama3.1-8B 推理基准(v6.0 offline) 系统 吞吐 (tokens/s) 精度 NVIDIA DGX B300(8×B300-270GB) 165,432 FP4 NVIDIA DGX B200(8×B200-180GB) 160,403 FP4 Dell PowerEdge XE7740(8×H200-NVL-141GB) 53,194 FP8 数据来源:MLCommons MLPerf Inference v6.0 官方结果(2026)。 B.4.3 HPL-MxP HPL-MxP 是面向 AI 工作负载的混合精度 HPL 基准,衡量大规模 GPU 集群的混合精度计算能力。2023-11 Top500 榜单 历史数据如表B-25 所示。 表B-25 HPL-MxP 基准结果 系统 GPU 性能 (EFLOPS) 理论峰值百分比 NVIDIA Eos 10,752 × H100 10.6 (FP8) 约 70% Frontier 37,632 × MI250X 7.8 (FP16) 约 68%
附录 C 论文索引
本附录精选 AI Infra 领域具有里程碑意义的学术论文,按技术领域分类整理。每篇论文标注标题、作者、发表会议/年份 和一句话核心贡献。开源项目索引见附录D。 C.1 缩放定律与架构 缩放定律与架构方向的代表性论文如表C-1 所示,覆盖自注意力机制、模型缩放与超大规模训练基础设施。 表C-1 缩放定律与架构论文 论文标题 作者 会议/年 核心贡献 份 Attention Is All You Need Vaswani et al. NeurIPS Transformer 架构奠基论文,以自注意力替 (Google) 2017 代 RNN 并支持并行训练 Scaling Laws for Neural Language Models Kaplan et al. arXiv 首次系统提出 LLM 的缩放定律:性能随参数 (OpenAI) 2020 量、数据量、计算量的幂律关系 Training Compute-Optimal Large Language Hoffmann et al. NeurIPS 提出 Chinchilla 定律:最优训练 Token 数 Models (Chinchilla) (DeepMind) 2022 约为参数量的 20 倍 Efficient Large-Scale Language Model Training Narayanan et al. SC 2021 Megatron-LM 的 TP+PP 混合并行训练方法 on GPU Clusters Using Megatron-LM (NVIDIA) 论文 PaLM: Scaling Language Modeling with Chowdhery et JMLR 提出 MFU 指标,在 6144 块 TPU v4 上训练 Pathways al. (Google) 2023 540B 参数 PaLM GPT-4 Technical Report OpenAI arXiv GPT-4 的技术概要,包含部分基础设施信息 Llama 2: Open Foundation and Fine-Tuned Touvron et al. arXiv Meta 开源 70B 参数的 Llama 2,提供训练 Chat Models (Meta) 2023 基础设施细节 DeepSeek-V3 Technical Report DeepSeek-AI arXiv DeepSeek-V3 的 671B MoE 模型,展示 FP8 2024 训练和极高 MFU The Llama 3 Herd of Models Meta AI arXiv Llama 3 系列(8B 到 405B),包含训练基 2024 础设施和数据管道细节 C.2 注意力机制优化 注意力机制优化方向的代表性论文如表C-2 所示,从 IO-Aware 注意力到近无限上下文长度。 表C-2 注意力机制优化论文 论文标题 作者 会议/年 核心贡献 份 FlashAttention: Fast and Memory-Efficient Exact Dao et al. (Stanford) NeurIPS 首创 IO-Aware 注意力算法,在 Attention with IO-Awareness 2022 SRAM 中完成 Softmax FlashAttention-2: Faster Attention with Better Dao (Stanford) arXiv 改进并行度,在 H100 上实现 Parallelism and Work Partitioning 2023 70% MFU FlashAttention-3: Fast and Accurate Attention with Shah, Dao et al. arXiv 利用 H100 的 TMA 和异步拷贝, Asynchrony and Low-precision (Colfax/Stanford) 2024 实现 740 TFLOPS 论文标题 作者 会议/年 核心贡献 份 Flash Decoding: Faster LLM Inference Through Dao et al. Blog 优化长序列推理的注意力计算, Efficient Attention (Stanford/Together) 2023 通过并行软最大值 GQA: Training Generalized Multi-Query Transformer Ainslie et al. EMNLP 提出 Grouped Query Attention Models from Multi-Head Checkpoints (Google) 2023 Ring Attention with Blockwise Transformers for Near- Liu et al. (UC arXiv 通过 Ring 拓扑实现无限上下文长 Infinite Context Berkeley) 2023 度 C.3 编译器和性能 编译器与性能方向的核心论文如表C-3 所示,覆盖 TVM、Triton、MLIR 等主流编译体系。 表C-3 编译器与性能论文 论文标题 作者 会议/年份 核心贡献 TVM: An Automated End-to-End Optimizing Compiler for Chen et al. OSDI 2018 Apache TVM 编译器的奠基 Deep Learning (UW) 性论文 Triton: An Intermediate Language and Compiler for Tillet et al. MAPS 2019 OpenAI Triton 的 Python- Tiled Neural Network Computations (Harvard) based GPU Kernel 语言 MLIR: Scaling Compiler Infrastructure for Domain Lattner et al. CGO 2021 MLIR 基础设施的综述论文 Specific Computation (Google) XLA: Optimizing Compiler for Machine Learning Leary, Wang TensorFlow Dev XLA 的设计原则 (Google) Summit 2017 TorchDynamo: A Python-level JIT Compiler Designed to Ansel et al. PyTorch PyTorch Dynamo 的设计与 Make Unmodified PyTorch Programs Faster (Meta) Conference 2022 实现 A Friendly Introduction to Machine Learning Compilers Kwon et al. Blog 2023 系列 ML 编译器友好入门系列 and Optimizers Slapo: A Schedule Language for Progressive Chen et al. ASPLOS 2024 AWS 的渐进式模型优化框架 Optimization of Large Deep Learning Models (AWS) Welder: Scheduling Deep Learning Memory Access via Sun et al. OSDI 2024 基于 Tile Graph 的内存调度 Tile-graph (MSR) 优化 C.4 分布式训练系统 分布式训练系统方向的核心论文如表C-4 所示,涵盖张量并行、流水线并行与优化器状态分片三类主流技术。 表C-4 分布式训练系统论文 论文标题 作者 会议/年 核心贡献 份 Megatron-LM: Training Multi-Billion Parameter Shoeybi et al. arXiv 提出 Tensor Parallelism(张量并行), Language Models Using Model Parallelism (NVIDIA) 2019 GEMM 沿列/行切分 GPipe: Efficient Training of Large Neural Networks Huang et al. NeurIP Pipeline Parallelism 奠基性论文,提出 using Pipeline Parallelism (Google) S 2019 Micro-Batch 流水线 PipeDream: Fast and Efficient Pipeline Parallel Narayanan et SOSP 提出层级级流水线与异步权重更新(1F1B DNN Training al. (Stanford) 2019 调度的前身) 论文标题 作者 会议/年 核心贡献 份 ZeRO: Memory Optimizations Toward Training Rajbhandari SC DeepSpeed ZeRO 系列:分片优化器状态 Trillion Parameter Models et al. 2020 (ZeRO-1) 、梯度(ZeRO-2)、参数 (Microsoft) (ZeRO-3) DeepSpeed: System Optimizations Enable Training Rasley et al. KDD DeepSpeed 系统论文,支撑 ZeRO 系列内 Deep Learning Models with Over 100 Billion (Microsoft) 2020 存优化落地 Parameters Alpa: Automating Inter- and Intra-Operator Zheng et al. OSDI 自动并行策略搜索框架,结合 intra-op 和 Parallelism for Distributed Deep Learning (UC Berkeley) 2022 inter-op 并行 TeraPipe: Token-Level Pipeline Parallelism for Li et al. (CMU) ICML Token 级别的流水线并行(比 Micro-Batch Training Large-Scale Language Models 2021 更细粒度) PyTorch FSDP: Experiences on Scaling Fully Zhao et al. VLDB PyTorch 的 FSDP 实现经验和 Scale 测试 Sharded Data Parallel (Meta) 2023 C.5 通信优化 通信优化方向的关键论文如表C-5 所示,涉及集合通信实现、算法自动合成与网络内聚合。 表C-5 通信优化论文 论文标题 作者 会议/年份 核心贡献 NCCL: Accelerating GPU Collective Jeaugey GTC 2017 NCCL 的设计与实现概述 Communications (NVIDIA) BytePS: A High Performance and Generic Jiang et al. OSDI 2020 利用 CPU 进行参数聚合以降低通信 Framework for Distributed DNN Training (ByteDance) 瓶颈的 BytePS 框架 On the Performance of Distributed Deep Learning Hashemi et al. Hot Communication (NVIDIA) Interconnects 系统分析分布式深度学习通信特征 Synthesizing Optimal Collective Algorithms Shah et al. (UT PPoPP 2021 自动合成最优集合通信算法 Austin) (NCCL/MSCCL 图搜索的基础) TACCL: Guiding Collective Algorithm Synthesis Shah et al. NSDI 2023 微软的集合通信算法合成器 using Communication Sketches (Microsoft) In-Network Aggregation for Distributed Machine Graham et al. SC 2020 Mellanox Sharp 网络内聚合技术论 Learning with SHARP (Mellanox) 文 C.6 推理系统 推理系统方向的核心论文如表C-6 所示,覆盖分页 KV Cache、迭代级调度与 Prefill/Decode 分离。 表C-6 推理系统论文 论文标题 作者 会议/年 核心贡献 份 Efficient Memory Management for Large Language Kwon et al. (UC SOSP vLLM 系统论文,提出 PagedAttention Model Serving with PagedAttention Berkeley) 2023 分页 KV Cache 管理 Orca: A Distributed Serving System for Transformer- Yu et al. (SNU) OSDI 提出迭代级调度(Iteration-Level Based Generative Models 2022 Scheduling)提高 GPU 利用率 论文标题 作者 会议/年 核心贡献 份 FlexGen: High-Throughput Generative Inference of Sheng et al. ICML 单 GPU 上通过 CPU Offload 运行 Large Language Models with a Single GPU (Stanford) 2023 175B 模型 Splitwise: Efficient Generative LLM Inference Using Patel et al. ISCA 将 LLM 推理分为 Phase 并分配不同硬 Phase Splitting (MSR/UW) 2024 件资源 DistServe: Disaggregating Prefill and Decoding for Zhong et al. OSDI Prefill 和 Decode 分离部署,独立优化 Goodput-optimized LLM Serving (PKU) 2024 S-LoRA: Serving Thousands of Concurrent LoRA Sheng et al. MLSys 统一的分页 KV Cache 与 LoRA 适配 Adapters (Stanford) 2024 器,支持数千并发 LoRA 服务 SGLang: Efficient Execution of Structured Language Zheng et al. arXiv Structured Generation + Model Programs (Stanford) 2024 RadixAttention 共享 KV Cache 前缀 Sarathi-Serve: Efficient Orchestration of LLM Inference Agrawal (GaTech) et al. OSDI Stalled Request Batching, Chunked 2024 Prefill C.7 量化 量化方向的代表性论文如表C-7 所示,涵盖 INT8、4-bit 权重量化与 FP8 训练。 表C-7 量化论文 论文标题 作者 会议/年份 核心贡献 LLM.int8(): 8-bit Matrix Multiplication for Dettmers et al. NeurIPS 混合精度 INT8:Outlier 维度保留 Transformers at Scale (UW) 2022 FP16 GPTQ: Accurate Post-Training Quantization for Frantar et al. ICLR 基于 OBQ 的权重量化,单 GPU 上 Generative Pre-trained Transformers (IST Austria) 2023 4-bit 量化 175B 模型 QLoRA: Efficient Finetuning of Quantized LLMs Dettmers et al. NeurIPS NF4 量化+LoRA 微调,单 48GB (UW) 2023 GPU 微调 65B 模型 AWQ: Activation-aware Weight Quantization for LLM Lin et al. (MIT) MLSys 基于激活幅度的通道级保护量化 Compression and Acceleration 2024 SmoothQuant: Accurate and Efficient Post-Training Xiao et al. ICML SmoothQuant 将量化难度从权重转 Quantization for LLMs (NVIDIA) 2023 移至激活 FP8-LM: Training FP8 Large Language Models Peng et al. arXiv 首个在 LLM 训练中展示 FP8 可行性 (Microsoft) 2023 的工作 ZeroQuant-V2: Efficient and Accurate Post-Training Yao et al. NeurIPS 低秩补偿量化 Quantization for LLMs (Microsoft) 2023
附录 D 开源项目索引
本附录汇总 AI Infra 领域具有代表性的开源项目,按训练框架、推理系统、通信网络、编译器、云平台、量化压缩、存储 数据、注意力内核与监控运维九个方向分类整理。 D.1 训练框架与系统 训练框架与系统方向的代表性项目如表D-1 所示。 表D-1 训练框架与系统项目 项目 维护者 GitHub Stars 核心功能 PyTorch Meta 103k+ 主流深度学习框架 JAX Google 36k+ 函数式数值计算框架 DeepSpeed Microsoft 43k+ 分布式训练优化库(ZeRO) Megatron-LM NVIDIA 18k+ 大规模 Transformer 训练系统 torchtitan Meta 5.7k+ PyTorch 原生大规模训练框架 FSDP (PyTorch) Meta (PyTorch 内置) 全分片数据并行 D.2 推理系统 推理系统方向的代表性项目如表D-2 所示。 表D-2 推理系统项目 项目 维护者 GitHub Stars 核心功能 vLLM UC Berkeley 90k+ 高吞吐 LLM 推理引擎(PagedAttention) TensorRT-LLM NVIDIA 14k+ NVIDIA 官方 LLM 推理优化 llama.cpp ggerganov 126k+ CPU/GPU 上 C++实现的高效 LLM 推理 SGLang Stanford 32k+ 结构化生成 + 高效 KV Cache 共享 MLC-LLM Apache/mlc-ai 23k+ 编译型跨平台 LLM 推理 LMCache LMCache 11.4k+ KV Cache 管理层,支撑长上下文推理 Hugging Face TGI Hugging Face 10k+ HF 官方文本生成推理服务 Ollama Ollama 179k+ 本地 LLM 运行工具 D.3 通信与网络 通信与网络方向的代表性项目如表D-3 所示。 表D-3 通信与网络项目 项目 维护者 GitHub Stars 核心功能 NCCL NVIDIA 5k+ GPU 集合通信库 项目 维护者 GitHub Stars 核心功能 NCCL Tests NVIDIA 1.6k+ NCCL 性能基准测试工具 RCCL AMD 420+ AMD GPU 集合通信库 D.4 编译器 编译器方向的代表性项目如表D-4 所示。 表D-4 编译器项目 项目 维护者 GitHub Stars 核心功能 Triton triton-lang 20k+ Python GPU Kernel 编译器 XLA OpenXLA 4.5k+ ML 编译器(JIT/AOT 优化) Apache TVM Apache 14k+ 端到端 ML 编译器 Torch-MLIR LLVM 1.9k+ PyTorch → MLIR 编译器管道 IREE iree-org 3.9k+ MLIR-based 模型部署运行时 ONNX Runtime Microsoft 22k+ 跨平台 ML 推理运行时 D.5 云原生与平台 云原生与平台方向的代表性项目如表D-5 所示。 表D-5 云原生与平台项目 项目 维护者 GitHub Stars 核心功能 Kubeflow Google/CNCF 16k+ K8s 原生 ML 工作流平台 MLflow Databricks/LF AI 28k+ ML 实验跟踪与模型管理 Ray Anyscale 44k+ 分布式计算框架 Volcano CNCF 6k+ K8s 批调度器(Gang Scheduling) Kueue K8s SIG-Scheduling 2.9k+ K8s 资源管理和队列 D.6 量化与压缩 量化与压缩方向的代表性项目如表D-6 所示。 表D-6 量化与压缩项目 项目 维护者 GitHub Stars 核心功能 bitsandbytes bitsandbytes-foundation 8k+ LLM.int8()和 QLoRA 的量化后端 GPTQ-for-LLaMA qwopqwop200 3.1k+ GPTQ 量化实现(已归档) AutoGPTQ AutoGPTQ 5k+ 易用的 GPTQ 量化库 AWQ MIT HAN Lab 3.6k+ Activation-aware 量化 TorchAO PyTorch 3.0k+ PyTorch 官方量化工具包 D.7 存储与数据 存储与数据方向的代表性项目如表D-7 所示。 表D-7 存储与数据项目 项目 维护者 GitHub Stars 核心功能 Lustre OpenSFS/Whamcloud - 高性能并行文件系统 WekaFS WekaIO - 云原生并行文件系统 Alluxio Alluxio 7.2k+ 数据编排平台(缓存层) JuiceFS juicedata 14k+ POSIX 兼容分布式文件系统 MosaicML StreamingDataset Databricks 1.5k+ 云端流式训练数据集 D.8 注意力与内核 注意力与内核方向的代表性项目如表D-8 所示。 表D-8 注意力与内核项目 项目 维护者 GitHub Stars 核心功能 FlashAttention Tri Dao 25k+ IO-Aware 注意力实现 FlashInfer UW 6.2k+ GPU Kernel 库,优化 LLM 推理 KTransformers kvcache-ai 19k+ 稀疏 MoE 异构推理内核 xFormers Meta 11k+ 高效 Transformer 组件库 D.9 监控与运维 监控与运维方向的代表性项目如表D-9 所示。 表D-9 监控与运维项目 项目 维护者 GitHub Stars 核心功能 NVIDIA DCGM NVIDIA 780+ GPU 集群监控和管理 Prometheus DCGM Exporter NVIDIA 1.8k+ DCGM 指标导出到 Prometheus 说明:GitHub Stars 数据为截至 2026 年 8 月的近似值。各项目的维护状态和活跃度请以其 GitHub 主页为准。
License
原书采用 CC BY-NC 4.0。
📑 章节目录
第 1 章 AI Infra 概述
《AI Infra 权威指南》第 1 章:AI Infra 概述。
第 2 章 GPU 微结构
《AI Infra 权威指南》第 2 章:GPU 微结构。
第 3 章 加速器与异构计算
《AI Infra 权威指南》第 3 章:加速器与异构计算。
第 4 章 高性能 Kernel
《AI Infra 权威指南》第 4 章:高性能 Kernel。
第 5 章 编译器与框架
《AI Infra 权威指南》第 5 章:编译器与框架。
第 6 章 分布式训练基础
《AI Infra 权威指南》第 6 章:分布式训练基础。
第 7 章 高级并行策略
《AI Infra 权威指南》第 7 章:高级并行策略。
第 8 章 集合通信与网络
《AI Infra 权威指南》第 8 章:集合通信与网络。
第 9 章 训练系统工程
《AI Infra 权威指南》第 9 章:训练系统工程。
第 10 章 推理优化与服务
《AI Infra 权威指南》第 10 章:推理优化与服务。
第 11 章 模型量化与压缩
《AI Infra 权威指南》第 11 章:模型量化与压缩。
第 12 章 RAG 与向量检索
《AI Infra 权威指南》第 12 章:RAG 与向量检索。
第 13 章 存储与数据工程
《AI Infra 权威指南》第 13 章:存储与数据工程。
第 14 章 集群架构与调度
《AI Infra 权威指南》第 14 章:集群架构与调度。
第 15 章 云原生 MLOps
《AI Infra 权威指南》第 15 章:云原生 MLOps。
第 16 章 性能与成本优化
《AI Infra 权威指南》第 16 章:性能与成本优化。
第 17 章 AI Infra 计算
《AI Infra 权威指南》第 17 章:AI Infra 计算。
第 18 章 AI Infra 实践
《AI Infra 权威指南》第 18 章:AI Infra 实践。