返回我的书列表
📚 TheAIEra Book 18 章

LLM Infra 从入门到实践

一本写给 Agent 开发者的 LLM 底层技术指南:从 Transformer 架构、GPU 与计算基础,到 vLLM 推理引擎、量化与推理加速、微调与 RLHF、分布式训练、生产部署、可观测性与成本优化、RAG 基础设施、多模态,共 6 部分 17 章。

LLM InfraLLMGPU推理微调部署

📖 本书大纲

LLM Infra 从入门到实践

在线阅读 · inferloop.dev/llm-infra

本书内容整理自开源项目 book-llm-infra(作者 diguike,CC BY-NC-SA 4.0 许可)。

原创来源声明:本书内容基于 diguike/book-llm-infra 仓库整理而成,原书在线阅读:inferloop.dev/llm-infra

这本书是给谁看的

一本写给 Agent 开发者的 LLM 底层技术指南。面向应用层工程师(前端/全栈/Agent 开发者),系统化学习 LLM 基础设施知识。

2024 年初,作者在做 Agent 项目时发现:延迟全在模型推理上,但打开 vLLM 的文档,PagedAttention、Continuous Batching、KV Cache 这些词一个都不认识。这本书就是作者当初希望存在的那本书。

目标读者:

  • 前端/全栈工程师,正在或准备做 LLM 应用、Agent 开发
  • 会 TypeScript/Python,但不懂 GPU、CUDA、分布式计算
  • 不打算成为 ML 研究员,但需要理解 Infra 层面在发生什么
  • 希望能自己部署模型、优化推理性能、控制成本

目标

  • 读完后对 LLM Infra 有完整认知,具备初步实战能力
  • 每章配套可运行的代码示例
  • 所有部署示例基于阿里云/腾讯云,确保国内可用

目录

前言

第 0 章

第一部分 基础认知重建

第二部分 模型服务与推理引擎

第三部分 模型优化

第四部分 微调与训练

第五部分 生产部署与平台工程

第六部分 前沿与进阶

附录

附录 B(Python/PyTorch 环境搭建)已并入第 0 章。

环境要求

  • Python 3.10+
  • PyTorch 2.0+
  • 部分章节需要 GPU(最低 RTX 3090 / 阿里云 ecs.gn7i / 腾讯云 GN10Xp)
  • 各章节的 README 会标注具体硬件要求

附录 A 阿里云/腾讯云 GPU 实例速查

最后更新:2026-05 GPU 实例规格和价格变化频繁,遇到不一致时以官方文档为准:阿里云 GPU(ECS:Elastic Compute Service,阿里云的虚拟机产品)、腾讯云 GPU(CVM:Cloud Virtual Machine,腾讯云的虚拟机产品)。

术语速读(本附录高频缩写)

  • GPU 型号:NVIDIA 数据中心卡常见型号——A10(Ampere 架构入门卡,24GB 显存)、A100(Ampere 旗舰,40GB/80GB 两版)、H100(Hopper 旗舰,80GB HBM3,A100 的 2-3 倍算力)、H800(H100 的合规版,受出口管制后向中国市场供应,NVLink 带宽阉割)、H20(更进一步的合规版,算力再砍)、L20(Ada Lovelace 架构推理卡,48GB GDDR6,2024 年起在国内云上线)、L40S(L20 的高端版,48GB 但更强)
  • HBM3 vs GDDR6:HBM3(High Bandwidth Memory 第三代)是堆叠式高带宽显存,A100/H100 用;GDDR6 是显卡常见的图形显存,带宽较低但成本也低,L20 用

实例选型决策树

graph TD
    A[你的场景] --> B{预算优先 还是 性能优先?}
    B -->|预算敏感| C{数据量}
    B -->|性能优先| D{模型规模}
    C -->|< 10GB 模型| C1[1× L20 48GB
或 1× A10 24GB 抢占式] C -->|10-40GB 模型| C2[1× L20 48GB
或 1× A100 40GB] D -->|7-13B 推理| D1[1× L20 48GB
性价比最高]

完整附录见仓库文件 llm-infra-appendix-a.md(本地/源码阅读)。

附录 C 术语表

本术语表按主题分组,每个条目给出中文名、英文(含缩写)、一句话定义和主要出现章节,方便读者随时回查。同一主题内按英文字母顺序排列。

模型与架构

术语 英文 一句话定义 主要章节
激活参数 Active Parameters MoE 模型每个 token 实际计算用到的参数量,决定推理速度;和总参数对应 ch02
注意力机制 Attention Transformer 核心计算,让每个 token 根据 Q/K/V 关注序列里的其他 token ch02
DeepSeek DeepSeek 国内 AI 公司开源的模型系列,技术路线偏激进,代表作 DeepSeek-V3 用 MoE 架构(671B 总参 / 37B 激活) ch01、ch07
向量化 / 嵌入 Embedding 把 token、图片或音频映射成固定维度的浮点向量,语义相近的向量在空间中距离近 ch02、ch14
前馈网络 FFN (Feed-Forward Network) Transformer Block 内的两层 MLP,负责对每个 token 做非线性特征变换 ch02
分组查询注意力 GQA (Grouped Query Attention) 多个 Q 头共享同一组 K/V 头,显著减小 KV Cache 体积,Llama 2 70B / Llama 3 默认使用 ch02、ch04
Hugging Face Hugging Face LLM 生态最大的模型托管平台 + Transformers 库 + 配套训练/推理工具家族(PEFT、TRL、Accelerate 等) 全书
键值缓存 KV Cache 缓存历史 token 的 Key/Value,Decode 阶段只算新 token 的 Q 即可,是 LLM 推理显存大头 ch01、ch02、ch05、ch08
Llama Llama Meta 开源的大语言模型系列,从 Llama 1 (2023) 到 Llama 4 (2025),架构成为现代开源 LLM 事实标准 ch01、ch02、全书
层归一化 LayerNorm / RMSNorm 对每层输出做归一化稳定训练;RMSNorm 是 Llama 系列用的简化版,只做 RMS 缩放 ch02
大语言模型 LLM (Large Language Model) 基于 Transformer 的大规模预训练语言模型 全书
Logits Logits 模型最后一层输出的未经 softmax 的原始分数向量,长度等于词表大小 ch04

完整术语表见仓库文件 llm-infra-appendix-c.md(本地/源码阅读)。

License

CC BY-NC-SA 4.0

📑 章节目录

0

第 0 章:Python 环境与快速入门

《LLM Infra 从入门到实践》第 0 章:Python 环境与快速入门。

准备篇

前言

《LLM Infra 从入门到实践》前言:这本书是写给谁看的。

1

第 1 章 全景图:LLM 技术栈的分层

《LLM Infra 从入门到实践》第 1 章 全景图:LLM 技术栈的分层。

2

第 2 章 Transformer 架构:工程师视角

《LLM Infra 从入门到实践》第 2 章 Transformer 架构:工程师视角。

3

第 3 章 GPU 与计算基础

《LLM Infra 从入门到实践》第 3 章 GPU 与计算基础。

4

第 4 章 模型推理:从权重文件到 API 响应

《LLM Infra 从入门到实践》第 4 章 模型推理:从权重文件到 API 响应。

5

第 5 章 vLLM:工业级推理引擎深度剖析

《LLM Infra 从入门到实践》第 5 章 vLLM:工业级推理引擎深度剖析。

6

第 6 章 推理引擎对比与选型

《LLM Infra 从入门到实践》第 6 章 推理引擎对比与选型。

7

第 7 章 量化:用更少的显存跑更大的模型

《LLM Infra 从入门到实践》第 7 章 量化:用更少的显存跑更大的模型。

8

第 8 章 推理加速技术

《LLM Infra 从入门到实践》第 8 章 推理加速技术。

9

第 9 章 微调:让通用模型变成领域专家

《LLM Infra 从入门到实践》第 9 章 微调:让通用模型变成领域专家。

10

第 10 章 RLHF 与对齐

《LLM Infra 从入门到实践》第 10 章 RLHF 与对齐。

11

第 11 章 分布式训练基础

《LLM Infra 从入门到实践》第 11 章 分布式训练基础。

12

第 12 章 LLM 服务的生产化部署

《LLM Infra 从入门到实践》第 12 章 LLM 服务的生产化部署。

13

第 13 章 可观测性与成本优化

《LLM Infra 从入门到实践》第 13 章 可观测性与成本优化。

14

第 14 章 RAG 系统的基础设施

《LLM Infra 从入门到实践》第 14 章 RAG 系统的基础设施。

15

第 15 章 多模态模型的基础设施

《LLM Infra 从入门到实践》第 15 章 多模态模型的基础设施。

16

第 16 章 延伸学习地图

《LLM Infra 从入门到实践》第 16 章 延伸学习地图。