LLM Infra 从入门到实践
一本写给 Agent 开发者的 LLM 底层技术指南:从 Transformer 架构、GPU 与计算基础,到 vLLM 推理引擎、量化与推理加速、微调与 RLHF、分布式训练、生产部署、可观测性与成本优化、RAG 基础设施、多模态,共 6 部分 17 章。
📖 本书大纲
LLM Infra 从入门到实践
在线阅读 · inferloop.dev/llm-infra
本书内容整理自开源项目 book-llm-infra(作者 diguike,CC BY-NC-SA 4.0 许可)。
原创来源声明:本书内容基于 diguike/book-llm-infra 仓库整理而成,原书在线阅读:inferloop.dev/llm-infra。
这本书是给谁看的
一本写给 Agent 开发者的 LLM 底层技术指南。面向应用层工程师(前端/全栈/Agent 开发者),系统化学习 LLM 基础设施知识。
2024 年初,作者在做 Agent 项目时发现:延迟全在模型推理上,但打开 vLLM 的文档,PagedAttention、Continuous Batching、KV Cache 这些词一个都不认识。这本书就是作者当初希望存在的那本书。
目标读者:
- 前端/全栈工程师,正在或准备做 LLM 应用、Agent 开发
- 会 TypeScript/Python,但不懂 GPU、CUDA、分布式计算
- 不打算成为 ML 研究员,但需要理解 Infra 层面在发生什么
- 希望能自己部署模型、优化推理性能、控制成本
目标
- 读完后对 LLM Infra 有完整认知,具备初步实战能力
- 每章配套可运行的代码示例
- 所有部署示例基于阿里云/腾讯云,确保国内可用
目录
前言
第 0 章
第一部分 基础认知重建
第二部分 模型服务与推理引擎
第三部分 模型优化
第四部分 微调与训练
第五部分 生产部署与平台工程
第六部分 前沿与进阶
附录
附录 B(Python/PyTorch 环境搭建)已并入第 0 章。
环境要求
- Python 3.10+
- PyTorch 2.0+
- 部分章节需要 GPU(最低 RTX 3090 / 阿里云 ecs.gn7i / 腾讯云 GN10Xp)
- 各章节的 README 会标注具体硬件要求
附录 A 阿里云/腾讯云 GPU 实例速查
最后更新:2026-05 GPU 实例规格和价格变化频繁,遇到不一致时以官方文档为准:阿里云 GPU(ECS:Elastic Compute Service,阿里云的虚拟机产品)、腾讯云 GPU(CVM:Cloud Virtual Machine,腾讯云的虚拟机产品)。
术语速读(本附录高频缩写)
- GPU 型号:NVIDIA 数据中心卡常见型号——A10(Ampere 架构入门卡,24GB 显存)、A100(Ampere 旗舰,40GB/80GB 两版)、H100(Hopper 旗舰,80GB HBM3,A100 的 2-3 倍算力)、H800(H100 的合规版,受出口管制后向中国市场供应,NVLink 带宽阉割)、H20(更进一步的合规版,算力再砍)、L20(Ada Lovelace 架构推理卡,48GB GDDR6,2024 年起在国内云上线)、L40S(L20 的高端版,48GB 但更强)
- HBM3 vs GDDR6:HBM3(High Bandwidth Memory 第三代)是堆叠式高带宽显存,A100/H100 用;GDDR6 是显卡常见的图形显存,带宽较低但成本也低,L20 用
实例选型决策树
graph TD
A[你的场景] --> B{预算优先 还是 性能优先?}
B -->|预算敏感| C{数据量}
B -->|性能优先| D{模型规模}
C -->|< 10GB 模型| C1[1× L20 48GB
或 1× A10 24GB 抢占式]
C -->|10-40GB 模型| C2[1× L20 48GB
或 1× A100 40GB]
D -->|7-13B 推理| D1[1× L20 48GB
性价比最高]完整附录见仓库文件 llm-infra-appendix-a.md(本地/源码阅读)。
附录 C 术语表
本术语表按主题分组,每个条目给出中文名、英文(含缩写)、一句话定义和主要出现章节,方便读者随时回查。同一主题内按英文字母顺序排列。
模型与架构
| 术语 | 英文 | 一句话定义 | 主要章节 |
|---|---|---|---|
| 激活参数 | Active Parameters | MoE 模型每个 token 实际计算用到的参数量,决定推理速度;和总参数对应 | ch02 |
| 注意力机制 | Attention | Transformer 核心计算,让每个 token 根据 Q/K/V 关注序列里的其他 token | ch02 |
| DeepSeek | DeepSeek | 国内 AI 公司开源的模型系列,技术路线偏激进,代表作 DeepSeek-V3 用 MoE 架构(671B 总参 / 37B 激活) | ch01、ch07 |
| 向量化 / 嵌入 | Embedding | 把 token、图片或音频映射成固定维度的浮点向量,语义相近的向量在空间中距离近 | ch02、ch14 |
| 前馈网络 | FFN (Feed-Forward Network) | Transformer Block 内的两层 MLP,负责对每个 token 做非线性特征变换 | ch02 |
| 分组查询注意力 | GQA (Grouped Query Attention) | 多个 Q 头共享同一组 K/V 头,显著减小 KV Cache 体积,Llama 2 70B / Llama 3 默认使用 | ch02、ch04 |
| Hugging Face | Hugging Face | LLM 生态最大的模型托管平台 + Transformers 库 + 配套训练/推理工具家族(PEFT、TRL、Accelerate 等) | 全书 |
| 键值缓存 | KV Cache | 缓存历史 token 的 Key/Value,Decode 阶段只算新 token 的 Q 即可,是 LLM 推理显存大头 | ch01、ch02、ch05、ch08 |
| Llama | Llama | Meta 开源的大语言模型系列,从 Llama 1 (2023) 到 Llama 4 (2025),架构成为现代开源 LLM 事实标准 | ch01、ch02、全书 |
| 层归一化 | LayerNorm / RMSNorm | 对每层输出做归一化稳定训练;RMSNorm 是 Llama 系列用的简化版,只做 RMS 缩放 | ch02 |
| 大语言模型 | LLM (Large Language Model) | 基于 Transformer 的大规模预训练语言模型 | 全书 |
| Logits | Logits | 模型最后一层输出的未经 softmax 的原始分数向量,长度等于词表大小 | ch04 |
完整术语表见仓库文件 llm-infra-appendix-c.md(本地/源码阅读)。
License
CC BY-NC-SA 4.0
📑 章节目录
第 0 章:Python 环境与快速入门
《LLM Infra 从入门到实践》第 0 章:Python 环境与快速入门。
前言
《LLM Infra 从入门到实践》前言:这本书是写给谁看的。
第 1 章 全景图:LLM 技术栈的分层
《LLM Infra 从入门到实践》第 1 章 全景图:LLM 技术栈的分层。
第 2 章 Transformer 架构:工程师视角
《LLM Infra 从入门到实践》第 2 章 Transformer 架构:工程师视角。
第 3 章 GPU 与计算基础
《LLM Infra 从入门到实践》第 3 章 GPU 与计算基础。
第 4 章 模型推理:从权重文件到 API 响应
《LLM Infra 从入门到实践》第 4 章 模型推理:从权重文件到 API 响应。
第 5 章 vLLM:工业级推理引擎深度剖析
《LLM Infra 从入门到实践》第 5 章 vLLM:工业级推理引擎深度剖析。
第 6 章 推理引擎对比与选型
《LLM Infra 从入门到实践》第 6 章 推理引擎对比与选型。
第 7 章 量化:用更少的显存跑更大的模型
《LLM Infra 从入门到实践》第 7 章 量化:用更少的显存跑更大的模型。
第 8 章 推理加速技术
《LLM Infra 从入门到实践》第 8 章 推理加速技术。
第 9 章 微调:让通用模型变成领域专家
《LLM Infra 从入门到实践》第 9 章 微调:让通用模型变成领域专家。
第 10 章 RLHF 与对齐
《LLM Infra 从入门到实践》第 10 章 RLHF 与对齐。
第 11 章 分布式训练基础
《LLM Infra 从入门到实践》第 11 章 分布式训练基础。
第 12 章 LLM 服务的生产化部署
《LLM Infra 从入门到实践》第 12 章 LLM 服务的生产化部署。
第 13 章 可观测性与成本优化
《LLM Infra 从入门到实践》第 13 章 可观测性与成本优化。
第 14 章 RAG 系统的基础设施
《LLM Infra 从入门到实践》第 14 章 RAG 系统的基础设施。
第 15 章 多模态模型的基础设施
《LLM Infra 从入门到实践》第 15 章 多模态模型的基础设施。
第 16 章 延伸学习地图
《LLM Infra 从入门到实践》第 16 章 延伸学习地图。