返回AI书列表
📚 TheAIEra Book 12 章

高效 AI 实战:量化与快速推理

从效率危机到生产级推理引擎:量化原理、校准与 PTQ、量化感知训练、LLM 量化(LLM.int8/GPTQ/AWQ)、sub-8-bit 格式(FP8/FP4/NF4/三元)、部署管线、GGUF/llama.cpp、边缘移动端与生产验证,共 12 章。

量化推理LLMPTQQATGPU边缘计算书籍

📖 本书大纲

高效 AI 实战:量化与快速推理

在线阅读 · theaiera.top/books/efficient-ai-quantization

本书内容整理自 Manning 书籍《Efficient AI in Practice: Quantization and Fast Inference》的官方代码仓库 Kalyanarangan/efficient-ai-in-practice(作者 Vivek Kalyanarangan,MIT 许可)。

原创来源声明:本书基于 Manning《Efficient AI in Practice: Quantization and Fast Inference》一书的开源代码仓库整理编写,原书为英文,本中文版本面向中文开发者重新组织章节内容、补充背景讲解与代码导读。原书出版方:Manning Publications。

这本书是给谁看的

2025 年之后,"模型能不能跑起来"已经不是问题,"跑得快不快、贵不贵"才是问题。一个 7B 模型在 FP16 下占 14GB 显存,一张消费级显卡就装不下;一次对话几十亿次浮点运算,每一个 token 都从 HBM 里搬运权重。量化——把 FP32/FP16 的权重和激活压缩成 INT8/INT4/FP8——是当下把大模型塞进有限硬件、把推理延迟和成本打下来最核心的手段。

这本书从 Manning 的同名英文书籍代码仓库出发,系统讲清楚量化的原理、算法、工具链和落地路径。它不假设你已经懂量化,但假设你会 Python 和基本的 PyTorch。

目标读者:

  • 想把 LLM 部署到自建服务器、边缘设备、手机的工程师
  • 训练/推理平台的开发者和性能优化工程师
  • 在做 RAG、Agent 应用时被推理延迟和显存成本卡住的应用开发者
  • 想真正理解 GPTQ、AWQ、FP8、GGUF 这些名词背后是什么的学习者

这本书不是什么

这不是一本 API 手册,不会教你怎么调用 torch.quantization 的每一个参数。它关心的是:

  • 为什么 8bit 量化有效?误差从哪来?什么时候失效?
  • 同一个模型,per-tensor、per-channel、per-group 有什么区别?KV cache 该怎么量化?
  • PTQ 和 QAT 各自在什么场景用?校准集怎么构建?
  • LLM.int8()、GPTQ、AWQ、FP8、NF4、1.58-bit 各自的思路和取舍?
  • 量化完的模型怎么部署到 ONNX Runtime、TensorRT、OpenVINO、llama.cpp、Core ML、TFLite?

每个问题都有可以运行的代码、真实的数字和可复现的实验。

怎么读这本书

全书 12 章,按四个板块组织:

  • 第 1-4 章(原理):效率危机、量化的第一性原理、粒度选择、校准与后训练量化(PTQ)。这是必须顺序读的基础。
  • 第 5-6 章(训练与工具链):量化感知训练(QAT)以及 PyTorch / ONNX / TFLite 三条量化通路。
  • 第 7-8 章(LLM 量化):LLM 量化特有的激活异常值问题,LLM.int8()、GPTQ、AWQ、KV cache 量化,以及 FP8、FP4、NF4、三元 1.58-bit 等 sub-8-bit 格式。
  • 第 9-12 章(部署落地):ONNX Runtime / TensorRT / OpenVINO 部署管线、GGUF 与 llama.cpp、边缘与移动端(Core ML / TFLite / LiteRT)、以及把 4bit LLM 服务与端侧视觉管线送进生产的完整案例。

前两板块打基础,第三板块是当下最热的 LLM 量化,第四板块讲怎么真正上线。你可以按顺序读,也可以直接跳到感兴趣的板块。

配套代码

每章对应的可运行脚本都来自原书仓库,章节内部会给出文件名与运行方式。代码基于 Python 3.9+ / PyTorch,绝大多数实验在普通笔记本 CPU 上即可运行,部分 LLM 实验(OPT-6.7B、Qwen2.5-3B)需要 Colab T4 或更高显存。

目录

第一部分 原理

第二部分 训练与工具链

第三部分 LLM 量化

第四部分 部署落地

📑 章节目录

1

第 1 章 效率危机:为什么要量化

《高效 AI 实战:量化与快速推理》第 1 章 效率危机:从能量层级、内存墙到浮点与整数的数轴对比,理解量化要解决的根本问题。

2

第 2 章 从第一性原理构建量化

《高效 AI 实战:量化与快速推理》第 2 章 从第一性原理构建量化:对称与非对称量化、zero-point nudge、混合量化的整数运算管线与误差分析。

3

第 3 章 粒度选择:从 per-tensor 到 per-group

《高效 AI 实战:量化与快速推理》第 3 章 粒度选择:per-tensor、per-channel、per-group 量化的误差与开销权衡,KV cache 量化,异常值处理。

4

第 4 章 校准与后训练量化(PTQ)

《高效 AI 实战:量化与快速推理》第 4 章 校准与后训练量化:激活范围估计、校准集构建、跨层均衡、位宽选择与校准验证。

5

第 5 章 量化感知训练(QAT)

《高效 AI 实战:量化与快速推理》第 5 章 量化感知训练:伪量化与直通估计器、per-channel QAT、PTQ 失败诊断、渐进式量化调度、Transformer QAT。

6

第 6 章 量化通路:PyTorch / ONNX / TFLite

《高效 AI 实战:量化与快速推理》第 6 章 量化通路:PyTorch TorchAO 权重量化、ONNX Runtime 动态/静态量化、TFLite 量化、跨框架数值等价性验证。

7

第 7 章 大语言模型量化实战

《高效 AI 实战:量化与快速推理》第 7 章 LLM 量化实战:激活异常值、LLM.int8() 混合精度分解、GPTQ 海森矩阵感知量化、AWQ 激活感知保护、TurboQuant KV cache 量化。

8

第 8 章 sub-8-bit 格式:FP8 / FP4 / NF4 / 三元

《高效 AI 实战:量化与快速推理》第 8 章 sub-8-bit 格式:FP8 (E4M3/E5M2)、FP4 blockwise、NF4 与 QLoRA、三元 1.58-bit 网络的编码解码、Pareto 前沿与困惑度对比。

9

第 9 章 部署管线:ORT / TensorRT / OpenVINO

《高效 AI 实战:量化与快速推理》第 9 章 部署管线:ONNX Runtime + Optimum 多执行提供方、TensorRT INT8 引擎构建、OpenVINO 部署、模型打包与 Triton 服务。

10

第 10 章 CPU 友好的 LLM 推理:GGUF 与 llama.cpp

《高效 AI 实战:量化与快速推理》第 10 章 CPU 友好的 LLM 推理:每百万 token 成本曲线、GGUF 文件格式逐字节拆解、safetensors→GGUF→量化变体流水线、x86/ARM 内核家族对比与运行时测量。

11

第 11 章 边缘与移动端推理

《高效 AI 实战:量化与快速推理》第 11 章 边缘与移动端推理:三设备三负载、TFLite/LiteRT-LM on Android、Core ML/MLX/MPS on Apple、前后处理开销测量。

12

第 12 章 生产级交付:4bit LLM 服务器与端侧视觉管线

《高效 AI 实战:量化与快速推理》第 12 章 生产级交付:Qwen2.5-3B AWQ 4bit 的 vLLM 服务器 + EfficientNet-Lite0 端侧视觉管线,预发布测试、并发扫描、延迟分解、算子放置、可观测性。