高效 AI 实战:量化与快速推理
从效率危机到生产级推理引擎:量化原理、校准与 PTQ、量化感知训练、LLM 量化(LLM.int8/GPTQ/AWQ)、sub-8-bit 格式(FP8/FP4/NF4/三元)、部署管线、GGUF/llama.cpp、边缘移动端与生产验证,共 12 章。
📖 本书大纲
高效 AI 实战:量化与快速推理
本书内容整理自 Manning 书籍《Efficient AI in Practice: Quantization and Fast Inference》的官方代码仓库 Kalyanarangan/efficient-ai-in-practice(作者 Vivek Kalyanarangan,MIT 许可)。
原创来源声明:本书基于 Manning《Efficient AI in Practice: Quantization and Fast Inference》一书的开源代码仓库整理编写,原书为英文,本中文版本面向中文开发者重新组织章节内容、补充背景讲解与代码导读。原书出版方:Manning Publications。
这本书是给谁看的
2025 年之后,"模型能不能跑起来"已经不是问题,"跑得快不快、贵不贵"才是问题。一个 7B 模型在 FP16 下占 14GB 显存,一张消费级显卡就装不下;一次对话几十亿次浮点运算,每一个 token 都从 HBM 里搬运权重。量化——把 FP32/FP16 的权重和激活压缩成 INT8/INT4/FP8——是当下把大模型塞进有限硬件、把推理延迟和成本打下来最核心的手段。
这本书从 Manning 的同名英文书籍代码仓库出发,系统讲清楚量化的原理、算法、工具链和落地路径。它不假设你已经懂量化,但假设你会 Python 和基本的 PyTorch。
目标读者:
- 想把 LLM 部署到自建服务器、边缘设备、手机的工程师
- 训练/推理平台的开发者和性能优化工程师
- 在做 RAG、Agent 应用时被推理延迟和显存成本卡住的应用开发者
- 想真正理解 GPTQ、AWQ、FP8、GGUF 这些名词背后是什么的学习者
这本书不是什么
这不是一本 API 手册,不会教你怎么调用 torch.quantization 的每一个参数。它关心的是:
- 为什么 8bit 量化有效?误差从哪来?什么时候失效?
- 同一个模型,per-tensor、per-channel、per-group 有什么区别?KV cache 该怎么量化?
- PTQ 和 QAT 各自在什么场景用?校准集怎么构建?
- LLM.int8()、GPTQ、AWQ、FP8、NF4、1.58-bit 各自的思路和取舍?
- 量化完的模型怎么部署到 ONNX Runtime、TensorRT、OpenVINO、llama.cpp、Core ML、TFLite?
每个问题都有可以运行的代码、真实的数字和可复现的实验。
怎么读这本书
全书 12 章,按四个板块组织:
- 第 1-4 章(原理):效率危机、量化的第一性原理、粒度选择、校准与后训练量化(PTQ)。这是必须顺序读的基础。
- 第 5-6 章(训练与工具链):量化感知训练(QAT)以及 PyTorch / ONNX / TFLite 三条量化通路。
- 第 7-8 章(LLM 量化):LLM 量化特有的激活异常值问题,LLM.int8()、GPTQ、AWQ、KV cache 量化,以及 FP8、FP4、NF4、三元 1.58-bit 等 sub-8-bit 格式。
- 第 9-12 章(部署落地):ONNX Runtime / TensorRT / OpenVINO 部署管线、GGUF 与 llama.cpp、边缘与移动端(Core ML / TFLite / LiteRT)、以及把 4bit LLM 服务与端侧视觉管线送进生产的完整案例。
前两板块打基础,第三板块是当下最热的 LLM 量化,第四板块讲怎么真正上线。你可以按顺序读,也可以直接跳到感兴趣的板块。
配套代码
每章对应的可运行脚本都来自原书仓库,章节内部会给出文件名与运行方式。代码基于 Python 3.9+ / PyTorch,绝大多数实验在普通笔记本 CPU 上即可运行,部分 LLM 实验(OPT-6.7B、Qwen2.5-3B)需要 Colab T4 或更高显存。
目录
第一部分 原理
第二部分 训练与工具链
第三部分 LLM 量化
第四部分 部署落地
📑 章节目录
第 1 章 效率危机:为什么要量化
《高效 AI 实战:量化与快速推理》第 1 章 效率危机:从能量层级、内存墙到浮点与整数的数轴对比,理解量化要解决的根本问题。
第 2 章 从第一性原理构建量化
《高效 AI 实战:量化与快速推理》第 2 章 从第一性原理构建量化:对称与非对称量化、zero-point nudge、混合量化的整数运算管线与误差分析。
第 3 章 粒度选择:从 per-tensor 到 per-group
《高效 AI 实战:量化与快速推理》第 3 章 粒度选择:per-tensor、per-channel、per-group 量化的误差与开销权衡,KV cache 量化,异常值处理。
第 4 章 校准与后训练量化(PTQ)
《高效 AI 实战:量化与快速推理》第 4 章 校准与后训练量化:激活范围估计、校准集构建、跨层均衡、位宽选择与校准验证。
第 5 章 量化感知训练(QAT)
《高效 AI 实战:量化与快速推理》第 5 章 量化感知训练:伪量化与直通估计器、per-channel QAT、PTQ 失败诊断、渐进式量化调度、Transformer QAT。
第 6 章 量化通路:PyTorch / ONNX / TFLite
《高效 AI 实战:量化与快速推理》第 6 章 量化通路:PyTorch TorchAO 权重量化、ONNX Runtime 动态/静态量化、TFLite 量化、跨框架数值等价性验证。
第 7 章 大语言模型量化实战
《高效 AI 实战:量化与快速推理》第 7 章 LLM 量化实战:激活异常值、LLM.int8() 混合精度分解、GPTQ 海森矩阵感知量化、AWQ 激活感知保护、TurboQuant KV cache 量化。
第 8 章 sub-8-bit 格式:FP8 / FP4 / NF4 / 三元
《高效 AI 实战:量化与快速推理》第 8 章 sub-8-bit 格式:FP8 (E4M3/E5M2)、FP4 blockwise、NF4 与 QLoRA、三元 1.58-bit 网络的编码解码、Pareto 前沿与困惑度对比。
第 9 章 部署管线:ORT / TensorRT / OpenVINO
《高效 AI 实战:量化与快速推理》第 9 章 部署管线:ONNX Runtime + Optimum 多执行提供方、TensorRT INT8 引擎构建、OpenVINO 部署、模型打包与 Triton 服务。
第 10 章 CPU 友好的 LLM 推理:GGUF 与 llama.cpp
《高效 AI 实战:量化与快速推理》第 10 章 CPU 友好的 LLM 推理:每百万 token 成本曲线、GGUF 文件格式逐字节拆解、safetensors→GGUF→量化变体流水线、x86/ARM 内核家族对比与运行时测量。
第 11 章 边缘与移动端推理
《高效 AI 实战:量化与快速推理》第 11 章 边缘与移动端推理:三设备三负载、TFLite/LiteRT-LM on Android、Core ML/MLX/MPS on Apple、前后处理开销测量。
第 12 章 生产级交付:4bit LLM 服务器与端侧视觉管线
《高效 AI 实战:量化与快速推理》第 12 章 生产级交付:Qwen2.5-3B AWQ 4bit 的 vLLM 服务器 + EfficientNet-Lite0 端侧视觉管线,预发布测试、并发扫描、延迟分解、算子放置、可观测性。