大语言模型全生命周期工程:从 Transformer 到 LLMOps
以大语言模型为主轴、生命周期全景不丢的 LLM 工程指南:类型、规模、数据、训练、评估、分布式训练、压缩、推理、服务、部署、监控与治理,共 8 篇 28 章 + 10 附录。
📖 本书大纲
大语言模型全生命周期工程:类型、规模、训练、服务、部署、监控与分布式系统
副标题:从 Transformer 到 LLMOps
关于本书
本书以「LLM 为主轴、生命周期全景不丢」为原则组织。传统机器学习、深度学习、视觉、语音、推荐等内容作为背景与对照保留,每一篇都贯穿着 LLM 主线:LLM 概念、预训练、微调、对齐、推理、服务、部署、监控、安全。
全书保持生命周期完整:模型类型 → 规模 → 数据 → 训练 → 评估 → 分布式训练 → 压缩 → 推理 → Serving → 部署 → 监控 → 治理 → 案例 → 趋势。
全书共 8 篇 28 章 + 10 个附录。每章遵循统一的写作结构(见下文「每章统一结构」)。
LLM 概念全生命周期地图
| 生命周期阶段 | 重点 LLM 概念 |
|---|---|
| 基础 | Transformer、Token、Embedding、Attention、位置编码、Decoder-only、MoE |
| 数据 | 预训练语料、指令数据、偏好数据、RAG 语料、合成数据、数据混合 |
| 训练 | CLM、SFT、RLHF、DPO、RLAIF、LoRA、QLoRA、长上下文训练 |
| 评估 | MMLU、GSM8K、HumanEval、MT-Bench、Arena、幻觉、越狱、红队 |
| 分布式训练 | 数据并行、张量并行、流水并行、专家并行、ZeRO、FSDP、Megatron |
| 压缩 | 量化、AWQ、GPTQ、GGUF、剪枝、蒸馏、稀疏化 |
| 推理 | KV Cache、PagedAttention、连续批处理、投机解码、前缀缓存 |
| 服务 | vLLM、TGI、TensorRT-LLM、流式输出、函数调用、RAG、Agent |
| 部署 | 多副本、多区域、边缘-云协同、分布式推理、GPU 调度 |
| 监控 | Prompt、Token、RAG 命中、工具调用、漂移、安全、成本 |
| 治理 | 提示注入、越狱、隐私、合规、模型卡、审计 |
目录
前言与导读
- 为什么模型工程不是「训练完就结束」
- LLM 生命周期全景:数据 → 预训练 → 微调 → 对齐 → 评估 → 压缩 → 推理 → 服务 → 部署 → 监控 → 迭代
- 传统 ML、深度学习、基础模型、LLM 的差异
- 本书结构、读者路径、代码与工具约定
- 小模型、大模型、边缘模型、基础模型的差异
第 1 篇 模型基础与 LLM 概念
第 2 篇 数据、训练与评估
第 3 篇 分布式训练与基础设施
第 4 篇 模型压缩与推理优化
第 5 篇 模型服务 Serving
第 6 篇 部署与发布
第 7 篇 监控、运维与治理
第 8 篇 实践案例与趋势
附录
- 附录 A 数学基础:线性代数、概率、优化、信息论
- 附录 B 常用工具链:PyTorch、TensorFlow、JAX、Ray、K8s、vLLM、Triton
- 附录 C 术语表
- 附录 D 模型上线检查清单
- 附录 E 训练检查清单
- 附录 F 监控告警检查清单
- 附录 G 安全合规检查清单
- 附录 H 常用数据集与基准
- 附录 I 推荐论文与开源项目
- 附录 J 习题与实验
前言与导读
- 为什么模型工程不是「训练完就结束」
- LLM 生命周期全景:数据 → 预训练 → 微调 → 对齐 → 评估 → 压缩 → 推理 → 服务 → 部署 → 监控 → 迭代
- 传统 ML、深度学习、基础模型、LLM 的差异
- 本书结构、读者路径、代码与工具约定
- 小模型、大模型、边缘模型、基础模型的差异
第 1 篇 模型基础与 LLM 概念
第 1 章 模型与 LLM 总览
- 模型、参数、超参数、结构、目标函数
- 假设空间、归纳偏置、泛化与过拟合
- 判别模型 vs 生成模型
- 传统 ML、深度学习、基础模型、LLM
- LLM 的定义、能力、涌现与边界
- LLM 生命周期与工程视角
第 2 章 模型类型全景:从传统模型到 LLM
- 按学习范式:监督、无监督、自监督、半监督、强化学习
- 按任务:分类、回归、排序、检测、分割、生成、检索、对话
- 按结构:线性模型、树模型、集成模型、核方法、贝叶斯模型
- 神经网络:MLP、CNN、RNN/LSTM、Transformer、GNN、Diffusion、GAN、VAE
- LLM 架构:Encoder-only、Decoder-only、Encoder-Decoder
- 按模态:文本、图像、语音、视频、表格、时序、图、多模态
- 按规模:小模型、中模型、大模型、基础模型、边缘模型
- 按部署形态:在线、离线、流式、端侧
第 3 章 LLM 核心概念
- Tokenization:BPE、WordPiece、SentencePiece、词表设计
- Embedding、位置编码、RoPE、ALiBi
- Self-Attention、Multi-Head Attention、MHA/MQA/GQA
- FFN、残差连接、LayerNorm/RMSNorm
- 因果掩码、上下文窗口、KV Cache
- 预训练目标:CLM、MLM、Span Corruption
- 涌现能力、In-Context Learning、思维链、指令跟随
- 幻觉、对齐、安全、可控生成
- 提示、对话模板、系统提示、结构化输出
第 4 章 模型大小与规模
- 参数量、层数、宽度、深度、词表大小、上下文窗口
- 稠密模型 vs 稀疏模型 vs MoE
- 激活参数量 vs 总参数量
- FLOPs、内存占用、显存占用、KV Cache、优化器状态
- 存储、带宽、通信量与成本
- Scaling Law、Chinchilla 规律、规模收益与边际成本
- 小模型价值:蒸馏、量化、端侧、低延迟
第 5 章 模型生命周期与工程视角
- 研究生命周期 vs 生产生命周期
- 模型卡、数据卡、实验追踪、版本管理
- 从 Notebook 到生产系统的鸿沟
- MLOps、LLMOps、ModelOps 的区别
- LLM 工程的特殊性:Prompt、上下文、RAG、Agent、Token 成本
第 2 篇 数据、训练与评估
第 6 章 数据工程
- 数据采集、清洗、去重、过滤、标注
- 数据质量、偏差、隐私、版权
- 训练集、验证集、测试集、线上反馈数据
- 数据版本、血缘、治理
- LLM 数据专题:预训练语料、指令数据、偏好数据、对话数据、RAG 语料
- 合成数据、数据增强、数据混合、课程学习
第 7 章 训练基础
- 损失函数、优化器、学习率、正则化
- 初始化、归一化、残差连接
- 批大小、梯度累积、训练稳定性
- 预训练、继续预训练、微调、指令微调
- LLM 对齐:RLHF、DPO、RLAIF、Constitutional AI
- 蒸馏、自训练、持续学习、增量学习、联邦学习
第 8 章 高效训练与微调
- 混合精度:FP16、BF16、FP8
- 梯度检查点、重计算、ZeRO、FSDP
- LoRA、QLoRA、Adapter、Prefix/Prompt Tuning
- 参数高效微调 vs 全量微调
- 长上下文训练、位置插值、序列并行
- 训练加速:算子优化、编译、通信重叠
第 9 章 评估与基准
- 离线评估:准确率、F1、AUC、BLEU、ROUGE、Perplexity
- LLM 能力基准:MMLU、GSM8K、HumanEval、MATH、BBH
- 对话与偏好评估:MT-Bench、Chatbot Arena、AlpacaEval
- RAG 评估、Agent 评估、工具调用评估
- 人评、A/B 测试、在线指标
- 幻觉、毒性、偏见、鲁棒性、越狱、安全评估
- 评估集污染、可信评估、红队测试
第 3 篇 分布式训练与基础设施
第 10 章 分布式训练原理
- 数据并行、模型并行、流水并行、张量并行、专家并行
- AllReduce、AllGather、ReduceScatter、集合通信
- 同步训练 vs 异步训练
- 全局批大小、梯度累积、学习率缩放
- LLM 训练中的并行组合与通信瓶颈
第 11 章 分布式训练框架与系统
- PyTorch DDP、FSDP、DeepSpeed、Megatron-LM
- Horovod、Ray Train、Colossal-AI
- 通信拓扑:NVLink、InfiniBand、RoCE
- GPU/TPU/NPU 集群、调度与容错
- Checkpoint、断点续训、弹性训练
- 千卡/万卡训练、MFU、成本、吞吐、扩展效率
第 12 章 训练基础设施
- 计算、存储、网络、调度
- Kubernetes、Slurm、Volcano、KubeRay
- 多租户、配额、优先级、抢占
- 实验管理、日志、指标、追踪
- 训练监控与故障排查
第 4 篇 模型压缩与推理优化
第 13 章 模型压缩
- 量化:PTQ、QAT、INT8、INT4、FP8、AWQ、GPTQ、GGUF
- 剪枝:结构化、非结构化、稀疏化
- 蒸馏:知识蒸馏、教师学生模型、黑盒/白盒蒸馏
- 低秩分解、权重共享、神经架构搜索
- LLM 压缩专题:量化对精度、延迟、吞吐、成本的影响
第 14 章 推理优化
- 推理 vs 训练:计算图、内存、批处理差异
- KV Cache、PagedAttention、连续批处理
- 动态批处理、投机解码、并行采样
- 算子融合、图优化、编译
- 推理引擎:ONNX Runtime、TensorRT、OpenVINO、vLLM、TGI、TensorRT-LLM
- 长上下文推理、前缀缓存、分块预填充
- 延迟、吞吐、成本三角
第 5 篇 模型服务 Serving
第 15 章 模型服务基础
- 什么是 Serving、Inference、Scoring
- 同步、异步、流式、批处理
- REST、gRPC、WebSocket、消息队列
- 在线推理、离线推理、近线推理
- 多模型服务、多版本服务、模型路由
第 16 章 服务架构
- 模型服务器:Triton、TorchServe、KServe、Ray Serve、Seldon
- API 网关、负载均衡、限流、鉴权
- 自动扩缩容:HPA、KEDA、自定义指标
- 缓存、队列、背压、超时、重试
- 灰度发布、蓝绿发布、金丝雀发布
- A/B 测试、影子流量、多臂老虎机
第 17 章 LLM 服务专题
- LLM Serving 架构:Prefill、Decode、KV Cache 管理
- 连续批处理、分页注意力、前缀缓存
- 多租户隔离、配额、优先级
- Token 成本、GPU 利用率、SLA
- RAG 服务、Agent 服务、工具调用
- 流式输出、函数调用、结构化输出
第 6 篇 部署与发布
第 18 章 部署基础
- 部署目标:云、边、端、混合、私有化
- 容器、镜像、Kubernetes、Helm、Operator
- GPU 调度、MIG、共享 GPU、异构硬件
- Serverless、边缘 K3s、移动端、浏览器端
- 模型格式:ONNX、TorchScript、SavedModel、GGUF、TensorRT Engine
第 19 章 模型版本与发布工程
- 模型注册表、模型仓库、制品管理
- CI/CD/CT:持续集成、持续交付、持续训练
- 环境隔离:开发、测试、预发、生产
- 配置管理、密钥管理、权限控制
- 回滚、审计、合规
第 20 章 分布式部署
- 多副本部署、无状态服务、有状态服务
- 多区域、多集群、混合云、边缘协同
- 分布式推理:张量并行、流水并行、专家并行
- 服务网格、流量治理、故障隔离
- 联邦推理、边缘-云协同、分层推理
- 一致性、可用性、分区容忍与成本权衡
第 7 篇 监控、运维与治理
第 21 章 监控体系
- 指标、日志、追踪、事件、告警
- 系统指标:CPU、GPU、显存、网络、磁盘
- 服务指标:QPS、延迟、错误率、饱和度
- 模型指标:准确率、召回、漂移、幻觉、安全
- 业务指标:转化、收入、用户满意度、成本
第 22 章 模型可观测性
- 输入输出监控、数据漂移、概念漂移
- 异常检测、离群点、分布偏移
- 解释性、归因、审计日志
- LLM 可观测性:Prompt、Token、工具调用、RAG 命中
- 在线评估与反馈闭环
第 23 章 可靠性、安全与治理
- SLO、SLA、SLI、错误预算
- 容量规划、压测、混沌工程、故障演练
- 降级、熔断、限流、排队、缓存
- 安全:对抗攻击、越狱、提示注入、数据泄露
- 隐私:差分隐私、联邦学习、机密计算
- 合规:GDPR、AI Act、模型卡、数据卡、审计
第 8 篇 实践案例与趋势
第 24 章 案例:传统模型生产化
- 风控、推荐、广告、搜索、预测
- 特征平台、模型服务、监控闭环
第 25 章 案例:视觉/语音/多模态
- 图像分类、检测、分割、OCR
- 语音识别、合成、实时通信
- 多模态检索、图文生成、视频理解
第 26 章 案例:LLM 与 Agent
- 从预训练到对齐
- RAG 服务、Agent 平台、工具调用
- 多租户 LLM 服务、成本优化
- 安全、合规、评测
第 27 章 案例:分布式训练与分布式推理
- 千卡训练集群
- 多区域推理部署
- 边缘-云协同推理
- 成本、性能、可靠性复盘
第 28 章 未来趋势
- 更大模型 vs 更小模型
- MoE、多模态、Agent、世界模型
- 端侧 AI、联邦学习、隐私计算
- 绿色 AI、可持续计算
- 自动化 MLOps/LLMOps
附录
- 附录 A:数学基础:线性代数、概率、优化、信息论
- 附录 B:常用工具链:PyTorch、TensorFlow、JAX、Ray、K8s、vLLM、Triton
- 附录 C:术语表
- 附录 D:模型上线检查清单
- 附录 E:训练检查清单
- 附录 F:监控告警检查清单
- 附录 G:安全合规检查清单
- 附录 H:常用数据集与基准
- 附录 I:推荐论文与开源项目
- 附录 J:习题与实验
每章统一结构
- 学习目标
- 核心概念
- LLM 关联与对比
- 原理与架构图
- 工程实现与代码示例
- 工具与框架
- 生产案例
- 常见陷阱
- 性能/成本/安全权衡
- 习题
- 参考文献
分册方案
如果分三册,可以这样分:
- 上册:模型基础、LLM 概念、类型、规模、数据、训练与评估(前言 + 第 1-9 章 + 附录部分)
- 中册:分布式训练、压缩、推理优化、Serving、部署(第 10-20 章 + 附录部分)
- 下册:监控、治理、安全、案例与趋势(第 21-28 章 + 附录部分)
写作进度
- 第 1 章 展开三级目录与每节写作要点
- 第 1 篇:第 1-5 章(已写完)
- 第 2 篇:第 6-9 章(数据、训练与评估,已写完)
- 第 3 篇:第 10-12 章(分布式训练与基础设施,已写完)
- 第 4 篇:第 13-14 章(模型压缩与推理优化,已写完)
- 第 5 篇:第 15-17 章(模型服务 Serving,已写完)
- 第 6 篇:第 18-20 章(部署与发布,已写完)
- 第 7 篇:第 21-23 章(监控、运维与治理,已写完)
- 第 8 篇:第 24-28 章(实践案例与趋势,已写完)
- 附录 A-J(已写完)
- 前言与导读(已写完)
- 全书统一性校对(公式/图表/交叉引用已检查)
📑 章节目录
第 1 章 模型与 LLM 总览
《大语言模型全生命周期工程》第 1 章:从模型、参数、假设空间到传统 ML、深度学习、基础模型与 LLM 的定义、能力、涌现与边界,建立全书工程视角。
第 2 章 模型类型全景:从传统模型到 LLM
《大语言模型全生命周期工程》第 2 章:按学习范式、任务、结构、模态、规模、部署形态六个维度扫描模型家族全景,并给出业务选型的决策框架。
第 3 章 LLM 核心概念
《大语言模型全生命周期工程》第 3 章:Tokenization、Embedding、位置编码、自注意力、MHA/MQA/GQA、因果掩码、KV Cache、预训练目标、上下文学习、幻觉与对齐等 LLM 核心概念。
第 4 章 模型大小与规模
《大语言模型全生命周期工程》第 4 章:参数量、稠密 vs MoE、FLOPs、显存与 KV Cache 计算、Scaling Law 与 Chinchilla 规律、规模收益与小模型价值。
第 5 章 模型生命周期与工程视角
《大语言模型全生命周期工程》第 5 章:研究 vs 生产生命周期、模型卡与数据卡、实验追踪、从 Notebook 到生产系统的鸿沟、MLOps/LLMOps/ModelOps 的区别与 LLM 工程的特殊性。
第 6 章 数据工程
《大语言模型全生命周期工程》第 6 章:数据采集、清洗、去重、标注,LLM 数据专题(预训练语料、指令数据、偏好数据、RAG 语料),合成数据、数据混合与数据治理。
第 7 章 训练基础
《大语言模型全生命周期工程》第 7 章:损失函数与优化器、训练稳定性,预训练/SFT/RLHF/DPO/RLAIF 完整训练谱系,蒸馏、自训练、持续学习与联邦学习。
第 8 章 高效训练与微调
《大语言模型全生命周期工程》第 8 章:混合精度 FP16/BF16/FP8、梯度检查点、ZeRO/FSDP 显存分片、LoRA/QLoRA 参数高效微调、长上下文训练与训练加速。
第 9 章 评估与基准
《大语言模型全生命周期工程》第 9 章:离线指标与 LLM 能力基准(MMLU/GSM8K/HumanEval/MT-Bench/Arena)、RAG 与 Agent 评估、人评与在线指标、幻觉与安全评估、污染与红队测试。
第 10 章 分布式训练原理
《大语言模型全生命周期工程》第 10 章:数据/张量/流水/专家并行原理、集合通信、同步异步训练、全局批大小与学习率缩放、并行组合与通信瓶颈。
第 11 章 分布式训练框架与系统
《大语言模型全生命周期工程》第 11 章:PyTorch DDP/FSDP、DeepSpeed、Megatron-LM 等框架格局,NCCL 与网络拓扑,Checkpoint/断点续训/弹性训练,千卡万卡训练的 MFU、成本与扩展效率。
第 12 章 训练基础设施
《大语言模型全生命周期工程》第 12 章:计算/存储/网络/调度四要素,Kubernetes/Slurm/Volcano/KubeRay 调度体系,多租户配额与抢占,实验管理、日志、指标、追踪与训练监控。
第 13 章 模型压缩
《大语言模型全生命周期工程》第 13 章:量化(PTQ/QAT/INT8/INT4/FP8/AWQ/GPTQ/GGUF)、剪枝、蒸馏、低秩分解与 LLM 压缩对精度、延迟、吞吐、成本的影响。
第 14 章 推理优化
《大语言模型全生命周期工程》第 14 章:推理 vs 训练、KV Cache 与 PagedAttention、连续批处理、投机解码、算子融合与推理引擎(vLLM/TGI/TensorRT-LLM),延迟-吞吐-成本三角。
第 15 章 模型服务基础
《大语言模型全生命周期工程》第 15 章:Serving/Inference/Scoring 的定义、同步/异步/流式/批处理、REST/gRPC/WebSocket/消息队列、在线/离线/近线推理与多模型服务。
第 16 章 服务架构
《大语言模型全生命周期工程》第 16 章:模型服务器(Triton/TorchServe/KServe/Ray Serve/Seldon)、API 网关、负载均衡、限流鉴权、自动扩缩容、灰度蓝绿金丝雀与 A/B 测试。
第 17 章 LLM 服务专题
《大语言模型全生命周期工程》第 17 章:LLM Serving 架构、连续批处理与分页注意力、多租户隔离与配额、Token 成本与 GPU 利用率、RAG/Agent/工具调用服务、流式输出与结构化输出。
第 18 章 部署基础
《大语言模型全生命周期工程》第 18 章:部署目标(云/边/端/混合/私有化)、容器与 Kubernetes/Helm/Operator、GPU 调度/MIG/异构、Serverless 与边缘部署、模型格式(ONNX/GGUF/TensorRT)。
第 19 章 模型版本与发布工程
《大语言模型全生命周期工程》第 19 章:模型注册表与制品管理、CI/CD/CT 持续集成交付训练、环境隔离、配置密钥管理、回滚审计合规。
第 20 章 分布式部署
《大语言模型全生命周期工程》第 20 章:多副本与多区域部署、混合云与边缘协同、分布式推理(张量/流水/专家并行)、服务网格与流量治理、联邦推理与分层推理、CAP 与成本权衡。
第 21 章 监控体系
《大语言模型全生命周期工程》第 21 章:指标/日志/追踪/事件/告警,系统指标、服务指标、模型指标、业务指标四层监控体系与 LLM 监控要点。
第 22 章 模型可观测性
《大语言模型全生命周期工程》第 22 章:数据漂移与概念漂移、异常检测与离群点、解释性与归因、LLM 特有的 Prompt/Token/工具调用/RAG 命中可观测性、在线评估与反馈闭环。
第 23 章 可靠性、安全与治理
《大语言模型全生命周期工程》第 23 章:SLO/SLA/SLI 与错误预算、容量规划压测与混沌工程、降级熔断限流、对抗攻击越狱与提示注入、差分隐私联邦学习机密计算、GDPR/AI Act 与模型卡数据卡审计。
第 24 章 案例:传统模型生产化
《大语言模型全生命周期工程》第 24 章:风控、推荐、广告、搜索、预测的传统模型生产化案例,特征平台、模型服务、监控闭环与 LLM 时代的升级路径。
第 25 章 案例:视觉/语音/多模态
《大语言模型全生命周期工程》第 25 章:图像分类检测分割 OCR、语音识别合成、多模态检索图文生成视频理解,以及多模态大模型(VLM)的工程化与专业小模型的共存。
第 26 章 案例:LLM 与 Agent
《大语言模型全生命周期工程》第 26 章:从预训练到对齐的完整案例、RAG 服务与 Agent 平台、多租户 LLM 服务与成本优化、安全合规评测的端到端实践。
第 27 章 案例:分布式训练与分布式推理
《大语言模型全生命周期工程》第 27 章:千卡训练集群复盘、多区域推理部署、边缘-云协同推理,以及成本、性能、可靠性的复盘方法论。
第 28 章 未来趋势
《大语言模型全生命周期工程》第 28 章:更大 vs 更小模型、MoE/多模态/Agent/世界模型、端侧 AI 与隐私计算、绿色 AI、自动化 MLOps/LLMOps。