返回AI书列表
📚 TheAIEra Book 28 章

大语言模型全生命周期工程:从 Transformer 到 LLMOps

以大语言模型为主轴、生命周期全景不丢的 LLM 工程指南:类型、规模、数据、训练、评估、分布式训练、压缩、推理、服务、部署、监控与治理,共 8 篇 28 章 + 10 附录。

LLMLLMOps模型生命周期分布式训练模型服务部署监控书籍

📖 本书大纲

大语言模型全生命周期工程:类型、规模、训练、服务、部署、监控与分布式系统

副标题:从 Transformer 到 LLMOps


关于本书

本书以「LLM 为主轴、生命周期全景不丢」为原则组织。传统机器学习、深度学习、视觉、语音、推荐等内容作为背景与对照保留,每一篇都贯穿着 LLM 主线:LLM 概念、预训练、微调、对齐、推理、服务、部署、监控、安全。

全书保持生命周期完整:模型类型 → 规模 → 数据 → 训练 → 评估 → 分布式训练 → 压缩 → 推理 → Serving → 部署 → 监控 → 治理 → 案例 → 趋势

全书共 8 篇 28 章 + 10 个附录。每章遵循统一的写作结构(见下文「每章统一结构」)。

LLM 概念全生命周期地图

生命周期阶段 重点 LLM 概念
基础 Transformer、Token、Embedding、Attention、位置编码、Decoder-only、MoE
数据 预训练语料、指令数据、偏好数据、RAG 语料、合成数据、数据混合
训练 CLM、SFT、RLHF、DPO、RLAIF、LoRA、QLoRA、长上下文训练
评估 MMLU、GSM8K、HumanEval、MT-Bench、Arena、幻觉、越狱、红队
分布式训练 数据并行、张量并行、流水并行、专家并行、ZeRO、FSDP、Megatron
压缩 量化、AWQ、GPTQ、GGUF、剪枝、蒸馏、稀疏化
推理 KV Cache、PagedAttention、连续批处理、投机解码、前缀缓存
服务 vLLM、TGI、TensorRT-LLM、流式输出、函数调用、RAG、Agent
部署 多副本、多区域、边缘-云协同、分布式推理、GPU 调度
监控 Prompt、Token、RAG 命中、工具调用、漂移、安全、成本
治理 提示注入、越狱、隐私、合规、模型卡、审计

目录

前言与导读

  • 为什么模型工程不是「训练完就结束」
  • LLM 生命周期全景:数据 → 预训练 → 微调 → 对齐 → 评估 → 压缩 → 推理 → 服务 → 部署 → 监控 → 迭代
  • 传统 ML、深度学习、基础模型、LLM 的差异
  • 本书结构、读者路径、代码与工具约定
  • 小模型、大模型、边缘模型、基础模型的差异

第 1 篇 模型基础与 LLM 概念

第 2 篇 数据、训练与评估

第 3 篇 分布式训练与基础设施

第 4 篇 模型压缩与推理优化

第 5 篇 模型服务 Serving

第 6 篇 部署与发布

第 7 篇 监控、运维与治理

第 8 篇 实践案例与趋势

附录

  • 附录 A 数学基础:线性代数、概率、优化、信息论
  • 附录 B 常用工具链:PyTorch、TensorFlow、JAX、Ray、K8s、vLLM、Triton
  • 附录 C 术语表
  • 附录 D 模型上线检查清单
  • 附录 E 训练检查清单
  • 附录 F 监控告警检查清单
  • 附录 G 安全合规检查清单
  • 附录 H 常用数据集与基准
  • 附录 I 推荐论文与开源项目
  • 附录 J 习题与实验

前言与导读

  • 为什么模型工程不是「训练完就结束」
  • LLM 生命周期全景:数据 → 预训练 → 微调 → 对齐 → 评估 → 压缩 → 推理 → 服务 → 部署 → 监控 → 迭代
  • 传统 ML、深度学习、基础模型、LLM 的差异
  • 本书结构、读者路径、代码与工具约定
  • 小模型、大模型、边缘模型、基础模型的差异

第 1 篇 模型基础与 LLM 概念

第 1 章 模型与 LLM 总览

  • 模型、参数、超参数、结构、目标函数
  • 假设空间、归纳偏置、泛化与过拟合
  • 判别模型 vs 生成模型
  • 传统 ML、深度学习、基础模型、LLM
  • LLM 的定义、能力、涌现与边界
  • LLM 生命周期与工程视角

第 2 章 模型类型全景:从传统模型到 LLM

  • 按学习范式:监督、无监督、自监督、半监督、强化学习
  • 按任务:分类、回归、排序、检测、分割、生成、检索、对话
  • 按结构:线性模型、树模型、集成模型、核方法、贝叶斯模型
  • 神经网络:MLP、CNN、RNN/LSTM、Transformer、GNN、Diffusion、GAN、VAE
  • LLM 架构:Encoder-only、Decoder-only、Encoder-Decoder
  • 按模态:文本、图像、语音、视频、表格、时序、图、多模态
  • 按规模:小模型、中模型、大模型、基础模型、边缘模型
  • 按部署形态:在线、离线、流式、端侧

第 3 章 LLM 核心概念

  • Tokenization:BPE、WordPiece、SentencePiece、词表设计
  • Embedding、位置编码、RoPE、ALiBi
  • Self-Attention、Multi-Head Attention、MHA/MQA/GQA
  • FFN、残差连接、LayerNorm/RMSNorm
  • 因果掩码、上下文窗口、KV Cache
  • 预训练目标:CLM、MLM、Span Corruption
  • 涌现能力、In-Context Learning、思维链、指令跟随
  • 幻觉、对齐、安全、可控生成
  • 提示、对话模板、系统提示、结构化输出

第 4 章 模型大小与规模

  • 参数量、层数、宽度、深度、词表大小、上下文窗口
  • 稠密模型 vs 稀疏模型 vs MoE
  • 激活参数量 vs 总参数量
  • FLOPs、内存占用、显存占用、KV Cache、优化器状态
  • 存储、带宽、通信量与成本
  • Scaling Law、Chinchilla 规律、规模收益与边际成本
  • 小模型价值:蒸馏、量化、端侧、低延迟

第 5 章 模型生命周期与工程视角

  • 研究生命周期 vs 生产生命周期
  • 模型卡、数据卡、实验追踪、版本管理
  • 从 Notebook 到生产系统的鸿沟
  • MLOps、LLMOps、ModelOps 的区别
  • LLM 工程的特殊性:Prompt、上下文、RAG、Agent、Token 成本

第 2 篇 数据、训练与评估

第 6 章 数据工程

  • 数据采集、清洗、去重、过滤、标注
  • 数据质量、偏差、隐私、版权
  • 训练集、验证集、测试集、线上反馈数据
  • 数据版本、血缘、治理
  • LLM 数据专题:预训练语料、指令数据、偏好数据、对话数据、RAG 语料
  • 合成数据、数据增强、数据混合、课程学习

第 7 章 训练基础

  • 损失函数、优化器、学习率、正则化
  • 初始化、归一化、残差连接
  • 批大小、梯度累积、训练稳定性
  • 预训练、继续预训练、微调、指令微调
  • LLM 对齐:RLHF、DPO、RLAIF、Constitutional AI
  • 蒸馏、自训练、持续学习、增量学习、联邦学习

第 8 章 高效训练与微调

  • 混合精度:FP16、BF16、FP8
  • 梯度检查点、重计算、ZeRO、FSDP
  • LoRA、QLoRA、Adapter、Prefix/Prompt Tuning
  • 参数高效微调 vs 全量微调
  • 长上下文训练、位置插值、序列并行
  • 训练加速:算子优化、编译、通信重叠

第 9 章 评估与基准

  • 离线评估:准确率、F1、AUC、BLEU、ROUGE、Perplexity
  • LLM 能力基准:MMLU、GSM8K、HumanEval、MATH、BBH
  • 对话与偏好评估:MT-Bench、Chatbot Arena、AlpacaEval
  • RAG 评估、Agent 评估、工具调用评估
  • 人评、A/B 测试、在线指标
  • 幻觉、毒性、偏见、鲁棒性、越狱、安全评估
  • 评估集污染、可信评估、红队测试

第 3 篇 分布式训练与基础设施

第 10 章 分布式训练原理

  • 数据并行、模型并行、流水并行、张量并行、专家并行
  • AllReduce、AllGather、ReduceScatter、集合通信
  • 同步训练 vs 异步训练
  • 全局批大小、梯度累积、学习率缩放
  • LLM 训练中的并行组合与通信瓶颈

第 11 章 分布式训练框架与系统

  • PyTorch DDP、FSDP、DeepSpeed、Megatron-LM
  • Horovod、Ray Train、Colossal-AI
  • 通信拓扑:NVLink、InfiniBand、RoCE
  • GPU/TPU/NPU 集群、调度与容错
  • Checkpoint、断点续训、弹性训练
  • 千卡/万卡训练、MFU、成本、吞吐、扩展效率

第 12 章 训练基础设施

  • 计算、存储、网络、调度
  • Kubernetes、Slurm、Volcano、KubeRay
  • 多租户、配额、优先级、抢占
  • 实验管理、日志、指标、追踪
  • 训练监控与故障排查

第 4 篇 模型压缩与推理优化

第 13 章 模型压缩

  • 量化:PTQ、QAT、INT8、INT4、FP8、AWQ、GPTQ、GGUF
  • 剪枝:结构化、非结构化、稀疏化
  • 蒸馏:知识蒸馏、教师学生模型、黑盒/白盒蒸馏
  • 低秩分解、权重共享、神经架构搜索
  • LLM 压缩专题:量化对精度、延迟、吞吐、成本的影响

第 14 章 推理优化

  • 推理 vs 训练:计算图、内存、批处理差异
  • KV Cache、PagedAttention、连续批处理
  • 动态批处理、投机解码、并行采样
  • 算子融合、图优化、编译
  • 推理引擎:ONNX Runtime、TensorRT、OpenVINO、vLLM、TGI、TensorRT-LLM
  • 长上下文推理、前缀缓存、分块预填充
  • 延迟、吞吐、成本三角

第 5 篇 模型服务 Serving

第 15 章 模型服务基础

  • 什么是 Serving、Inference、Scoring
  • 同步、异步、流式、批处理
  • REST、gRPC、WebSocket、消息队列
  • 在线推理、离线推理、近线推理
  • 多模型服务、多版本服务、模型路由

第 16 章 服务架构

  • 模型服务器:Triton、TorchServe、KServe、Ray Serve、Seldon
  • API 网关、负载均衡、限流、鉴权
  • 自动扩缩容:HPA、KEDA、自定义指标
  • 缓存、队列、背压、超时、重试
  • 灰度发布、蓝绿发布、金丝雀发布
  • A/B 测试、影子流量、多臂老虎机

第 17 章 LLM 服务专题

  • LLM Serving 架构:Prefill、Decode、KV Cache 管理
  • 连续批处理、分页注意力、前缀缓存
  • 多租户隔离、配额、优先级
  • Token 成本、GPU 利用率、SLA
  • RAG 服务、Agent 服务、工具调用
  • 流式输出、函数调用、结构化输出

第 6 篇 部署与发布

第 18 章 部署基础

  • 部署目标:云、边、端、混合、私有化
  • 容器、镜像、Kubernetes、Helm、Operator
  • GPU 调度、MIG、共享 GPU、异构硬件
  • Serverless、边缘 K3s、移动端、浏览器端
  • 模型格式:ONNX、TorchScript、SavedModel、GGUF、TensorRT Engine

第 19 章 模型版本与发布工程

  • 模型注册表、模型仓库、制品管理
  • CI/CD/CT:持续集成、持续交付、持续训练
  • 环境隔离:开发、测试、预发、生产
  • 配置管理、密钥管理、权限控制
  • 回滚、审计、合规

第 20 章 分布式部署

  • 多副本部署、无状态服务、有状态服务
  • 多区域、多集群、混合云、边缘协同
  • 分布式推理:张量并行、流水并行、专家并行
  • 服务网格、流量治理、故障隔离
  • 联邦推理、边缘-云协同、分层推理
  • 一致性、可用性、分区容忍与成本权衡

第 7 篇 监控、运维与治理

第 21 章 监控体系

  • 指标、日志、追踪、事件、告警
  • 系统指标:CPU、GPU、显存、网络、磁盘
  • 服务指标:QPS、延迟、错误率、饱和度
  • 模型指标:准确率、召回、漂移、幻觉、安全
  • 业务指标:转化、收入、用户满意度、成本

第 22 章 模型可观测性

  • 输入输出监控、数据漂移、概念漂移
  • 异常检测、离群点、分布偏移
  • 解释性、归因、审计日志
  • LLM 可观测性:Prompt、Token、工具调用、RAG 命中
  • 在线评估与反馈闭环

第 23 章 可靠性、安全与治理

  • SLO、SLA、SLI、错误预算
  • 容量规划、压测、混沌工程、故障演练
  • 降级、熔断、限流、排队、缓存
  • 安全:对抗攻击、越狱、提示注入、数据泄露
  • 隐私:差分隐私、联邦学习、机密计算
  • 合规:GDPR、AI Act、模型卡、数据卡、审计

第 8 篇 实践案例与趋势

第 24 章 案例:传统模型生产化

  • 风控、推荐、广告、搜索、预测
  • 特征平台、模型服务、监控闭环

第 25 章 案例:视觉/语音/多模态

  • 图像分类、检测、分割、OCR
  • 语音识别、合成、实时通信
  • 多模态检索、图文生成、视频理解

第 26 章 案例:LLM 与 Agent

  • 从预训练到对齐
  • RAG 服务、Agent 平台、工具调用
  • 多租户 LLM 服务、成本优化
  • 安全、合规、评测

第 27 章 案例:分布式训练与分布式推理

  • 千卡训练集群
  • 多区域推理部署
  • 边缘-云协同推理
  • 成本、性能、可靠性复盘

第 28 章 未来趋势

  • 更大模型 vs 更小模型
  • MoE、多模态、Agent、世界模型
  • 端侧 AI、联邦学习、隐私计算
  • 绿色 AI、可持续计算
  • 自动化 MLOps/LLMOps

附录

  • 附录 A:数学基础:线性代数、概率、优化、信息论
  • 附录 B:常用工具链:PyTorch、TensorFlow、JAX、Ray、K8s、vLLM、Triton
  • 附录 C:术语表
  • 附录 D:模型上线检查清单
  • 附录 E:训练检查清单
  • 附录 F:监控告警检查清单
  • 附录 G:安全合规检查清单
  • 附录 H:常用数据集与基准
  • 附录 I:推荐论文与开源项目
  • 附录 J:习题与实验

每章统一结构

  1. 学习目标
  2. 核心概念
  3. LLM 关联与对比
  4. 原理与架构图
  5. 工程实现与代码示例
  6. 工具与框架
  7. 生产案例
  8. 常见陷阱
  9. 性能/成本/安全权衡
  10. 习题
  11. 参考文献

分册方案

如果分三册,可以这样分:

  • 上册:模型基础、LLM 概念、类型、规模、数据、训练与评估(前言 + 第 1-9 章 + 附录部分)
  • 中册:分布式训练、压缩、推理优化、Serving、部署(第 10-20 章 + 附录部分)
  • 下册:监控、治理、安全、案例与趋势(第 21-28 章 + 附录部分)

写作进度

  • 第 1 章 展开三级目录与每节写作要点
  • 第 1 篇:第 1-5 章(已写完)
  • 第 2 篇:第 6-9 章(数据、训练与评估,已写完)
  • 第 3 篇:第 10-12 章(分布式训练与基础设施,已写完)
  • 第 4 篇:第 13-14 章(模型压缩与推理优化,已写完)
  • 第 5 篇:第 15-17 章(模型服务 Serving,已写完)
  • 第 6 篇:第 18-20 章(部署与发布,已写完)
  • 第 7 篇:第 21-23 章(监控、运维与治理,已写完)
  • 第 8 篇:第 24-28 章(实践案例与趋势,已写完)
  • 附录 A-J(已写完)
  • 前言与导读(已写完)
  • 全书统一性校对(公式/图表/交叉引用已检查)

📑 章节目录

1

第 1 章 模型与 LLM 总览

《大语言模型全生命周期工程》第 1 章:从模型、参数、假设空间到传统 ML、深度学习、基础模型与 LLM 的定义、能力、涌现与边界,建立全书工程视角。

2

第 2 章 模型类型全景:从传统模型到 LLM

《大语言模型全生命周期工程》第 2 章:按学习范式、任务、结构、模态、规模、部署形态六个维度扫描模型家族全景,并给出业务选型的决策框架。

3

第 3 章 LLM 核心概念

《大语言模型全生命周期工程》第 3 章:Tokenization、Embedding、位置编码、自注意力、MHA/MQA/GQA、因果掩码、KV Cache、预训练目标、上下文学习、幻觉与对齐等 LLM 核心概念。

4

第 4 章 模型大小与规模

《大语言模型全生命周期工程》第 4 章:参数量、稠密 vs MoE、FLOPs、显存与 KV Cache 计算、Scaling Law 与 Chinchilla 规律、规模收益与小模型价值。

5

第 5 章 模型生命周期与工程视角

《大语言模型全生命周期工程》第 5 章:研究 vs 生产生命周期、模型卡与数据卡、实验追踪、从 Notebook 到生产系统的鸿沟、MLOps/LLMOps/ModelOps 的区别与 LLM 工程的特殊性。

6

第 6 章 数据工程

《大语言模型全生命周期工程》第 6 章:数据采集、清洗、去重、标注,LLM 数据专题(预训练语料、指令数据、偏好数据、RAG 语料),合成数据、数据混合与数据治理。

7

第 7 章 训练基础

《大语言模型全生命周期工程》第 7 章:损失函数与优化器、训练稳定性,预训练/SFT/RLHF/DPO/RLAIF 完整训练谱系,蒸馏、自训练、持续学习与联邦学习。

8

第 8 章 高效训练与微调

《大语言模型全生命周期工程》第 8 章:混合精度 FP16/BF16/FP8、梯度检查点、ZeRO/FSDP 显存分片、LoRA/QLoRA 参数高效微调、长上下文训练与训练加速。

9

第 9 章 评估与基准

《大语言模型全生命周期工程》第 9 章:离线指标与 LLM 能力基准(MMLU/GSM8K/HumanEval/MT-Bench/Arena)、RAG 与 Agent 评估、人评与在线指标、幻觉与安全评估、污染与红队测试。

10

第 10 章 分布式训练原理

《大语言模型全生命周期工程》第 10 章:数据/张量/流水/专家并行原理、集合通信、同步异步训练、全局批大小与学习率缩放、并行组合与通信瓶颈。

11

第 11 章 分布式训练框架与系统

《大语言模型全生命周期工程》第 11 章:PyTorch DDP/FSDP、DeepSpeed、Megatron-LM 等框架格局,NCCL 与网络拓扑,Checkpoint/断点续训/弹性训练,千卡万卡训练的 MFU、成本与扩展效率。

12

第 12 章 训练基础设施

《大语言模型全生命周期工程》第 12 章:计算/存储/网络/调度四要素,Kubernetes/Slurm/Volcano/KubeRay 调度体系,多租户配额与抢占,实验管理、日志、指标、追踪与训练监控。

13

第 13 章 模型压缩

《大语言模型全生命周期工程》第 13 章:量化(PTQ/QAT/INT8/INT4/FP8/AWQ/GPTQ/GGUF)、剪枝、蒸馏、低秩分解与 LLM 压缩对精度、延迟、吞吐、成本的影响。

14

第 14 章 推理优化

《大语言模型全生命周期工程》第 14 章:推理 vs 训练、KV Cache 与 PagedAttention、连续批处理、投机解码、算子融合与推理引擎(vLLM/TGI/TensorRT-LLM),延迟-吞吐-成本三角。

15

第 15 章 模型服务基础

《大语言模型全生命周期工程》第 15 章:Serving/Inference/Scoring 的定义、同步/异步/流式/批处理、REST/gRPC/WebSocket/消息队列、在线/离线/近线推理与多模型服务。

16

第 16 章 服务架构

《大语言模型全生命周期工程》第 16 章:模型服务器(Triton/TorchServe/KServe/Ray Serve/Seldon)、API 网关、负载均衡、限流鉴权、自动扩缩容、灰度蓝绿金丝雀与 A/B 测试。

17

第 17 章 LLM 服务专题

《大语言模型全生命周期工程》第 17 章:LLM Serving 架构、连续批处理与分页注意力、多租户隔离与配额、Token 成本与 GPU 利用率、RAG/Agent/工具调用服务、流式输出与结构化输出。

18

第 18 章 部署基础

《大语言模型全生命周期工程》第 18 章:部署目标(云/边/端/混合/私有化)、容器与 Kubernetes/Helm/Operator、GPU 调度/MIG/异构、Serverless 与边缘部署、模型格式(ONNX/GGUF/TensorRT)。

19

第 19 章 模型版本与发布工程

《大语言模型全生命周期工程》第 19 章:模型注册表与制品管理、CI/CD/CT 持续集成交付训练、环境隔离、配置密钥管理、回滚审计合规。

20

第 20 章 分布式部署

《大语言模型全生命周期工程》第 20 章:多副本与多区域部署、混合云与边缘协同、分布式推理(张量/流水/专家并行)、服务网格与流量治理、联邦推理与分层推理、CAP 与成本权衡。

21

第 21 章 监控体系

《大语言模型全生命周期工程》第 21 章:指标/日志/追踪/事件/告警,系统指标、服务指标、模型指标、业务指标四层监控体系与 LLM 监控要点。

22

第 22 章 模型可观测性

《大语言模型全生命周期工程》第 22 章:数据漂移与概念漂移、异常检测与离群点、解释性与归因、LLM 特有的 Prompt/Token/工具调用/RAG 命中可观测性、在线评估与反馈闭环。

23

第 23 章 可靠性、安全与治理

《大语言模型全生命周期工程》第 23 章:SLO/SLA/SLI 与错误预算、容量规划压测与混沌工程、降级熔断限流、对抗攻击越狱与提示注入、差分隐私联邦学习机密计算、GDPR/AI Act 与模型卡数据卡审计。

24

第 24 章 案例:传统模型生产化

《大语言模型全生命周期工程》第 24 章:风控、推荐、广告、搜索、预测的传统模型生产化案例,特征平台、模型服务、监控闭环与 LLM 时代的升级路径。

25

第 25 章 案例:视觉/语音/多模态

《大语言模型全生命周期工程》第 25 章:图像分类检测分割 OCR、语音识别合成、多模态检索图文生成视频理解,以及多模态大模型(VLM)的工程化与专业小模型的共存。

26

第 26 章 案例:LLM 与 Agent

《大语言模型全生命周期工程》第 26 章:从预训练到对齐的完整案例、RAG 服务与 Agent 平台、多租户 LLM 服务与成本优化、安全合规评测的端到端实践。

27

第 27 章 案例:分布式训练与分布式推理

《大语言模型全生命周期工程》第 27 章:千卡训练集群复盘、多区域推理部署、边缘-云协同推理,以及成本、性能、可靠性的复盘方法论。

28

第 28 章 未来趋势

《大语言模型全生命周期工程》第 28 章:更大 vs 更小模型、MoE/多模态/Agent/世界模型、端侧 AI 与隐私计算、绿色 AI、自动化 MLOps/LLMOps。