动手学深度学习(Dive into Deep Learning 入门版)
《动手学深度学习》入门版:面向初学者的深度学习理论导读,保留原书完整章节结构,合并小章节、去掉代码与图片,用通俗语言讲解深度学习的核心概念与理论。
📖 本书大纲
动手学深度学习:从概念理解深度学习
本书为《动手学深度学习》的*理论入门版。原书(zh.d2l.ai)是李沐等作者撰写的开源深度学习教材,本书在保留原书完整章节结构的基础上,将原书各章内的小节合并为一章发布,去掉具体代码实现与图片展示,重点讲解理论——每个概念"是什么"、解决什么问题,不深入数学公式与算法细节。*
原创来源声明:本书内容整理自开源教材《动手学深度学习》(Dive into Deep Learning,d2l-zh),原书仓库 d2l-ai/d2l-zh,在线版本见 zh.d2l.ai。原书由 Aston Zhang、李沐、Zachary C. Lipton、Alexander J. Smola 等撰写,采用 CC BY-SA 4.0 许可。本书为理论重述版,代码与图片版权归原作者所有。
这本书是给谁看的
这是一本深度学习入门书,写给想理解深度学习"是什么"、但暂时不需要上手写代码的读者。
- 零基础可读:不要求先修机器学习或数学课程,预备知识章会用通俗语言讲清楚张量、导数和概率这些基础概念。
- 重理论、轻代码:本书不讲编程实现,也不贴大段代码,重点是让读者建立对深度学习核心概念的清晰直觉。
- 保留原书结构:章节顺序与原书一致,读完本书后如果想去原书或课程中动手实践,可以无缝衔接。
原书结构与本版对照
原书《动手学深度学习》共 15 章 + 附录。本版按以下方式组织:
| 本书章节 | 对应原书章节 | 主要内容 |
|---|---|---|
| 准备篇 | 前言 | 深度学习的意义与本书的定位 |
| 第 1 章 | 引言 | 机器学习是什么、关键组件、各类机器学习问题 |
| 第 2 章 | 预备知识 | 数据操作、线性代数、微积分、自动微分、概率 |
| 第 3 章 | 线性神经网络 | 线性回归、softmax 回归、分类问题 |
| 第 4 章 | 多层感知机 | 多层感知机、过拟合、正则化、反向传播 |
| 第 5 章 | 深度学习计算 | 模型构造、参数管理、自定义层、读写、GPU |
| 第 6 章 | 卷积神经网络 | 卷积层、填充步幅、通道、池化、LeNet |
| 第 7 章 | 现代卷积神经网络 | AlexNet、VGG、NiN、GoogLeNet、批归一化、ResNet、DenseNet |
| 第 8 章 | 循环神经网络 | 序列模型、文本预处理、语言模型、RNN 原理 |
| 第 9 章 | 现代循环神经网络 | GRU、LSTM、深度/双向 RNN、编码器-解码器、束搜索 |
| 第 10 章 | 注意力机制 | 注意力评分、多头注意力、自注意力、Transformer |
| 第 11 章 | 优化算法 | 梯度下降、SGD、动量、AdaGrad、RMSProp、Adam、学习率调度 |
| 第 12 章 | 计算性能 | 硬件基础、并行计算、多 GPU、参数服务器 |
| 第 13 章 | 计算机视觉 | 图像增广、微调、目标检测、语义分割、风格迁移 |
| 第 14 章 | NLP:预训练 | Word2Vec、GloVe、子词嵌入、BERT 预训练 |
| 第 15 章 | NLP:应用 | 情感分析、自然语言推断、BERT 微调 |
| 第 16 章 | 附录:深度学习工具 | Jupyter、云平台、GPU 选择、d2l 包 |
章节导航
准备篇 前言
深度学习为什么重要,这本书要讲什么。
第 1 章 引言
深度学习的起点:
- 机器学习是什么,与日常生活的联系
- 机器学习的四大关键组件:数据、模型、目标函数、优化算法
- 监督学习、无监督学习、强化学习等各类机器学习问题
- 深度学习的历史、发展与成功案例
第 2 章 预备知识
动手学习前需要的基础:
- 数据操作:张量与数组
- 线性代数:向量、矩阵、范数
- 微积分:导数与梯度
- 自动微分与概率论基础
第 3 章 线性神经网络
最简单的神经网络:
- 线性回归:预测连续数值
- 损失函数与梯度下降
- softmax 回归:分类问题
- 图像分类数据集与交叉熵
第 4 章 多层感知机
从单层到多层:
- 多层感知机(MLP)与激活函数
- 过拟合与欠拟合
- 权重衰减与丢弃法(Dropout)
- 反向传播与数值稳定性
- 模型偏差与环境污染问题
第 5 章 深度学习计算
搭建模型的工程基础:
- 层与块:模型的构造
- 参数管理与自定义层
- 参数初始化与读写
- GPU 计算
第 6 章 卷积神经网络
计算机视觉的核心:
- 为什么用卷积
- 卷积层、填充与步幅、多输入多输出通道
- 池化层
- LeNet:第一个卷积网络
第 7 章 现代卷积神经网络
卷积网络的进化史:
- AlexNet:深度学习复兴的标志
- VGG、NiN、GoogLeNet
- 批量规范化
- ResNet 残差网络与 DenseNet
第 8 章 循环神经网络
处理序列数据:
- 序列模型与马尔可夫假设
- 文本预处理与语言模型
- 循环神经网络(RNN)原理
- 随时间反向传播(BPTT)
第 9 章 现代循环神经网络
RNN 的改进与扩展:
- 门控循环单元(GRU)与长短期记忆(LSTM)
- 深度循环网络与双向 RNN
- 编码器-解码器架构与序列到序列学习
- 束搜索
第 10 章 注意力机制
现代深度学习的基石:
- 注意力提示与注意力池化
- 注意力评分函数
- Bahdanau 注意力与多头注意力
- 自注意力、位置编码与 Transformer
第 11 章 优化算法
让模型学得更好的算法:
- 优化的目标与凸性
- 梯度下降、随机梯度下降(SGD)与小批量 SGD
- 动量、AdaGrad、RMSProp、AdaDelta、Adam
- 学习率调度
第 12 章 计算性能
训练大规模模型的基础设施:
- 硬件基础:CPU、GPU、内存
- 编译、异步计算与自动并行
- 多 GPU 训练与参数服务器
第 13 章 计算机视觉
深度学习的看家本领:
- 图像增广与微调
- 目标检测:边界框、锚框、SSD、R-CNN 系列
- 语义分割与全卷积网络
- 风格迁移与 Kaggle 实战
第 14 章 自然语言处理:预训练
让机器理解语言:
- Word2Vec:词嵌入
- GloVe 与子词嵌入
- 词的相似性与类比
- BERT 预训练
第 15 章 自然语言处理:应用
NLP 任务的落地:
- 情感分析
- 自然语言推断
- BERT 微调
第 16 章 附录:深度学习工具
学习与实战的工具箱:
- Jupyter Notebook
- 云平台与 GPU 服务器选择
- d2l 包与如何参与贡献
阅读建议
- 第一次阅读建议按顺序从头读到尾,前几章是后续所有内容的基础。
- 每章开头有"本章讲什么",结尾有"小结",可以先浏览再精读。
- 遇到不熟悉的术语,参考每章末尾的"关键术语"表格。
- 读完某一章后,如果想看代码实现,可以回到原书 zh.d2l.ai 找到对应章节动手实践。
补充资源
- 原书在线版:zh.d2l.ai
- 原书仓库:d2l-ai/d2l-zh
- 原书论坛:discuss.d2l.ai
📑 章节目录
前言
深度学习为什么重要,本书是什么定位,写给谁看,以及如何阅读本书。
引言:机器学习与深度学习
机器学习是什么、四大关键组件(数据、模型、目标函数、优化算法)、各类机器学习问题,以及深度学习的起源、发展与特点。
预备知识:数据、代数、微积分与概率
学习深度学习前需要的基础知识:张量与数据操作、线性代数、微积分、自动微分与概率论,用通俗语言讲清这些工具解决什么问题。
线性神经网络:从回归到分类
第一个深度学习模型:线性回归预测数值、softmax 回归处理分类,理解损失函数、梯度下降、交叉熵与独热编码这些最基础的概念。
多层感知机:非线性与泛化
为什么需要多层网络与激活函数,过拟合与欠拟合的本质,权重衰减、Dropout 等正则化方法,反向传播与数值稳定性,以及分布偏移问题。
深度学习计算:模型工程的抽象
深度学习框架背后的工程抽象:层与块、参数管理、延后初始化、自定义层、模型读写与 GPU 计算。
卷积神经网络:让网络理解图像
卷积神经网络的核心概念:为什么用卷积、卷积层、填充与步幅、多输入多输出通道、池化层,以及第一个经典 CNN——LeNet。
现代卷积神经网络:CNN 的进化史
从 AlexNet 到 DenseNet 的 CNN 进化史:块抽象、1×1 卷积、Inception、批量规范化、残差连接,理解现代深度网络的每个关键设计。
循环神经网络:让网络拥有记忆
处理序列数据的基础:序列模型与马尔可夫假设、文本预处理、语言模型、循环神经网络 RNN 的原理、困惑度与 BPTT。
现代循环神经网络:门控与序列到序列
RNN 的改进与扩展:GRU 与 LSTM 的门控机制、深度与双向 RNN、编码器-解码器架构、序列到序列学习与束搜索。
注意力机制:从关注到 Transformer
注意力机制的核心概念:注意力提示、注意力汇聚、评分函数、Bahdanau 注意力、多头注意力、自注意力与位置编码,以及集大成者 Transformer。
优化算法:让模型学得更好
深度学习优化算法全景:梯度下降、随机梯度下降、小批量、动量、AdaGrad、RMSProp、AdaDelta、Adam 与学习率调度。
计算性能:训练大规模模型的基础设施
深度学习性能的物理基础:硬件、编译与异步计算、自动并行、多 GPU 训练与参数服务器。
计算机视觉:从分类到定位与分割
计算机视觉进阶:图像增广、微调与迁移学习、目标检测(边界框、锚框、SSD、R-CNN)、语义分割与全卷积网络、风格迁移。
自然语言处理:预训练
让机器理解语言:Word2Vec 词嵌入、GloVe、子词嵌入、词的相似性,以及 BERT 双向预训练的原理。
自然语言处理:应用
NLP 任务的落地:情感分析、自然语言推断,以及用 RNN、CNN 和 BERT 微调解决实际问题。
附录:深度学习工具
学习与实践深度学习的工具箱:Jupyter Notebook、云平台(SageMaker、EC2)、服务器与 GPU 选择,以及如何参与开源贡献。