目录
本书源码
第1章绪论
1.1深度学习和大模型的定义
1.2人工智能的演进
1.3人工智能的三大范式
1.4深度学习的核心价值
1.5深度学习的应用领域
1.6读者指南
1.6.1前置知识
1.6.2编程环境准备
第2章多层感知机
2.1模型结构
2.2模型的计算
2.2.1确定模型架构
2.2.2符号表示
2.2.3参数初始化
2.2.4正向计算过程
2.2.5误差反向传播
2.2.6预测过程
2.3模型的意义
2.4模型的不足
2.5模型优化技巧
2.5.1初始化技术
2.5.2激活函数
2.5.3Dropout正则化
2.5.4小批量梯度下降法
2.6常见概念的联系和区别
2.7案例1: 多层感知机拟合各类函数
2.8案例2: 多层感知机预测泰坦尼克号乘客生还概率
2.8.1描述性统计
2.8.2多层感知机建模
2.8.3特征重要性分析
2.8.4利用模型预测
2.8.5数据处理拓展
第3章卷积神经网络
3.1模型结构
3.1.1设计思路
3.1.2卷积层
3.1.3池化层
3.1.4全连接层
3.1.5激活函数
3.2卷积与池化的计算
3.2.1卷积的概念
3.2.2卷积的例子
3.2.3卷积的计算
3.2.4带步长和填充的卷积计算
3.2.5池化的计算
3.3反卷积的计算
3.3.1基本思路
3.3.2反卷积中的步长和填充
3.3.3反卷积计算方法
3.3.4延伸讨论
3.4卷积梯度的计算
3.4.1卷积结果对输入的梯度
3.4.2卷积结果对卷积核的梯度
3.5反卷积梯度的计算
3.5.1反卷积结果对输入的梯度
3.5.2反卷积结果对卷积核的梯度
3.5.3反卷积等价于误差反向传播
3.6模型的优势
3.7模型的不足
3.8案例1: 卷积运算识别简单形状
3.9案例2: 卷积运算识别物体边缘
3.10案例3: 用CNN识别手写数字
第4章循环神经网络
4.1模型结构
4.1.1序列数据的特点
4.1.2循环连接
4.1.3时间展开视角
4.2模型正向计算
4.3随时间反向传播算法
4.4模型的优势
4.5模型的不足
4.6模型的应用场景
4.6.1自然语言处理
4.6.2语音和视频处理
4.6.3其他应用场景
4.7模型的改进
4.7.1梯度裁剪
4.7.2双向RNN
4.8案例: 用RNN写唐诗
第5章LSTM与GRU
5.1LSTM的结构
5.1.1输入门
5.1.2遗忘门
5.1.3输出门
5.1.4记忆单元
5.2LSTM的优势分析
5.3LSTM的劣势分析
5.4GRU的结构
5.4.1重置门
5.4.2候选隐藏状态
5.4.3更新门
5.4.4当前隐藏状态
5.5LSTM与GRU的比较分析
5.5.1结构差异
5.5.2参数数量
5.5.3计算效率和训练速度
5.5.4长距离建模能力
5.5.5场景适用性
5.6案例1: 演示LSTM和GRU的计算过程
5.7案例2: 用LSTM写歌词
第6章Transformer
6.1模型结构
6.2模型输入处理
6.3注意力机制
6.3.1问题的引入
6.3.2注意力机制的设计思路
6.3.3注意力的计算
6.3.4多头注意力
6.4Encoder的原理和结构
6.4.1多头注意力
6.4.2前馈神经网络
6.4.3残差神经网络
6.4.4层归一化
6.4.5Dropout
6.4.6Padding Mask
6.5Decoder的原理和结构
6.5.1整体结构
6.5.2交叉注意力模块
6.5.3输入
6.5.4Look Ahead Mask
6.5.5输出
6.6Transformer改进方法
6.7注意力机制与CNN、RNN的关系
6.8Transformer的优势
6.9Transformer的劣势
6.10案例: 使用Transformer构造中英文翻译系统
第7章BERT
7.1BERT简介
7.2自然语言处理的通用概念
7.3BERT的原理
7.4BERT的结构
7.5BERT的预训练任务
7.5.1掩码语言模型
7.5.2下一句预测
7.5.3句子顺序预测
7.5.4BERT预训练的意义
7.6BERT的微调
7.7BERT的参数量分析
7.8BERT的优势
7.9BERT的劣势
7.10BERT的改进版本
7.11BERT的扩展讨论
7.12案例: 微调BERT模型用于情感分析
第8章GPT
8.1Decoderonly的优势
8.2GPT的原理和结构
8.2.1GPT1的原理
8.2.2GPT1的结构
8.2.3原始文本预处理
8.2.4分词
8.2.5词嵌入
8.2.6位置编码
8.2.7Decoder
8.2.8输出层
8.3GPT的训练和推理
8.3.1预训练阶段
8.3.2推理阶段
8.3.3GPT模型的微调
8.4GPT1后续版本的演进
8.4.1GPT2
8.4.2GPT3
8.4.3GPT4
8.5模型的应用领域
8.6模型优势
8.7模型劣势
8.8案例: 利用GPT2打造文章续写系统
第9章YOLO
9.1目标检测任务介绍
9.1.1目标检测算法的挑战
9.1.2目标检测评价指标
9.1.3目标检测的数据集
9.1.4目标检测算法的分类
9.2传统目标检测算法
9.2.1RCNN
9.2.2Fast RCNN
9.2.3Faster RCNN
9.3YOLO v1的原理
9.4YOLO v1的结构
9.5YOLO v1的计算过程
9.5.1预训练分类网络
9.5.2训练目标检测网络
9.5.3推理阶段
9.5.4NMS
9.5.5非极大值抑制的例子
9.6YOLO的改进
9.6.1YOLO v2的改进
9.6.2YOLO v3的改进
9.6.3YOLO后续版本的改进
9.7YOLO的优势
9.8YOLO的劣势
9.9案例: 使用YOLO对图片做目标检测
9.9.1项目介绍
9.9.2使用方法
第10章VAE
10.1生成模型简介
10.2自编码器原理与结构
10.2.1自编码器结构
10.2.2损失函数
10.2.3AE重建的可行性
10.2.4AE的训练
10.3AE的变形
10.3.1降噪自编码器
10.3.2稀疏自编码器
10.3.3收缩自编码器
10.3.4卷积自编码器和循环自编码器
10.4AE的优劣势分析
10.4.1优势
10.4.2劣势
10.5VAE的原理
10.5.1VAE的结构
10.5.2损失函数
10.5.3变分推断
10.6VAE的优势
10.7VAE的不足
10.8VAE的应用
10.9VAE模型与GMM模型的关系
10.10案例: 用VAE压缩图像
第11章对抗神经网络
11.1模型简介
11.2模型结构与原理
11.2.1符号表示
11.2.2生成模型与概率分布的关系
11.2.3Discriminator
11.2.4Generator
11.3模型训练和推理过程
11.4GAN的变种
11.5模型优势
11.6模型不足
11.7模型的应用
11.7.1图像生成与编辑
11.7.2语音合成与转换
11.8案例: 使用WGANGP生成小狗图片
第12章扩散模型
12.1扩散模型背景
12.2模型结构与原理
12.2.1符号定义
12.2.2前向扩散过程
12.2.3反向去噪
12.3模型训练与推理
12.4最大似然估计
12.5模型评价
12.6与VAE模型的关系
12.7模型的改进方向
12.8模型的应用
12.9模型优势
12.10模型劣势
12.11未来应用和发展方向
12.12案例: 微调扩散模型生成宝可梦角色
12.12.1Stable Diffusion简介
12.12.2LoRA技术
12.12.3数据集准备
12.12.4模型准备
12.12.5代码解析
第13章强化学习
13.1强化学习核心要素
13.2贝尔曼方程
13.2.1状态价值函数与状态动作价值函数
13.2.2贝尔曼期望方程
13.2.3贝尔曼最优方程
13.3强化学习分类
13.4QLearning
13.4.1时序差分
13.4.2模型原理
13.5DQN
13.6SARSA
13.7REINFORCE
13.7.1策略梯度定理
13.7.2REINFORCE的原理
13.7.3训练过程
13.7.4基线的引入
13.8ActorCritic
13.8.1ActorCritic的原理
13.8.2训练过程
13.9TRPO
13.9.1TRPO的原理
13.9.2训练过程
13.10PPO
13.10.1PPO的原理
13.10.2PPO的训练
13.10.3广义优势估计
13.11GRPO
13.12案例: 用强化学习走迷宫
13.12.1迷宫的构建
13.12.2QLearning
13.12.3SARSA
13.12.4REINFORCE
13.12.5PPO
第14章当前人工智能的缺陷
14.1数据依赖严重
14.2计算资源消耗极大
14.3可解释性不足
14.4稳健性不足
14.5伦理与安全风险
14.6生成内容的质量
参考文献
