图书目录

目录

本书源码

第1章绪论

1.1深度学习和大模型的定义

1.2人工智能的演进

1.3人工智能的三大范式

1.4深度学习的核心价值

1.5深度学习的应用领域

1.6读者指南

1.6.1前置知识

1.6.2编程环境准备

第2章多层感知机

2.1模型结构

2.2模型的计算

2.2.1确定模型架构

2.2.2符号表示

2.2.3参数初始化

2.2.4正向计算过程

2.2.5误差反向传播

2.2.6预测过程

2.3模型的意义

2.4模型的不足

2.5模型优化技巧

2.5.1初始化技术

2.5.2激活函数

2.5.3Dropout正则化

2.5.4小批量梯度下降法

2.6常见概念的联系和区别

2.7案例1: 多层感知机拟合各类函数

2.8案例2: 多层感知机预测泰坦尼克号乘客生还概率

2.8.1描述性统计

2.8.2多层感知机建模

2.8.3特征重要性分析

2.8.4利用模型预测

2.8.5数据处理拓展

第3章卷积神经网络

3.1模型结构

3.1.1设计思路

3.1.2卷积层

3.1.3池化层

3.1.4全连接层

3.1.5激活函数

3.2卷积与池化的计算

3.2.1卷积的概念

3.2.2卷积的例子

3.2.3卷积的计算

3.2.4带步长和填充的卷积计算

3.2.5池化的计算

3.3反卷积的计算

3.3.1基本思路

3.3.2反卷积中的步长和填充

3.3.3反卷积计算方法

3.3.4延伸讨论

3.4卷积梯度的计算

3.4.1卷积结果对输入的梯度

3.4.2卷积结果对卷积核的梯度

3.5反卷积梯度的计算

3.5.1反卷积结果对输入的梯度

3.5.2反卷积结果对卷积核的梯度

3.5.3反卷积等价于误差反向传播

3.6模型的优势

3.7模型的不足

3.8案例1: 卷积运算识别简单形状

3.9案例2: 卷积运算识别物体边缘

3.10案例3: 用CNN识别手写数字

第4章循环神经网络

4.1模型结构

4.1.1序列数据的特点

4.1.2循环连接

4.1.3时间展开视角

4.2模型正向计算

4.3随时间反向传播算法

4.4模型的优势

4.5模型的不足

4.6模型的应用场景

4.6.1自然语言处理

4.6.2语音和视频处理

4.6.3其他应用场景

4.7模型的改进

4.7.1梯度裁剪

4.7.2双向RNN

4.8案例: 用RNN写唐诗

第5章LSTM与GRU

5.1LSTM的结构

5.1.1输入门

5.1.2遗忘门

5.1.3输出门

5.1.4记忆单元

5.2LSTM的优势分析

5.3LSTM的劣势分析

5.4GRU的结构

5.4.1重置门

5.4.2候选隐藏状态

5.4.3更新门

5.4.4当前隐藏状态

5.5LSTM与GRU的比较分析

5.5.1结构差异

5.5.2参数数量

5.5.3计算效率和训练速度

5.5.4长距离建模能力

5.5.5场景适用性

5.6案例1: 演示LSTM和GRU的计算过程

5.7案例2: 用LSTM写歌词

第6章Transformer

6.1模型结构

6.2模型输入处理

6.3注意力机制

6.3.1问题的引入

6.3.2注意力机制的设计思路

6.3.3注意力的计算

6.3.4多头注意力

6.4Encoder的原理和结构

6.4.1多头注意力

6.4.2前馈神经网络

6.4.3残差神经网络

6.4.4层归一化

6.4.5Dropout

6.4.6Padding Mask

6.5Decoder的原理和结构

6.5.1整体结构

6.5.2交叉注意力模块

6.5.3输入

6.5.4Look Ahead Mask

6.5.5输出

6.6Transformer改进方法

6.7注意力机制与CNN、RNN的关系

6.8Transformer的优势

6.9Transformer的劣势

6.10案例: 使用Transformer构造中英文翻译系统

第7章BERT

7.1BERT简介

7.2自然语言处理的通用概念

7.3BERT的原理

7.4BERT的结构

7.5BERT的预训练任务

7.5.1掩码语言模型

7.5.2下一句预测

7.5.3句子顺序预测

7.5.4BERT预训练的意义

7.6BERT的微调

7.7BERT的参数量分析

7.8BERT的优势

7.9BERT的劣势

7.10BERT的改进版本

7.11BERT的扩展讨论

7.12案例: 微调BERT模型用于情感分析

第8章GPT

8.1Decoderonly的优势

8.2GPT的原理和结构

8.2.1GPT1的原理

8.2.2GPT1的结构

8.2.3原始文本预处理

8.2.4分词

8.2.5词嵌入

8.2.6位置编码

8.2.7Decoder

8.2.8输出层

8.3GPT的训练和推理

8.3.1预训练阶段

8.3.2推理阶段

8.3.3GPT模型的微调

8.4GPT1后续版本的演进

8.4.1GPT2

8.4.2GPT3

8.4.3GPT4

8.5模型的应用领域

8.6模型优势

8.7模型劣势

8.8案例: 利用GPT2打造文章续写系统

第9章YOLO

9.1目标检测任务介绍

9.1.1目标检测算法的挑战

9.1.2目标检测评价指标

9.1.3目标检测的数据集

9.1.4目标检测算法的分类

9.2传统目标检测算法

9.2.1RCNN

9.2.2Fast RCNN

9.2.3Faster RCNN

9.3YOLO v1的原理

9.4YOLO v1的结构

9.5YOLO v1的计算过程

9.5.1预训练分类网络

9.5.2训练目标检测网络

9.5.3推理阶段

9.5.4NMS

9.5.5非极大值抑制的例子

9.6YOLO的改进

9.6.1YOLO v2的改进

9.6.2YOLO v3的改进

9.6.3YOLO后续版本的改进

9.7YOLO的优势

9.8YOLO的劣势

9.9案例: 使用YOLO对图片做目标检测

9.9.1项目介绍

9.9.2使用方法

第10章VAE

10.1生成模型简介

10.2自编码器原理与结构

10.2.1自编码器结构

10.2.2损失函数

10.2.3AE重建的可行性

10.2.4AE的训练

10.3AE的变形

10.3.1降噪自编码器

10.3.2稀疏自编码器

10.3.3收缩自编码器

10.3.4卷积自编码器和循环自编码器

10.4AE的优劣势分析

10.4.1优势

10.4.2劣势

10.5VAE的原理

10.5.1VAE的结构

10.5.2损失函数

10.5.3变分推断

10.6VAE的优势

10.7VAE的不足

10.8VAE的应用

10.9VAE模型与GMM模型的关系

10.10案例: 用VAE压缩图像

第11章对抗神经网络

11.1模型简介

11.2模型结构与原理

11.2.1符号表示

11.2.2生成模型与概率分布的关系

11.2.3Discriminator

11.2.4Generator

11.3模型训练和推理过程

11.4GAN的变种

11.5模型优势

11.6模型不足

11.7模型的应用

11.7.1图像生成与编辑

11.7.2语音合成与转换

11.8案例: 使用WGANGP生成小狗图片

第12章扩散模型

12.1扩散模型背景

12.2模型结构与原理

12.2.1符号定义

12.2.2前向扩散过程

12.2.3反向去噪

12.3模型训练与推理

12.4最大似然估计

12.5模型评价

12.6与VAE模型的关系

12.7模型的改进方向

12.8模型的应用

12.9模型优势

12.10模型劣势

12.11未来应用和发展方向

12.12案例: 微调扩散模型生成宝可梦角色

12.12.1Stable Diffusion简介

12.12.2LoRA技术

12.12.3数据集准备

12.12.4模型准备

12.12.5代码解析

第13章强化学习

13.1强化学习核心要素

13.2贝尔曼方程

13.2.1状态价值函数与状态动作价值函数

13.2.2贝尔曼期望方程

13.2.3贝尔曼最优方程

13.3强化学习分类

13.4QLearning

13.4.1时序差分

13.4.2模型原理

13.5DQN

13.6SARSA

13.7REINFORCE

13.7.1策略梯度定理

13.7.2REINFORCE的原理

13.7.3训练过程

13.7.4基线的引入

13.8ActorCritic

13.8.1ActorCritic的原理

13.8.2训练过程

13.9TRPO

13.9.1TRPO的原理

13.9.2训练过程

13.10PPO

13.10.1PPO的原理

13.10.2PPO的训练

13.10.3广义优势估计

13.11GRPO

13.12案例: 用强化学习走迷宫

13.12.1迷宫的构建

13.12.2QLearning

13.12.3SARSA

13.12.4REINFORCE

13.12.5PPO

第14章当前人工智能的缺陷

14.1数据依赖严重

14.2计算资源消耗极大

14.3可解释性不足

14.4稳健性不足

14.5伦理与安全风险

14.6生成内容的质量

参考文献