图书目录

目录

第1章强化学习基础知识1

1.1绪论1

1.1.1强化学习的基本概念1

1.1.2强化学习的4个要素3

1.1.3强化学习的特点4

1.1.4小结5

1.2强化学习的问题模型5

1.2.1智能体和环境的动态交互过程5

1.2.2马尔可夫决策过程5

1.2.3MDP中的优化问题7

1.2.4小结8

1.3值函数8

1.3.1概率和期望的数学基础8

1.3.2值函数的引例: 送餐机器人11

1.3.3简单值函数12

1.3.4标准值函数14

1.3.5状态值函数计算14

1.3.6动作值函数计算15

1.3.7小结15

1.4最优值函数16

1.4.1策略分类16

1.4.2最优策略和最优值函数16

1.4.3小结17

1.5本章小结17

1.6本章常用符号列表18

第2章强化学习表格型求解法20

2.1动态规划算法20〖3〗强化学习原理与实践(微课版)目录〖3〗2.1.1递归及动态规划20

2.1.2贝尔曼算子21

2.1.3策略评估22

2.1.4策略改进23

2.1.5策略迭代评估改进24

2.1.6值函数迭代27

2.1.7小结29

2.2蒙特卡罗算法30

2.2.1蒙特卡罗算法介绍 30

2.2.2探索策略32

2.2.3策略异轨的蒙特卡罗算法35

2.2.4小结38

2.3时序差分算法38

2.3.1时序差分算法简介38

2.3.2Sarsa: 策略同轨的时序差分算法40

2.3.3Q学习41

2.3.4值函数的偏差44

2.3.5双Q学习45

2.3.6值函数预测的误差46

2.3.7小结47

2.4本章常用符号列表48

第3章深度强化学习基础50

3.1神经网络基础51

3.1.1人脑神经网络和人工神经网络51

3.1.2人工神经元52

3.1.3前馈神经网络55

3.1.4小结57

3.2神经网络的参数学习57

3.2.1损失函数57

3.2.2梯度反向传播59

3.2.3梯度下降法64

3.2.4小结66

3.3采用深度神经网络近似值函数的强化学习算法66

3.3.1用神经网络近似值函数66

3.3.2DQN算法69

3.3.3DoubleDQN75

3.3.4DuelingDQN77

3.3.5小结78

3.4策略梯度定理78

3.4.1随机策略梯度79

3.4.2采用策略梯度的强化学习方法: REINFORCE算法 83

3.4.3基于值函数梯度的方法与基于策略梯度的方法对比84

3.4.4小结85

3.5确定性策略梯度算法85

3.5.1确定性策略梯度85

3.5.2DDPG87

3.5.3小结89

3.6执行者评判者算法89

3.6.1执行者评判者算法的思路 89

3.6.2A2C以及A3C90

3.6.3小结94

3.7策略优化算法94

3.7.1TRPO94

3.7.2PPO97

3.7.3小结98

3.8本章常用符号列表99

第4章神经网络与深度强化学习100

4.1卷积神经网络100

4.1.1神经元与感受野100

4.1.2卷积神经网络基础102

4.1.3CNN的连接结构107

4.1.4卷积神经网络的参数学习110

4.1.5其他卷积种类113

4.1.6经典卷积网络113

4.1.7残差网络115

4.1.8深度强化学习与卷积神经网络116

4.1.9小结118

4.2循环神经网络118

4.2.1循环神经网络基础119

4.2.2长短期记忆网络124

4.2.3深度强化学习与循环神经网络131

4.2.4小结135

4.3Transformer模型135

4.3.1Transformer神经网络基础135

4.3.2注意力137

4.3.3注意力层139

4.3.4自注意力层141

4.3.5Transformer的组成142

4.3.6Transformer具体运行过程145

4.3.7Transformer的应用155

4.3.8深度强化学习与Transformer156

4.3.9小结167

4.4图神经网络167

4.4.1图卷积网络基础167

4.4.2深度强化学习与图神经网络169

4.4.3小结170

4.5本章常用符号列表171

第5章贝叶斯强化学习173

5.1贝叶斯强化学习简介173

5.2基础知识一: 贝叶斯推断、共轭先验分布与汤普森采样173

5.2.1贝叶斯推断的流程174

5.2.2Binomial分布和其参数的共轭先验分布Beta174

5.2.3Poisson分布和其参数的共轭先验分布Gamma176

5.2.4Multinomial分布和其参数的共轭先验分布Dirichlet178

5.2.5汤普森采样180

5.2.6小结180

5.3基础知识二: 高斯过程与高斯过程回归180

5.3.1无参数的高斯过程回归181

5.3.2有参数的高斯过程回归182

5.3.3小结182

5.4有模型的贝叶斯强化学习182

5.4.1简介182

5.4.2环境模型182

5.4.3贝叶斯自适应马尔可夫决策过程183

5.4.4贝叶斯最优性183

5.4.5离线值逼近183

5.4.6在线值逼近185

5.4.7在线树搜索值逼近186

5.4.8用探索奖励以保证“可能近似正确”的方法187

5.4.9扩展到未知奖励189

5.4.10小结189

5.5无模型的贝叶斯强化学习190

5.5.1简介190

5.5.2值函数算法与高斯过程时序差分190

5.5.3贝叶斯策略梯度方法192

5.5.4小结194

5.6本章常用符号列表195

第6章其他类型的强化学习算法197

6.1基于模型的强化学习197

6.1.1环境模型学习198

6.1.2基于模型学习策略201

6.1.3DynaQ算法204

6.1.4基于模型的强化学习优势205

6.1.5小结206

6.2分层强化学习206

6.2.1马尔可夫过程和半马尔可夫过程206

6.2.2基于选项的分层强化学习207

6.2.3基于选项的算法实例: OptionCritic算法208

6.2.4分层抽象机210

6.2.5MAXQ值函数分解212

6.2.6小结214

6.3人类建议强化学习214

6.3.1建议的提供与分类215

6.3.2解释建议215

6.3.3建议塑造216

6.3.4算法实例: SVFB算法217

6.3.5小结218

6.4课程强化学习219

6.4.1迁移学习及其评价指标219

6.4.2课程及其评价指标219

6.4.3课程学习221

6.4.4算法实例: 教师学生课程学习222

6.4.5小结222

6.5安全强化学习223

6.5.1优化准则223

6.5.2探索过程225

6.5.3小结226

6.6最大熵强化学习226

6.6.1概率图模型227

6.6.2基于概率推理的策略搜索228

6.6.3推理过程的优化目标229

6.6.4随机转移概率的优化方式230

6.6.5结构化变分推断230

6.6.6小结231

6.7本章常用符号列表231

第7章多智能体强化学习基础233

7.1多智能体系统233

7.2博弈论基础234

7.2.1多智能体交互与博弈234

7.2.2标准形式博弈236

7.2.3纳什均衡237

7.2.4重复博弈239

7.2.5马尔可夫博弈241

7.2.6部分观察随机博弈244

7.2.7扩展形式博弈245

7.2.8平均场博弈247

7.3小结248

7.4本章常用符号列表249

第8章多智能体深度强化学习250

8.1独立训练运行的MADRL250

8.2集中式训练、分布式执行的MADRL251

8.2.1基于值的集中式训练、分布式执行的MADRL251

8.2.2基于策略的多智能体强化学习算法261

8.3智能体间通信的MADRL262

8.4互相推测的MADRL264

8.5多智能体强化学习展望265

8.6小结265

8.7本章常用符号列表266