强化学习原理与实践(微课版)
本书有视频和PPT等配套素材,有很强的实践性。

作者:吴贺俊

丛书名:面向新工科专业建设计算机系列教材

定价:69元

印次:1-1

ISBN:9787302714286

出版日期:2026.09.01

印刷日期:2026.09.11

图书责编:杨帆

图书分类:教材

电子书
在线购买
分享
内容简介
作者简介
前言序言
资源下载
查看详情 查看详情 查看详情

本书将阐述强化学习原理,力图揭示强化学习的基本思想和方法,并介绍应用强化学习的场景及出现的问题,探讨和提出我们的一些思路和方法。本书将从环境感知开篇,采用具体的传感、控制实例,说明强化学习中环境和智能体这两个要素。在此基础上,本书引出马尔科夫决策问题模型,以优化目标为导向,从数学和物理角度,详细阐述和推导各值函数方程的原理。为方便读者,本书附加了需要用到的概率和统计学原理。最后,本书按强化学习方法的优化途径,分类讲解各类算法的原理和实现,使读者对于理论的理解更透彻。 读者对象是人工智能、机器人、物联网、计算机等专业的本科生和研究生,及相关工程技术人员。

吴贺俊,中山大学计算机学院教授、博导,香港科技大学博士,中国大学慕课“人工智能原理与实践”主讲人,研究人工智能、智能物联网、机器人集群等,承担国家自然科学基金项目,发表多篇国际顶刊顶会论文。曾入选教育部高等学校计算机类专业教学指导委员会、中国教师发展基金会2022一2023年高校计算机专业优秀教师奖励计划,主讲的“人工智能”于2023年获得中国计算机教育大会(CECC)优秀课程配套资源特等奖。

前言 当前有很多版本的《强化学习》教材,其中Richard S. Sutton 、Andrew G. Barto等学者于1998年出版的《强化学习》尤为经典,此教材的第2版于2018年面世,这两本教材属于人工智能强化学习领域一致公认的经典巨作。2003年,我修读博士研究生的时候,业内还没有提出深度学习和深度强化学习的概念,当时选修的机器学习课程的教材之一就是Sutton和Barto教授撰写的第1版《强化学习》。Sutton等教授的教材深度剖析了强化学习方法的思想和原理,传播了强化学习的基本思想和基础理论。2019年,强化学习领域科学家俞凯先生翻译出版了Sutton和Barto教授原著《强化学习》的中文版,该中文版教材翻译质量极高,让中国学者对强化学习基本理论方法的学习变得更为便利。 那么,我为什么要写这本教材呢?其实我一直在等该领域内能有资深教授出版一本比较实用的、涵盖深度学习和深度强化学习基础的教材。经典的强化学习教材内没有提供这些内容,况且,正如俞凯先生在《强化学习》中文版教材前言中提到的,Sutton和Barto教授撰写的《强化学习》并非一本实用主义的算法普及书籍,而是强化学习思想的深度解析之作。所以,经典强化学习教材的编写大多从根本上可能就没有囊括深度强化学习等方法的初衷。直到2019年,我们教研组同事在教学中都感觉到从论文提炼出的关于深度强化学习和多智能体强化学习等内容的简单讲义让学生复习和参考都颇为不便,我便萌生了写这本书的意向。2019年11月,我们开始编写这本书,经过多年教学的积累,再加上这几年的准备和逐年的拓展,终于完成了本书。与深度学习、深度强化...

目录
荐语
查看详情 查看详情
目录

第1章强化学习基础知识1

1.1绪论1

1.1.1强化学习的基本概念1

1.1.2强化学习的4个要素3

1.1.3强化学习的特点4

1.1.4小结5

1.2强化学习的问题模型5

1.2.1智能体和环境的动态交互过程5

1.2.2马尔可夫决策过程5

1.2.3MDP中的优化问题7

1.2.4小结8

1.3值函数8

1.3.1概率和期望的数学基础8

1.3.2值函数的引例: 送餐机器人11

1.3.3简单值函数12

1.3.4标准值函数14

1.3.5状态值函数计算14

1.3.6动作值函数计算15

1.3.7小结15

1.4最优值函数16

1.4.1策略分类16

1.4.2最优策略和最优值函数16

1.4.3小结17

1.5本章小结17

1.6本章常用符号列表18

第2章强化学习表格型求解法20

2.1动态规划算法20〖3〗强化学习原理与实践(微课版)目录〖3〗2.1.1递归及动态规划20

2.1.2贝尔曼算子21

2.1.3策略评估22

2.1.4策略改进23

2.1.5策略迭代评估改进24

2.1.6值函数迭代27

2.1.7小结29

2.2蒙特卡罗算法30

2.2.1蒙特卡罗算法介绍 30

2.2.2探索策略32

2.2.3策略异轨的蒙特卡罗算法35

2.2.4小结38

2.3时序差分算法38

2.3.1时序差分算法简介38

2.3.2Sarsa: 策略同轨的时序差分算法40

2.3.3Q学习41

2.3.4值函数的偏差44

2.3.5双Q学习45

2.3.6值函数预测的... 查看详情

1.内容全面系统:本书包括8章,从绪论到多智能体强化学习的基本原理和算法,系统介绍了强化学习、深度强化学习、多智能体强化学习的基本概念、方法和发展历程,建立了完整的学习框架。 2.注重实践应用:除了理论讲解外,本书还配备了微课视频,通过动画和板书推导的形式讲解主要知识点,提供源程序和实验数据集,使读者能够更好地理解和应用强化学习方法解决实际问题。 3.适用群体广泛:本书主要面向高等院校相关专业的本科生、研究生,同时也适用于工程技术人员和教师等参考使用。无论是在学术研究还是工程实践中,本书都提供了必要的知识和指导。 4.使用灵活方便:为方便不同读者群体的需求,本书的篇幅较长,可按章节顺序阅读,也可根据实际需求自由跳跃选读。对于教师用户,提供了PPT课件,方便备课和教学使用。 5.章节融会贯通:每章都包括知识回顾、前后关系和内容特色,帮助读者建立上下文联系。微课部分的虚拟教室、理论推导和代码讲解等内容,进一步加强知识理解和实践应用能力。

查看详情