内容简介

本书将阐述强化学习原理,力图揭示强化学习的基本思想和方法,并介绍应用强化学习的场景及出现的问题,探讨和提出我们的一些思路和方法。本书将从环境感知开篇,采用具体的传感、控制实例,说明强化学习中环境和智能体这两个要素。在此基础上,本书引出马尔科夫决策问题模型,以优化目标为导向,从数学和物理角度,详细阐述和推导各值函数方程的原理。为方便读者,本书附加了需要用到的概率和统计学原理。最后,本书按强化学习方法的优化途径,分类讲解各类算法的原理和实现,使读者对于理论的理解更透彻。 读者对象是人工智能、机器人、物联网、计算机等专业的本科生和研究生,及相关工程技术人员。