基于值函数和策略梯度的深度强化学习综述

引用

摘要：

作为人工智能领域的热门研究问题,深度强化学习自提出以来,就受到人们越来越多的关注.目前,深度强化学习能够解决很多以前难以解决的问题,比如直接从原始像素中学习如何玩视频游戏和针对机器人问题学习控制策略,深度强化学习通过不断优化控制策略,建立一个对视觉世界有更高层次理解的自治系统.其中,基于值函数和策略梯度的深度强化学习是核心的基础方法和研究重点.该文对这两类深度强化学习方法进行了系统的阐述和总结,包括用到的求解算法和网络结构.首先,本文概述了基于值函数的深度强化学习方法,包括开山鼻祖深度Q网络和基于深度Q网络的各种改进方法.然后介绍了策略梯度的概念和常见算法,并概述了深度确定性策略梯度、信赖域策略优化和异步优势行动者-评论家这三种基于策略梯度的深度强化学习方法及相应的一些改进方法.接着概述了深度强化学习前沿成果阿尔法狗和阿尔法元,并分析了后者和该文概述的两种深度强化学习方法的联系.最后对深度强化学习的未来研究方向进行了展望.

关键词：深度学习、强化学习、深度强化学习、值函数、策略梯度、机器学习

所属期刊栏目：42

分类号：TP18(自动化基础理论)

资助基金：国家自然科学基金21676295;中国石油大学北京2018年度前瞻导向及培育项目2462018QZDX02

在线出版日期：2019-07-08（万方平台首次上网日期，不代表论文的发表时间）

页数：共33页

页码：1406-1438

英文信息展示

期刊专题