强化学习的基础知识。基本要素、轨迹、值函数、V函数和Q函数、贝尔曼方程。
强化学习定义
概览
强化学习是指一个智能体从与环境的交互中不断学习去完成特定的目标。
强化学习不需要给出正确策略作为监督信息,只需要给出策略的(延迟)回报,并通过调整策略来取得最大化的期望回报。
- 智能体、环境
- 环境状态
,智能体的动作 ,智能体的策略 ,状态转移概率 ,即使奖励
智能体和环境
智能体
- 感知环境的状态和反馈的奖励,进行学习和决策
决策:根据 -- 环境状态 -- 做出不同的动作学习: 根据 -- 反馈奖励 -- 调整策略
环境
- 智能体外部的所有事物
- 收到 -- 智能体的动作 -- 改变状态
- 给 -- 智能体 -- 反馈奖励
5个基本要素
状态
环境的状态,状态空间
动作
智能体的行为,动作空间
策略
智能体 根据 -- 环境状态s -- 决定下一步的动作a 的函数
状态转移概率
根据 -- 当前状态
即时奖励
环境给智能体的奖励,标量函数。根据 -- 环境当前状态 、智能体执行的动作、环境新状态
智能体的策略
随机性策略。

马尔科夫决策过程
- 马尔可夫过程,
- 马尔可夫决策过程,
- 轨迹,给初始状态,智能体与环境的一次交互过程
马尔可夫过程
状态序列
马尔可夫决策过程
智能体与环境的交互是一个马尔可夫决策过程。
轨迹
给定策略
其中
轨迹的概率
- 初始状态
- 所有时刻概率的乘积
- 智能体执行动作,环境更新状态

目标函数
- 一个轨迹的总回报。
- 一个策略的期望回报。
。 所有轨迹的回报的期望 - 强化学习的目标。学一个策略
, 最大化这个策略的期望回报
轨迹的总回报
1. 某一时刻的奖励
给定策略一次交互过程(回合,试验)为轨迹
2. 一条轨迹的总回报
总回报是一条轨迹所有时刻的累积奖励和。
3. 一条轨迹的折扣回报
折扣回报引入折扣率,降低远期回报的权重(T无限大时)。
折扣率
, 在意短期回报 , 在意长期回报
策略的期望回报
给一个策略
一个策略的期望回报:该策略下所有轨迹总回报的期望值。
强化学习的目标
强化学习的目标是学习到一个策略
值函数
- 状态值函数。
, 初始状态为s,执行策略 得到的期望回报。 - 贝尔曼方程迭代计算值函数
- 状态-动作值函数。
, 初始状态为s,进行动作a,执行策略 得到的期望回报 - V函数与Q函数的关系。
- 值函数的作用。评估策略
, 对好的动作a( 大 ),增大其概率
状态值函数
状态值函数
贝尔曼方程计算值函数
当前状态的值函数,可以通过下个状态的值函数进行递推计算。
核心:
- 关键在于状态转移:
- 选动作、选新状态 :
, - 策略
和状态转移概率 - 对这两层可能性的所有值函数,求期望即可
给定策略状态转移概率奖励
V函数的贝尔曼方程
状态-动作值函数
状态-动作值函数是 初始状态为期望总回报。 也称为Q函数。
Q函数的贝尔曼方程
V函数与Q函数
函数要 先确定动作 , 再确定新状态 函数是确定动作a后的V函数
V函数是所有动作a的Q函数的期望
值函数的作用
值函数用来对策略
如果在状态s,有一个动作a使得
- s状态,执行动作a 比 s状态 所有动作的期望,都要好。状态a高于所有状态的平均值
- 说明执行动作a比当前策略
好 - 调整参数使
的概率增加
贝尔曼和贝尔曼最优方程
函数和 函数 - 贝尔曼方程(选择所有可能的均值)
- 贝尔曼最优方程(直接选择最大值)
V函数与Q函数
V函数:以s为初始状态,执行策略期望回报(所有轨迹回报的均值)
Q函数:以s为初始状态,执行动作a,执行策略
利用V函数去计算Q函数
贝尔曼方程
贝尔曼最优方程
深度强化学习
有些任务的状态和动作非常多,并且是连续的。普通方法很难去计算。
可以使用更复杂的函数(深度神经网络)使智能体来感知更复杂的环境状态,建立更复杂的策略。
深度强化学习
强化学习-- 定义问题和优化目标深度学习-- 解决状态表示、策略表示等问题