马尔可夫决策过程
📅 发表于 2025/08/25
🔄 更新于 2025/10/23
👁️ — 次访问
📝 2098 字
⏳ 7 分钟
rl
#马尔可夫性质
#马尔可夫过程
#马尔可夫奖励过程
#奖励
#回报
#价值函数
#折扣因子
#V函数
#Q函数
#贝尔曼方程
#贝尔曼期望方程
#贝尔曼最优方程
#动态规划
#自举
#预测
#策略评估
#控制
#策略搜索
定义
与历史无关未来的转移和过去是独立的优点
不考虑完整系统历史的情况下,预测和控制 Agent行为实际情况
不符合马尔可夫性质的,不仅依赖当前,还依赖历史状态。离散时间的马尔可夫过程,是最简单的马尔可夫过程状态转移概率:
状态转移矩阵:有限状态的马尔可夫过程
定义
仅增加奖励函数,R是一个期望即时奖励
标量反馈信号,Agent 到达某状态 获得的即时奖励。在某状态采取某个动作 表现如何回报
未来奖励之和,面向未来/无限累计,可通过贝尔曼方程 迭代计算。对未来奖励打折扣,更希望得到现在的奖励平衡当前奖励和未来奖励。 单步奖励,只关注当前;接近1,对所有未来奖励都同等重要越后面的奖励对当前价值的影响,会越来越小价值
即时奖励+ 未来状态的折扣价值。进入某状态后 可能获得的平均回报。回报的期望在某状态 采取某动作 可能获得的平均回报。回报的期望。现实世界奖励 往往是延迟的,强化学习需要学习远期奖励但不能太远,需要使用折扣因子马尔科夫过程是带环的,避免无穷奖励未来评估 不一定准确,存在不确定性更希望立刻就能得到奖励,而不是后面才得到奖励V函数的贝尔曼方程
当前状态和未来状态之间的迭代关系,即时奖励+未来奖励的折扣总和。状态特别多时,求解特别困难。V函数贝尔曼方程的证明过程
推导过程:见下文
关键内容:证明如下公式 + 数学全期望公式 +
状态太多时,不太能直接使用矩阵求逆求解价值函数,一般使用迭代算法来进行求解。包括蒙特卡洛方法,动态规划方法,时序差分方法等。
核心思想
随波逐流产生多条轨迹,每条轨迹算出回报g对多条轨迹的回报g 做平均,即得到状态价值核心思想
动态规划+自举的方法,一直迭代贝尔曼方程,直到价值函数收敛,得到状态价值。动态规划:用未来的价值估计 来更新 现在的价值估计自举(bootstrap)/强化:根据其他估算值来更新估算值下一个状态价值 来更新 当前状态价值。算法过程
更新差值 小于阈值时,就可以停止更新,贝尔曼方程进行迭代更新关键定义
未来状态:同时依赖于当前状态和智能体 在当前状态采取的动作奖励函数:由状态和当前动作决定
轨迹
核心思想
寻找一个最佳策略,使价值函数最大策略
在某状态 该采取什么动作,可以输出动作概率、也可以输出确定的动作值。随机性策略 或 确定性策略马尔可夫决策过程4元组:

状态转移和序列决策:

马尔可夫过程/马尔可夫奖励过程:状态转移直接由状态决定的马尔可夫决策过程:状态转移 由状态和当前动作决定的 当前状态和未来状态间多了一层决策性

无限累加公式 --> 有限递归公式。迭代的方式 --> 去求解 这个状态方程状态价值函数/V函数
在状态s,回报的期望。期望和策略相关动作价值函数/Q函数
在状态s 采取动作a,可能得到回报的期望。贝尔曼期望方程
当前状态和未来状态的关联关系当前即时奖励 + 后续状态的折扣回报。V函数的贝尔曼期望方程
Q函数的贝尔曼期望方程
备份图
未来下一时刻的价值函数与上一时刻价值函数的关联关系。1. 基础定义
从状态s开始,执行策略获得的平均回报,回报的期望。2. V函数的贝尔曼方程
通过V计算V,V函数的贝尔曼方程,所有可能a的均值通过Q计算V,策略动作价值函数来联系。3. V函数的贝尔曼最优方程:直接选择回报最大的a
V函数计算分解

1. Q函数定义:从状态s开始 选择动作a,依照策略回报的期望。
2. Q函数的贝尔曼期望方程
通过V计算Q,Q函数贝尔曼方程,所有可能s的均值通过Q计算Q,Q函数自身迭代计算3. Q函数的贝尔曼最优方程,直接选择最大回报的a
Q函数计算分解

设
贝尔曼方程
即时奖励+未来奖励的折扣总和。V函数贝尔曼方程证明过程
这样也可以
Q函数贝尔曼方程
推导过程
预测/策略评估
给定策略,求解价值函数 评估策略价值价值函数控制/寻找最佳策略
不限制策略,要去寻找 最佳策略和最佳价值最佳价值函数最佳策略预测和控制的关系
预测方法,是为了帮助解决控制问题做铺垫。直接预测Q函数即可,在决策时 选择最大Q值 对应的动作即可。预测:给定策略,策略为等概率上下左右移动,求解价值函数

控制:不给定策略,直接求解最优价值,输出对应策略。
