尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

RL-赵-(七)-不基于模型2-时序差分/TD算法02-计算ActionValue:Sarsa01【基于RM算法⮕求解贝尔曼公式】【基于一步采样直接求出给定π下ActionValue】

发布时间:2026/9/25 2:11:00

资讯中心
01
ARTICLE

RL-赵-(七)-不基于模型2-时序差分/TD算法02-计算ActionValue:Sarsa01【基于RM算法⮕求解贝尔曼公式】【基于一步采样直接求出给定π下ActionValue】

RL-赵-(七)-不基于模型2-时序差分/TD算法02-计算ActionValue:Sarsa01【基于RM算法⮕求解贝尔曼公式】【基于一步采样直接求出给定π下ActionValue】
RL-赵-(七)-不基于模型3:Sarsa【TD算法】【在线】【基于RM算法在无模型条件下求解贝尔曼公式->基于一步采样直接计算出给定π下的Action Value->立刻基于ϵ-greedy更新π】原始Sarsa用于估计一个给定policy(π)的 Action Value(Policy Evaluation)。和 Policy Improvement 结合就可以进行Policy Evaluation与Policy Improvement相互迭代得到求解最优策略的算法。刚刚我们介绍完了第二个小节在这一小节当中我们介绍了一个非常经典的TD算法它可以来估计一个给定策略的state value然后我们分析了它的很多性质比如说它为什么要设计成这个样子 它在解决什么数学问题它的收敛性如何等等 包括最后我们比较了TD算法和之前学习的基于蒙特卡洛的方法
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。