尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】

发布时间:2026/9/29 9:51:51

资讯中心
01
ARTICLE

RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】

RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】
RL-赵-(七)-不基于模型5:Q-Learning【TD算法】【离线】【基于RM算法在无模型条件下求解贝尔曼最优公式->直接计算出最优ActionValue->直接更新目标π】【无需PE与PI迭代】二、Off-policy、On-policy在深入研究Q-learning之前,我们首先介绍两个重要的概念,首先,在TD learning task中存在两个策略:第一个是behav
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。