尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法02-5:目标函数/metrics的选取05【目标函数的梯度】

发布时间:2026/9/27 4:23:19

资讯中心
01
ARTICLE

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法02-5:目标函数/metrics的选取05【目标函数的梯度】

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法02-5:目标函数/metrics的选取05【目标函数的梯度】
二、目标函数的梯度(Gradients of the metrics)给定一个metric,然后推导它的梯度然后,应用gradient-based methods去优化这个metric。gradient的计算是policy gradient methods中最复杂的计算部分!首先,我们需要区分不同的目标函数/metrics:v ˉ π = ∑ s ∈ S d ( s ) v π ( s ) ≐ E [ ∑ t = 0 ∞ γ t R t + 1 ] \begin{aligned}\bar{v}_{\pi}\:=\sum_{s\in\mathcal{S}}d(s)v_{\pi}(s)\doteq\mathbb{E}\left[\sum_{t=0}^\infty\gamma^tR_{t+1}\right] \end{aligned}vˉπ​​=s∈S∑​d(s)vπ​(s)≐E[t=0∑∞​γtRt+1​]​v ˉ π 0 \bar{v}_\pi^0vˉπ0​;r ˉ π ≐ ∑ s ∈ S d π ( s ) r π ( s ) ≐ lim ⁡ n → ∞ 1 n E [ ∑ k = 1 n R t + k ] \begin{aligned}\bar{r}_{\pi}\doteq\sum_{s\in\mathcal{S}}d_{\pi}\left(s\right)r_{\pi}\left(s\right) \doteq\lim_{n\to\infty}\frac{1}{n}\mathbb{E}\left[\sum_{k=1}^{n}R_{t+k}\right] \\[4ex]\end{aligned}rˉπ​≐s∈S∑​dπ​(s)rπ​(s)≐n→∞lim​n1​E[k=1∑n​Rt+k​]​第二,我们需要区分 the discounted 和 undiscounted casesGradients/梯度的统一表示形式:∇ θ J ( θ ) = ∑ s ∈ S η ( s ) ∑ a ∈ A ∇ θ π ( a ∣ s , θ ) q π ( s , a ) \color{red}{ \nabla_\theta J(\theta)=\sum_{s\in\mathcal{S}}\eta(s)\sum_{a\in\mathcal{A}}\nabla_\theta\pi(a|s,\theta)q_\pi(s,a)}∇θ​J(θ)=s∈S∑​η(s)a∈A∑​∇θ​π(a∣s,θ)qπ​(s,a)其中目标函数J ( θ ) J(\theta)J(θ)可以是:v ˉ π = ∑ s ∈ S d ( s ) v π ( s ) ≐ E [ ∑ t = 0 ∞ γ t R t + 1 ] \begin{aligned}\bar{v}_{\pi}\:=\sum_{s\in\mathcal{S}}d(s)v_{\pi}(s)\doteq\mathbb{E}\left[\sum_{t=0}^\infty\gamma^tR_{t+1}\right] \end{aligned}vˉπ​​=s∈S∑​d(s)vπ​(s)≐E[t=0∑∞​γtRt+1​]​v ˉ π 0 \bar{v}_\pi^0vˉπ0​;r ˉ π ≐ ∑ s ∈ S d π ( s ) r π ( s ) ≐ lim ⁡ n → ∞ 1 n E [ ∑ k = 1 n R t + k ] \begin{aligned}\bar{r}_{\pi}\doteq\sum_{s\in\mathcal{S}}d_{\pi}\left(s\right)r_{\pi}\left(s\right) \doteq\lim_{n\to\infty}\frac{1}{n}\mathbb{E}\left[\sum_{k=1}^{n}R_{t+k}\right] \\[4ex]\end{aligned}rˉπ​≐s∈S∑​dπ​(s)rπ​(s)≐n→∞lim​n1​E[k=1∑n​Rt+k​]​= ==可以表示严格相等(=),近似(≈)或者成比例等于(∝);∑ s ∈ S \begin{aligned}\sum_{s\in\mathcal{S}}\end{aligned}s∈S∑​​:表示对s ss求和;η \etaη是一个在states下的分布或者权重,每一个state有一个权重η ( s ) \eta(s)η(s);η \etaη对于不同的目标函数在不同的情况下它会呈现出来不同的distribution;∑ a ∈ A ∇ θ π ( a ∣ s , θ ) q π ( s , a ) \begin{aligned}\sum_{a\in\mathcal{A}}\nabla_\theta\pi(a|s,\theta)q_\pi(s,a)\end{aligned}a∈A∑​∇θ​
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。