尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

【无标题】RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】

发布时间:2026/9/26 3:34:24

资讯中心
01
ARTICLE

【无标题】RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】

【无标题】RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】
RL-赵-(八)-Value-Based04:Deep Q-learning(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】【目标:最优化网络参数⮕使得通过网络计算出的q是最优的】1、技巧01:Two Networks(两个网络)第一个技巧: 使用了两个网络,一个是main network, 另一个是target network。为什么要使用两个网络呢? 在数学上来说因为计算梯度的时候会非常的复杂,所以先去固定一个,然后再去计算另一个,这样就需要两个网络来实现。具体实现的细节:令w ww和w T w_TwT​分别表示mean network和target network的参数,它们初始化的时候是一样的。在每个iteration中,从 replay buffer【这里边包含了很多的experience的sample】 中 draw —个 mini-batch 样本{ ( s , a , r , s ′ ) } \{(s,a,r,s^{\prime})\}{(s,a,r,s′)}网络的输入包括 states ss和 actiona aa, 输出y = q ^ ( s , a , w ) y = \hat{q}(s, a, w)y=q^​(s,a,w)。y ^ \hat{y}y^​的目标值是y T ≐ r + γ max ⁡ a ∈ A ( s ′ ) q ^ ( s ′ , a , w T ) y_T\doteq r+\gamma\max_{a\in\mathcal{A}(s^{\prime})}\hat{q}(s^{\prime},a,w_T)yT​≐r+γmaxa∈A(s′)​q^​(s′,a,wT​)。然后为了更新Main Network 我们直接基于the mini-batch
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。