RL-赵-(八)-ValueBased03-ActionValue估算:Q-learning函数逼近算法【目标:计算出最优“值函数”参数,通过该“值函数”计算出的Action Value最优】
我们知道: “TD learning” with “value function approximate”: w t + 1 = w t + α t [ r t + 1 + γ v ^ ( s t + 1 , w t ) − v ^ ( s t , w t ) ] ∇ w v ^ ( s t , w t ) \color{red}{w_{t+1}=w_t+\alpha_t\left[r_{t+1}+\gamma\hat{v}(s_{t+1},w_t)-\hat{v}(s_t,w…
2026/9/26 6:35:06