RL-赵-(八)-Value函数拟合算法02-ActionValue估算01:Sarsa函数逼近算法【与基于表格的区别:不是用于计算q,而是用于更新“值函数”的参数,使得通过参数计算出的q值最优】
到目前为止,我们仅仅是考虑 state value estimation的问题,也就是我们希望 v ^ ≈ v π \hat{v}\approx v_{\pi} v^≈vπ
为了搜索最优策略,我们需要估计action values。
我们知道: “TD learning” with “value function approximate”: w t + 1 = w t + α t [ r …
2026/9/26 18:46:44