RL-10-赵-Actor-Critic01-在线算法02:A2C算法04【优势函数由TD error来近似:A=δₜ=qₜ(s,a)-vₜ(s)≈rₜ₊₁(s,a)+γvₜ₊₁(s)-vₜ(s)】
更进一步地,有一个技巧,就是the advantage function由TD error近似: δ t = q t ( s t , a t ) − v t ( s t ) ⟹ δ t = r t + 1 + γ v t ( s t + 1 ) − v t ( s t ) \delta_t=q_t(s_t,a_t)-v_t(s_t) \Longrightarrow \delta_t=r_{t+1}+\gamma v_t(s_{t+1})-v_t(s_t) δ
2026/9/29 10:54:02