RL-算法01-SAC04:SAC Actor Loss完整推导【Soft Policy Iteration、KL散度、Reparameterization Trick与Tanh Gaussian】
第4部分:SAC Actor Loss完整推导——Soft Policy Iteration、KL散度、Reparameterization Trick与Tanh Gaussian Policy
上一部分完成了 SAC Critic 的数学推导:
Q(st,at)=rt+γE[Q(st+1,at+1)−αlogπ(at+1∣st+1)]Q(s_t,a_t)=r_t+\gamma E[Q(s_{t+1},a_{t+1})-\alpha\…
2026/9/28 21:20:01