RL-赵-(八)-Value函数拟合算法01-StateValue估算:TD函数逼近算法05【案例:用线性逼近器/TD-Linear估计State Values(策略评估问题)】
一、案例背景
考虑一个55的网格世界示例: 给定一个策略,对于任意的s,as,as,a :π(a∣s)=0.2\pi(a|s)=0.2π(a∣s)=0.2 我们的目标是基于该策略,估计state values (策略评估问题) 总计有25种state values。 设置:rforbidden = rboundary = −1,rtarget = 1,γ=0.…
2026/9/27 22:41:40