RL-赵-(五)-不基于模型1:MC算法05【MC ε-Greedy】【把只能从(s,a)对开始的条件去掉】【软策略:每个动作都有可能;通过ε平衡exploitation与exploration】
四、MC ε-Greedy(MC without exploring starts )
1、Soft Policies(软策略) 什么是Soft policies?如果一个策略采取的每一个action的概率是positive,也就是这些action都有可能被采取,那么这个策略就称为soft policy。
为什么要引入软策略? 使用软策略,一些足够长的…
2026/9/24 17:55:37