RL-赵-(七)-不基于模型3:Sarsa【TD算法】【在线】【基于RM算法在无模型条件下求解贝尔曼公式->基于一步采样直接计算出给定π下的Action Value->立刻基于ϵ-greedy更新π】原始Sarsa用于估计一个给定policy(π)的 Action Value(Policy Evaluation)。和 Policy Improvement 结合就可以进行Policy Evaluation与Policy Improvement相互迭代得到求解最优策略的算法。刚刚我们介绍完了第二个小节在这一小节当中我们介绍了一个非常经典的TD算法它可以来估计一个给定策略的state value然后我们分析了它的很多性质比如说它为什么要设计成这个样子 它在解决什么数学问题它的收敛性如何等等 包括最后我们比较了TD算法和之前学习的基于蒙特卡洛的方法
