从本文开始,将从value-based methods转向到policy-based methods,从value function approximation到policy function approximation。一、Basic idea of policy gradient到目前,我们的policies都是用tables表示的。如下是所有state的action probabilities,存储在一个tableπ ( a ∣ s ) \pi(a|s)π(a∣s),表格中的每个实体由一个state和一个action表示【表格中每个元素直接保存了某个s-a对的π概率值】。我们可以直接访问或改变表格中的一个值。到目前为止 其实我们所有的策略全都是用表格来表示的比如说我有一些状态每一个状态就对应这个一行我有一些action 每一个action就对应一列 我想去里边找某一个状态下我take action a3它的概率是多少呢?我直接去这个表格当中就能找到 所以之前的策略全部是用表格的形式来表达的它表格的基本操作还是比较简单的 我想去里边访问一个量或者是我想改变一个量直接通过索引就可以实现现在,我们可以把表格改成函数。policies/策略用参数化的函数表示。π ( a ∣ s , θ ) \pi(a|s,\theta)π(a∣s,θ)其中θ ∈ R m \theta\in\mathbb{R}^mθ∈Rm是一个参数向量,可以用来表示π ππ这个函数里边的参数。例如,这个函数可以是一个神经网络(现在用的最广泛的这种函数的形式实际上就是神经网络),它的输入是s ss,输出是采取每个action的概率,参数是θ \thetaθ;Value Function Approximation函数中的参数我们用w ww来表示;Policy Gradient Methods 函数的参数我们用θ θθ来表示;优势:当state space比较大时(有非常多的state,甚至这个state是连续变化的那有无穷多个),表格化的表示是低效的,尤其是针对存储和泛化能力。泛化就是比如说我要去更新
