二、Algorithm for State Value estimation1、Objective function首先,用一种更正式的方式:令vπ(s)v_\pi(s)vπ(s)和v^(s,w)\hat{v}(s,w)v^(s,w)分别表示true state value和approximate函数;我们的目标是找到一个最优的www,使得v^(s,w)\hat{v}(s,w)v^(s,w)对于每个sss能最优地近似vπ(s)v_{\pi}\left(s\right)vπ(s);这个问题就是一个policy evaluation问题,然后之后我们会再推广得到action value,稍后我们再将会把它推广到policy improvement;所以我们一步一步来,我们先看怎么样做policy evaluation;为了找到最优的www,我们需要两步:第一步定义一个目标函数 (object function) ;第二步是优化这个目标函数;目标函数:J(w)=E[(vπ(S)−v^(S,w))2] J(w)=\mathbb{E}[(v_\pi(S)-\hat{v}(S,w))^2]J(w)=E[(vπ(S)−v^(S,w))2]我们的目标是找到最优的www,这样可以最小化J(w)J(w)J(w);SSS是一个随机变量,S∈SS\in \mathcal{S}S∈S,随机变量一定是有概率分布(probability distribution)的;期望值与随机变量(random variable)S∈SS\in \mathcal{S}S∈S有关。随机变量SSS的概率分布是什么?这通常令人困惑,因为我们到目前为止还没有讨论过state的概率分布;有几种定义SSS的概率分布的方式;第一种方式是使用一个平均分布(uniform distribution):它对待每个states都是同等的重要性,通过将每个state的概率设置为1/∣S1/|S1/∣S;这种情况下,目标函数变为:J(w)=E[(vπ(S)−v^(S,w))2]=1∣S∣∑s∈S(vπ(s)−v^(s,w))2 J(w)=\mathbb{E}[(v_\pi(S)-\hat{v}(S,w))^2]=\frac{1}{|\mathcal{S}|}\sum_{s\in\mathcal{S}}(v_\pi(s)-\hat{v}(s,w))^2J(w)=E[(v
