22 科研 策略梯度算法(强化学习)
总结摘要
22-科研-策略梯度算法(强化学习)
阅读CEAES: Bidirectional Reinforcement Learning Optimization for Consistent and Explainable Essay Assessment的补充
之前在吴恩达机器学习网课中学习的应该是基于价值的(Value-Based)的强化学习方法,即DQN。它是通过学习价值函数V(s)来间接地获得策略。
而基于策略(Policy-Based)的方法则直接参数化并优化策略本身。为此设计了一个用参数$\theta$控制的函数函数$\pi_{\theta}(a|s)$。目的是找到最优的参数$\theta^$,使策略$\pi_{\theta^}$积累的回报最大化。