esparkl.top
open-menu closeme
首页
科研
课程笔记
各项技能
实习就业
关于
github rss
  • 22 科研 策略梯度算法(强化学习)

    calendar 2025-09-13 · 1 分钟阅读 · 强化学习  ·
    分享到: twitter facebook linkedin copy

    阅读CEAES: Bidirectional Reinforcement Learning Optimization for Consistent and Explainable Essay Assessment的补充 之前在吴恩达机器学习网课中学习的应该是基于价值的(Value-Based)的强化学习方法,即DQN。它是通过学习价值函数V(s)来间接地获得策略。 而基于策略(Policy-Based)的方法则直接参数化并优化策略本身。为此设计了一个用参数$\theta$控制的函数函数$\pi_{\theta}(a|s)$。目的是找到最优的参数$\theta^$,使策略$\pi_{\theta^}$积累的回报最大化。


    阅读更多

eSparkL photo

eSparkL

见证成长的地方

stay hungry, stay humble 致力做一个知识厨子

阅读更多

最新文章

  • 31 互联网程序设计
  • 21 数据挖掘网课 7.12
  • 15 概率论期末复习
  • 思科第六章小测 应用层
  • 思科第五章小测 传输层
  • 14 数据库第8章
  • 思科第四章小测 IP寻址
  • 软件工程5.21

分类

项目 4 DJANGO 3 概率论 3 计网 3 HUGO 2 小仓库 2 论文阅读 2 软件工程 2 ANACONDA 1 DOCKER 1 LANGCHAIN 1 NUMPY 1 PYTORCH 1 UNITY 1
所有分类
ANACONDA1 DJANGO3 DOCKER1 HUGO2 LANGCHAIN1 NUMPY1 PYTORCH1 UNITY1 WINDOWS1 百度飞桨1 概率论3 互联网程序设计1 计网3 论文阅读2 软件工程2 数据库1 数挖1 项目4 小仓库2
[A~Z][0~9]

标签

AI+教育 1 大二 1 大作业 1 强化学习 1 智能体 1
esparkl.top

Copyright 2025-  ESPARKL.TOP. All Rights Reserved

to-top