IT数码 购物 网址 头条 软件 日历 阅读 图书馆
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放器↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁
 
   -> 人工智能 -> David Silver UCL强化学习课程学习笔记六之Value Function Approximation 值函数估计 -> 正文阅读

[人工智能]David Silver UCL强化学习课程学习笔记六之Value Function Approximation 值函数估计

Lecture 6: Value Function Approximation
https://www.davidsilver.uk/wp-content/uploads/2020/03/FA.pdf

Introduction

在这里插入图片描述
不同种类的值函数估计 从左到右分别是状态值函数,动作值函数act-in和动作值函数act-out

Incremental Methods 增量方法

在这里插入图片描述
核心思想:利用梯度下降的方法找到一组变量使得值函数的估计值与真实值之间的均方误差最小,即J(w)最小。在lecture4中就有将一般的均值求取变为增量式求取的方法(MC),这里的思路类似。
在这里插入图片描述
MC值函数估计在这里插入图片描述

TD值函数估计
在这里插入图片描述

TD(λ)值函数估计
在这里插入图片描述

增量控制算法
在这里插入图片描述

在这里插入图片描述
bootsrap是第四章出现的名词,大概意为某个状态的价值更新用了其他状态的值,而并非只是用总回报。我们知道MC不是bootstrap的,TD和TD(λ)则都是bootstrap的。

在这里插入图片描述
prediction收敛性分析

在这里插入图片描述在这里插入图片描述
梯度TD 梯度Q学习在查表、线性和非线性下的收敛性分析。

Batch Methods 批方法

在这里插入图片描述
批处理方法意在根据训练数据的经验寻求找到最佳拟合值函数。
在这里插入图片描述
要优化的代价函数LS最小二乘法。
在这里插入图片描述
基于经验的DQN

在这里插入图片描述
线性条件下LS算法的收敛性分析。

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

  人工智能 最新文章
2022吴恩达机器学习课程——第二课(神经网
第十五章 规则学习
FixMatch: Simplifying Semi-Supervised Le
数据挖掘Java——Kmeans算法的实现
大脑皮层的分割方法
【翻译】GPT-3是如何工作的
论文笔记:TEACHTEXT: CrossModal Generaliz
python从零学(六)
详解Python 3.x 导入(import)
【答读者问27】backtrader不支持最新版本的
上一篇文章      下一篇文章      查看所有文章
加:2022-02-06 13:50:16  更:2022-02-06 13:51:23 
 
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁

360图书馆 购物 三丰科技 阅读网 日历 万年历 2025年1日历 -2025/1/10 11:10:59-

图片自动播放器
↓图片自动播放器↓
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
  网站联系: qq:121756557 email:121756557@qq.com  IT数码