DQN核心思想理解

　　看过Deep learning（convolutional neural network），看过RL（Q-learning）。但是在两者结合这一块一直弄不明白。

　　我的疑问在于一直不明白DL是怎样识别出那个特定的物体，比如，木板或者小鸟。以及Q-learning怎样做决策。

　　后来才发现，DQN的核心思想并没有识别出特定物体。

　　DQN里面的Deep learning部分，输入是原始图像，输出是action对应的Q值（类似于有这么多action类，每一类的概率值）。原始图像就是当前state (current state)，把当前state输入到Deep Learning里面，以计算在该state下对应的各Action的Q值。

　　有人问，那这怎么计算啊。我们都知道在RL里面，Q值是通过Reward来更新的。但是在DQN里面，Q值是直接算出来的。你可以把中间的neural network部分，看成一个函数f，最后输出的Q(s,a) 就等于 f(s)。这是非常不同的一点。

　　这样就算了，那感觉和Q-learning也没多少联系啊。联系在于neural network的loss function部分。我们都知道neural network是需要训练后，才能正常工作的。既然要对Neural network进行训练，那么Loss function就是必须的。那么怎样定义这个loss function呢？我们都知道这个loss function是对neural network的输出Q值进行更新的一个函数。Q值更新？似曾相识啊，这个Q值更新我们参考《Reinforcement Learning: An Introduction》2nd sutton教材的P142页：

　　这个就是Q值的Q-learning更新公式。我们就用这个公式来做loss function，保证最后得到的Q值是最优的。

　　至于怎样训练，就是类似于RL的通用方法，通过经验值计算。思想就是，大量模拟，在数量达到一定阶段后，这个得到的Q值就非常接近真实的Q值了。学名叫做experience replay（经验池），可以参考蒲丰投针实验。（其实这一点有点模糊，在RL里面，为什么Q会趋近于真实值Q，一是因为有实际的环境模拟，二是因为有一个Reward，这个Reward是按照一个终值的确定Reward，一点点往前面state传递的，所以在很多episodes后，Q值最终会趋向稳定。但是在Neural Network中，这种前后states之间的联系是如何保证的？以及为什么这样计算他就也能像Q-learning那样收敛？难道是weights的原因，毕竟前后states是用同一个neural network。这里有待进一步弄清楚）

References:

https://zhuanlan.zhihu.com/p/21421729

DQN核心思想理解的更多相关文章

Rookey.Frame v1.0 视频教程之三发布－框架核心思想介绍
本期发布视频: (三)Rookey.Frame v1.0框架核心思想介绍了Rookey.Frame v1.0框架搭建的核心思想,将框架核心思想理解清楚,对框架运行就会得心应手官方视频教程: htt ...
《深入理解Spark：核心思想与源码分析》——SparkContext的初始化（叔篇）——TaskScheduler的启动
<深入理解Spark:核心思想与源码分析>一书前言的内容请看链接<深入理解SPARK:核心思想与源码分析>一书正式出版上市 <深入理解Spark:核心思想与源码分析> ...
《深入理解Spark：核心思想与源码分析》（前言及第1章）
自己牺牲了7个月的周末和下班空闲时间,通过研究Spark源码和原理,总结整理的<深入理解Spark:核心思想与源码分析>一书现在已经正式出版上市,目前亚马逊.京东.当当.天猫等网站均有销售 ...
《深入理解Spark：核心思想与源码分析》（第2章）
<深入理解Spark:核心思想与源码分析>一书前言的内容请看链接<深入理解SPARK:核心思想与源码分析>一书正式出版上市 <深入理解Spark:核心思想与源码分析> ...
《深入理解Spark：核心思想与源码分析》一书正式出版上市
自己牺牲了7个月的周末和下班空闲时间,通过研究Spark源码和原理,总结整理的<深入理解Spark:核心思想与源码分析>一书现在已经正式出版上市,目前亚马逊.京东.当当.天猫等网站均有销售 ...
《深入理解Spark：核心思想与源码分析》正式出版上市
自己牺牲了7个月的周末和下班空闲时间,通过研究Spark源码和原理,总结整理的<深入理解Spark:核心思想与源码分析>一书现在已经正式出版上市,目前亚马逊.京东.当当.天猫等网站均有销售 ...
Spring核心思想：“控制反转”，也叫“依赖注入” 的理解
@Service对应的是业务层Bean,例如: @Service("userService") public class UserServiceImpl implements Us ...
Hibernate核心思想—ORM机制（一）
转:http://blog.csdn.net/wanghuan203/article/details/7566518 hibernate是一个采用ORM(Object/Relation Mapping ...
python中 and 和 or 运算的核心思想 ——— 短路逻辑
python中 and 和 or 运算的核心思想 --- 短路逻辑 1. 包含一个逻辑运算符首先从基本的概念着手,python中哪些对象会被当成 False 呢?而哪些又是 True 呢? 在Pyt ...

随机推荐

Vi/Vim命令壁纸图
下载地址 http://pan.baidu.com/s/1mtQdY
【linux】虚拟机内装Linux系统的ssh访问
一般在虚拟机内安装一个Linux系统,虚拟机网络设置为桥接后,Linux系统会在安装的过程中自动设置其为dhcp配置,会给其随机分配一个ip,这个ip可以用命令 "ifconfig" ...
网站Http升级至Https（基于Tomcat）
由于之前一直忙于服创比赛,然后就导致好久没写博客了. 现在服创结束也有十来天了,感觉不写点什么就对不起自己了. 于是乎,就写写将网站从http升级到https的过程吧. 首先域名和服务器自然是必须的, ...
九度oj 1004 Median 2011年浙江大学计算机及软件工程研究生机试真题
题目1004:Median 时间限制:1 秒内存限制:32 兆特殊判题:否提交:14162 解决:3887 题目描述: Given an increasing sequence S of N i ...
攻克数据库核心技术壁垒，实现百万级QPS的高吞吐
CynosDB是腾讯云自研的新一代高性能高可用的企业级分布式云数据库.融合了传统数据库.云计算与新硬件的优势,100%兼容开源数据库,百万级QPS的高吞吐,不限存储,价格仅为商用数据库的1/10. C ...
WINDOWS安装mysql5.7.20
MSI安装包链接 http://pan.baidu.com/s/1mhI0SMO 提取密码 gaqu 安装前要把老版本的MYSQL卸载干净之前用官网的archive免安装版安装一直失败,放弃,用MS ...
问题集录06--SpringBoot创建Maven项目
1. 如下图,打开idea之后,file -> new -> project2. 如下图,在弹出的new project 页面,选择maven -> 勾选Create from ar ...
CSS代码优化（转载）
要点1:css代码优化作用与意义 1.减少占用网页字节.在同等条件下缩短浏览器下载css代码时间,相当于加快网页打开速度:2.便于维护.简化和标准化css代码让css代码减少,便于日后维护:3.让自己 ...
mycat核心概念
一.逻辑库(schema) 业务人员一般是不需要知道数据库中间件的,他们只需要连接到数据库并使用数据库,一切复杂的细节都被中间件给隐藏了,对于业务人员来说中间件即是一个数据库.这里逻辑库的概念就是一个 ...
JavaScript之parseInt()数值转换常被忽略的问题
使用parseInt()你可以从字符串中获取数值,该方法接受另一个基数参数,这经常省略,但不应该.当字符串以”0″开头的时候就有可能会出问题,例如,部分时间进入表单域,在ECMAScript 3中,开 ...

DQN核心思想理解

DQN核心思想理解的更多相关文章

随机推荐

热门专题