【RL系列】马尔可夫决策过程—

Gambler's Problem，即“赌徒问题”，是一个经典的动态编程里值迭代应用的问题。

在一个掷硬币游戏中，赌徒先下注，如果硬币为正面，赌徒赢回双倍，若是反面，则输掉赌注。赌徒给自己定了一个目标，本金赢到100块或是输光就结束游戏。找到一个关于本金与赌注之间关系的策略使得赌徒最快赢到100块。状态s = {1, 2, 3...., 99, 100}，动作a = {1, 2, 3, ...., min(s, 100 - s)}。奖励设置：只有当赌徒赢到100块时奖励+1，其余状态奖励为0。

这个问题并不难，最优policy一定是min(s, 100-s)，这里就不分析了，直接给出计算程序

clear

clc

%% Initialize

Q = zeros(101);

ActionProb = Q + 1/100;

V = zeros(1, 101);

R = V;

R(1, 101)  = 1;

V = R;

hp = 0.4;

i = 0;

delta = 100;

gamma = 0.5;

capital = [1:99];

num = 1;

%% Value Iteration

while(num < 10)

    while(i < num)

        delta = 0;

        capital = [1:99];

        for state = [1:99]

            actions = [1:min(capital(state), 100 - capital(state))];

            PossibleStateLose = capital(state) - actions + 1;

            PossibleStateWin = capital(state) + actions + 1;

            %Q(state + 1, actions) = gamma*(hp*V(PossibleStateWin) + (1 - hp)*V(PossibleStateLose)) + R(PossibleStateWin) + R(PossibleStateLose);

            Q(state + 1, actions) = hp*V(PossibleStateWin) + (1 - hp)*V(PossibleStateLose);

            [MAX index] = max(Q(state + 1, :));

            %%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%

            %Softmax Policy:

            %ActionProb(state, :) = 0;

            %ActionProb(state, :) = exp(Q(state, :)/0.02)/sum(exp(Q(state, :)/0.02));

            %R(state + 1) = ActionProb(state, :)*Q(state, :)';

            %%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%%

            V(state + 1) = MAX;

        end

    i = i + 1;

    end

    plot(V, 'LineWidth', 2)

    hold on

    num = num + 1;

    grid on

end

%%

figure

for state = 1:100

    [MAX index] = max(Q(state, :));

    Map(state) = index;

    plot(state, index, 'bo')

    hold on

end

%%Test Part

iter = 1;

count = zeros(1, 100);

flag = count;

Mflag = zeros(1, 100);

while(iter < 1000)

Mflag = zeros(1, 100);

Mcount = Mflag;

for state = 1:100

    capital = state;

    while(1)

        if(capital >= 100)

            break

        end

        stake = Map(capital);

        %stake = min(capital, 100 - capital);

        if(rand < 0.4)

            capital = capital + stake;

        else

            capital = capital - stake;

        end

        if(capital <= 0)

            flag(state) = flag(state) + 1;

            Mflag(state) = Mflag(state) + 1;

            break

        else

            count(state) = count(state) + 1;

            Mcount(state) = Mcount(state) + 1;

        end

    end

end

%figure

%plot(find(flag~=1), count(find(flag ~= 1)), 'bo')

FT(iter) = sum(Mflag)/100;

ST(iter) = mean(Mcount(find(Mflag ~= 1)));

iter = iter + 1;

end

figure

plot(1 - flag/1000, 'bo')

figure

plot(count/1000)

mean(1-FT)

mean(ST)

【RL系列】马尔可夫决策过程——Gambler's Problem的更多相关文章

【RL系列】马尔可夫决策过程——状态价值评价与动作价值评价
请先阅读上两篇文章: [RL系列]马尔可夫决策过程中状态价值函数的一般形式 [RL系列]马尔可夫决策过程与动态编程状态价值函数,顾名思义,就是用于状态价值评价(SVE)的.典型的问题有“格子世界(G ...
【RL系列】马尔可夫决策过程中状态价值函数的一般形式
请先阅读上一篇文章:[RL系列]马尔可夫决策过程与动态编程在上一篇文章里,主要讨论了马尔可夫决策过程模型的来源和基本思想,并以MAB问题为例简单的介绍了动态编程的基本方法.虽然上一篇文章中的马尔可夫 ...
【RL系列】马尔可夫决策过程——Jack‘s Car Rental
本篇请结合课本Reinforcement Learning: An Introduction学习 Jack's Car Rental是一个经典的应用马尔可夫决策过程的问题,翻译过来,我们就直接叫它“租 ...
[Reinforcement Learning] 马尔可夫决策过程
在介绍马尔可夫决策过程之前,我们先介绍下情节性任务和连续性任务以及马尔可夫性. 情节性任务 vs. 连续任务情节性任务(Episodic Tasks),所有的任务可以被可以分解成一系列情节,可以看作 ...
增强学习（二）----- 马尔可夫决策过程MDP
1. 马尔可夫模型的几类子模型大家应该还记得马尔科夫链(Markov Chain),了解机器学习的也都知道隐马尔可夫模型(Hidden Markov Model,HMM).它们具有的一个共同性质就是 ...
【cs229-Lecture16】马尔可夫决策过程
之前讲了监督学习和无监督学习,今天主要讲“强化学习”. 马尔科夫决策过程:Markov Decision Process(MDP) 价值函数:value function 值迭代:value iter ...
强化学习-MDP(马尔可夫决策过程)算法原理
1. 前言前面的强化学习基础知识介绍了强化学习中的一些基本元素和整体概念.今天讲解强化学习里面最最基础的MDP(马尔可夫决策过程). 2. MDP定义 MDP是当前强化学习理论推导的基石,通过这套框 ...
David Silver强化学习Lecture2：马尔可夫决策过程
课件:Lecture 2: Markov Decision Processes 视频:David Silver深度强化学习第2课 - 简介 (中文字幕) 马尔可夫过程马尔可夫决策过程简介马尔可夫决 ...
马尔可夫决策过程MDP
1. 马尔可夫模型的几类子模型马尔科夫链(Markov Chain),了解机器学习的也都知道隐马尔可夫模型(Hidden Markov Model,HMM).它们具有的一个共同性质就是马尔可夫性(无 ...

随机推荐

Datatable报错Uncaught TypeError: Cannot read property 'cell' of undefined
使用Datatables时,报出错误仔细想想,是因为我在columns里加入了id,并设置visible:false 但是却没在下面的HTML部分多加一个 th 虽然我觉得因为id是隐藏的,不用加上 ...
小程序的get和post需要注意的地方
在进行异步请求之前先去小程序后台配置好服务器域名. get请求:header: { 'content-type':'json'}就可以. post请求:header: { 'content-type' ...
CSS节选——选择器
CSS,cascading style sheet,层叠样式表,请留意层叠概念. css3为了区分伪类和伪元素,伪元素采用双冒号写法. 常见伪类——:hover,:link,:active,:targ ...
编译安装 Hue
# 安装前的准备 useradd huedev wget https://github.com/cloudera/hue/archive/release-4.2.0.tar.gz -O /home/h ...
浅谈JS作用域和闭包
函数表达式和函数声明变量/函数声明都会提前 console.log(a) let a =1 那么打印出来的a为 undefined,因为会将a提到前面并赋予默认值undefined 函数声明:函数声 ...
CentOS7.6离线安装Redis5.0.4
安装gcc-c++: 检查是否存在gcc-c++:rpm -qa|grep gcc-c++ 如果不存在就下载Linux-GC-C++文件: 访问镜像网站:http://mirrors.aliyun.c ...
Fpm启动机制及流程分析———详细
FPM(FastCGI Process Manager)是PHP FastCGI运行模式的一个进程管理器,从它的定义可以看出,FPM的核心功能是进程管理,那么它用来管理什么进程呢?这个问题就需要从Fa ...
jdk8新特性-stream
一.什么是流stream 1.可理解为高级版本的 Iterator 不是集合元素,它不是数据结构并不保存数据,它是有关算法和计算的. 2.单向,不可往复数据只能遍历一次,遍历过一次后即用尽了,就好比 ...
MongoDB数据库 : 管道,用户管理,副本集等
聚合(aggregate): db.集合.aggregate([{管道:{表达式}}]) db.集合.aggregate([ {管道1:{表达式1}}, {管道2:{表达式2}}, ... ...]) ...
echo、print、print_r、var_dump
echo(): 可以一次输出多个值,多个值之间用逗号分隔.echo是语言结构(language construct),而并不是真正的函数,因此不能作为表达式的一部分使用. print(): 函数pri ...

【RL系列】马尔可夫决策过程——Gambler's Problem

【RL系列】马尔可夫决策过程——Gambler's Problem的更多相关文章

随机推荐

热门专题