【Regularization】林轩田机器学习基石

正则化的提出，是因为要解决overfitting的问题。

以Linear Regression为例：低次多项式拟合的效果可能会好于高次多项式拟合的效果。

这里回顾上上节nonlinear transform的课件：

上面的内容说的是，多项式拟合这种的假设空间，是nested hypothesis；因此，能否想到用step back的方法（即，加一些constraints的方法把模型给退化回去呢？）

事实上，是可以通过加入constraint使得模型退化回去的；但是，再优化的过程中涉及到了“判断每个wq等于0的”问题，这种问题有点儿类似PLA的求解过程。

类比一下，这是一个NP-hard的问题，即不好求解。那么能不能换一种方式，让求解变得容易些呢？

让求解变得容易的方法是，改变约束条件。假设空间变成了regularized hypothesis Wreg。

上述内容，是通过几何角度分析：满足约束条件的最优解，Wreg应该与梯度的负方向一样。

这样optimal solution就可以求出来了；有个别名叫岭回归。

上述的过程，主要请出了前人的智慧“拉格朗日乘子”，目的是把有约束的优化问题转化为无约束的优化问题。

上面是用几何意义想出来的最有的Wreg，下面还原到初始的目标优化函数：

这里引出来了augmented error的概念；因为Ein是square的，W'W也是正的，所以lambda也是设成是正的（由于lambda是正的，因此在优化求解的时候，可以保证W'W不能太大）。用这个方法可以对模型复杂度进行惩罚，并且把有约束的问题转化为无约束的问题。

这里的关键在于如何选取lambda

lambda越大，倾向于w越短；这种方式可以平移到很多线性模型中（只要是square error的）；由于这种regularization的作用是缩短W的长度，因此也叫weight-decay regularization。

接下来，从更一般的角度讲解了regularization

正则化分三种类型

（1）特殊目标驱动正则化：比如，缩减偶次项Wq²

（2）为了平滑（尽量少够到一些stochastic/deterministic noise ）：例如 L1 regularizer

（3）易于优化：如L2 regularizer

感觉这里对L1 L2 regularizer讲解的比较弱，搜了一篇日志（http://blog.csdn.net/zouxy09/article/details/24971995），对L1和L2 regularizer讲解的不错。

【Regularization】林轩田机器学习基石的更多相关文章

（转载）林轩田机器学习基石课程学习笔记1 — The Learning Problem
(转载)林轩田机器学习基石课程学习笔记1 - The Learning Problem When Can Machine Learn? Why Can Machine Learn? How Can M ...
【The VC Dimension】林轩田机器学习基石
首先回顾上节课末尾引出来的VC Bound概念,对于机器学习来说,VC dimension理论到底有啥用. 三点: 1. 如果有Break Point证明是一个好的假设集合 2. 如果N足够大,那么E ...
【Hazard of Overfitting】林轩田机器学习基石
首先明确了什么是Overfitting 随后,用开车的例子给出了Overfitting的出现原因出现原因有三个: (1)dvc太高,模型过于复杂(开车开太快) (2)data中噪声太大(路面太颠簸) ...
【 Logistic Regression 】林轩田机器学习基石
这里提出Logistic Regression的角度是Soft Binary Classification.输出限定在0~1之间,用于表示可能发生positive的概率. 具体的做法是在Linear ...
【Linear Regression】林轩田机器学习基石
这一节开始讲基础的Linear Regression算法. (1)Linear Regression的假设空间变成了实数域 (2)Linear Regression的目标是找到使得残差更小的分割线(超 ...
【Theory of Generalization】林轩田机器学习基石
紧接上一讲的Break Point of H.有一个非常intuition的结论,如果break point在k取到了,那么k+1, k+2,... 都是break point. 那么除此之外,我们还 ...
【Training versus Testing】林轩田机器学习基石
接着上一讲留下的关子,机器学习是否可行与假设集合H的数量M的关系. 机器学习是否可行的两个关键点: 1. Ein(g)是否足够小(在训练集上的表现是否出色) 2. Eout(g)是否与Ein(g)足够 ...
【Feasibility of Learning】林轩田机器学习基石
这一节的核心内容在于如何由hoeffding不等式关联到机器学习的可行性. 这个PAC很形象又准确,描述了“当前的可能性大概是正确的”,即某个概率的上届. hoeffding在机器学习上的关联就是: ...
【Perceptron Learning Algorithm】林轩田机器学习基石
直接跳过第一讲.从第二讲Perceptron开始,记录这一讲中几个印象深的点: 1. 之前自己的直觉一直对这种图理解的不好,老按照x.y去理解. a) 这种图的每个坐标代表的是features:fea ...

随机推荐

java集合框架——List
一.List接口概述 List有个很大的特点就是可以操作角标. 下面开始介绍List接口中相对于Collection接口比较特别的方法.在Collection接口中已经介绍的方法此处就不再赘述. 1. ...
如何获得C4C里某个code字段对应的描述信息
通过我这篇文章介绍的方法使用C4C OData服务去取服务订单数据(Sales Order): 如何用代码的方式取出SAP C4C销售订单创建后所有业务伙伴的数据 https://www.jiansh ...
NutDao配置多数据源
首先,我必须声明,这是一个非常简单的方法,很多小菜没做出来,是因为把nutz想得太复杂数据源(或者是数据库连接池),在Nutz.Ioc看来,是一个普通的Bean,没任何特别之处. 再强调一点,除了$ ...
【CCPC-Wannafly Winter Camp Day3 (Div1) G】排列（水题）
点此看题面大致题意:已知 $p$为$n$的一个排列,定义$A(p)_i=min_{j=1}^ip_j$,若用$q_i$表示$p$第$i$小的前缀的长度(以值为第一关键字,下标 ...
【转】WebSocket 是什么原理？为什么可以实现持久连接？
WebSocket是HTML5出的东西也就是说HTTP协议没有变化但HTTP是不支持持久连接的(长连接,循环连接的不算)或者说WebSocket干脆就不是基于HTTP来执行的.但是...说不通啊. ...
JSON对象与XML相互转换工具类
依赖jar <dependency> <groupId>dom4j</groupId> <artifactId>dom4j</artifactId ...
Java-笔记1
/* 对第一个java程序进行总结 1. java程序编写-编译-运行的过程编写:我们将编写的java代码保存在以".java"结尾的源文件中编译:使用javac.exe命令编 ...
AngularJS 重复HTML元素
data-ng-repeat指令会重复一个HTML元素 <!DOCTYPE html><html><head><meta http-equiv="C ...
面试-Spring理解
转自http://hui.sohu.com/infonews/article/6331404387079946240 spring呢,是pivotal公司维护的一系列开源工具的总称,最为人所知的是sp ...
Vue 前端md5加密
用户注册时将加密后的密码发送给后端存储当登陆的时候,再将加密后的密码和数据库中加密的密码相匹配. npm: https://www.npmjs.com/package/crypto-browseri ...

【Regularization】林轩田机器学习基石

【Regularization】林轩田机器学习基石的更多相关文章

随机推荐

热门专题