《统计学习方法》笔记（3）：k近邻

k近邻（KNN）是相对基本的机器学习方法，特点是不需要建立模型，而是直接根据训练样本的数据对测试样本进行分类。

1、k近邻的算法？

算法对测试样本进行分类的一般过程如下：

1）根据给定的k值，搜索与测试样本距离最近的k个训练样本；

2）统计k个样本对应的每种分类数量；

3）根据每种分类的数量投票决定样本点所属分类，票数多者得。

例如：对于二分类，采用k=5的k近邻算法进行分类：距离样本点最近的5个点中，属于类0的样本数量为2，属于类1的样本数量为3，最终判定样本点属于类1。

2、k近邻的三要素？

k值、距离计算方法和投票规则是共同决定k近邻算法的三要素。

1）k值前面算法中已经介绍过了，是人为设定的值；根据这个设定的k值，选定距离样本点最近的训练样本。

2）距离计算方法一般采用欧氏距离，也可采用更加一般的Lp距离。举例来说：向量x1=(1,2)和x2=(3,4)均为2维特征向量，欧氏距离为 $\sqrt{((1-3)^2+(2-4)^2 )}$ ，Lp距离为 $\sqrt[p]{((1-3)^p+(2-4)^p )}$
，欧氏距离是Lp距离中P=2的特例。

3）投票规则一般采用票数多者得的原则。

3、快速对样本进行分类的方法？

k近邻算法的核心是快速的搜索到距离最近的样本点。对于样本量N很大的数据集，如果采用线性搜索方法，因为需要遍历样本中的每一个点，速度会非常慢。

为此常采用kd树结构来存储原始数据，kd树其实是二叉搜索树，对于树中的每一个节点，其左子节点（left节点）都小于自身，右子节点（right节点）都大于自身。采用该数据结构进行样本搜索时，每次可以排除掉剩余节点中半数（并非严格的半数）的节点，速度会快得多，时间复杂度是O(logN)。

《统计学习方法》笔记（3）：k近邻的更多相关文章

统计学习方法三：K近邻
一.什么是K近邻? K近邻是一种基本的分类和回归方法. 在分类时,对新的实例,根据其K个最近邻的训练实例的类别,通过多数表决权等方式预测其类别. 通俗的讲,找K个和其关系最近的邻居,哪个类别的邻居多, ...
统计学习笔记之k近邻法
1.kNN算法的思想:给定一个训练数据集,对新的输入实例,在训练集中找到与该实例最近邻的k个实例,这k个实例的多数属于某类,就把输入实例分为这个类. 2.算法 (1)根据给定的距离度量,在训练集T中找 ...
《统计学习方法》笔记三 k近邻法
本系列笔记内容参考来源为李航<统计学习方法> k近邻是一种基本分类与回归方法,书中只讨论分类情况.输入为实例的特征向量,输出为实例的类别.k值的选择.距离度量及分类决策规则是k近邻法的三个 ...
统计学习方法笔记 -- KNN
K近邻法(K-nearest neighbor,k-NN),这里只讨论基于knn的分类问题,1968年由Cover和Hart提出,属于判别模型 K近邻法不具有显式的学习过程,算法比较简单,每次分类都是 ...
统计学习方法笔记（KNN）
k近邻法(k-nearest neighbor,k-NN) 输入:实例的特征向量,对应于特征空间的点:输出:实例的类别,可以取多类. 分类时,根据其k个最近邻的训练实例的类别,通过多数表决等方式进行预 ...
统计学习方法笔记--EM算法--三硬币例子补充
本文,意在说明<统计学习方法>第九章EM算法的三硬币例子,公式(9.5-9.6如何而来) 下面是(公式9.5-9.8)的说明, 本人水平有限,怀着分享学习的态度发表此文,欢迎大家批评,交流 ...
李航-统计学习方法-笔记-3：KNN
KNN算法基本模型:给定一个训练数据集,对新的输入实例,在训练数据集中找到与该实例最邻近的k个实例.这k个实例的多数属于某个类,就把输入实例分为这个类. KNN没有显式的学习过程. KNN使用的模型 ...
统计学习方法笔记 Logistic regression
logistic distribution 设X是连续随机变量,X服从逻辑斯谛分布是指X具有下列分布函数和密度函数: 式中,μ为位置参数,γ>0为形状参数. 密度函数是脉冲函数分布函数是一条S ...
统计学习方法笔记 -- Boosting方法
AdaBoost算法基本思想是,对于一个复杂的问题,单独用一个分类算法判断比较困难,那么我们就用一组分类器来进行综合判断,得到结果,"三个臭皮匠顶一个诸葛亮" 专业的说法, 强可 ...

随机推荐

layuitable设置数据表
如图,要设置类似这样的格式步骤如下: 1. 设置一个列表表格 2. 获取数据 table.render({ elem: '#pl-list' ,id: 'pl_table' ,height: 480 ...
logmnr使用
logminer 工具的使用 Oracle LogMiner 是Oracle公司从产品8i以后提供的一个实际非常有用的分析工具,使用该工具可以轻松获得Oracle 重作日志文件(归档日志文件)中的具体 ...
ABAP游标
DATA: BEGIN OF count_line, carrid TYPE spfli-carrid, count TYPE i, END OF count_line, spfli_tab TYPE ...
docker 系列之 docker安装
Docker支持以下的CentOS版本 CentOS 7 (64-bit) CentOS 6.5 (64-bit) 或更高的版本前提条件目前,CentOS 仅发行版本中的内核支持 Docker. ...
一、SQLite学习
由于公司业务拓展,需要开发一个基于ASP.NET Core2.0+AdminLTE架构的后台管理系统,数据库选择方面,选择了使用SQLite轻便. SQLite:一个软件库,实现自给自足,无服务器,零 ...
部署java项目到服务器
1.首先判断服务器是什么系统 linux,windows 2.如果是linux使用SSH进行链接 3.如果是windows使用远程桌面进行链接 1.windows+R->mstsc进行远程桌面的 ...
etymon word air aero aeri aer ag agreement walk joint trick skill chief forget out~1
1● air 2● aero 3● aeri 4● aer 空气充气 1● ag 做,代理做 =====>agency 1● agr 2● agri 3 ...
Oracle 当前日期如何添加指定年数、月数、天数、时数、分钟数、秒数
Oracle 当前时间如何添加指定数,来获取指定的年数.月份或其他的时间日期 --当前时间(2018-10-19 16:51:22)--- select sysdate nowDate from du ...
zabbix3.4.7主动模式监控日志(多关键字)
日志监控原理 1.Zabbix Server和Zabbix Agent会追踪日志文件的大小和最后修改时间,并且分别记录在字节计数器和最新的时间计数器中. 2.Agent会从上次读取日志的地方开始读取日 ...
【Loadrunner_Http接口】使用Loadrunner对天气信息的接口编写脚本
方法一:使用get请求 Action() { //http接口访问,get请求 web_url("www.abc.com", "URL=http://v.juhe.cn/ ...

《统计学习方法》笔记（3）：k近邻

《统计学习方法》笔记（3）：k近邻的更多相关文章

随机推荐

热门专题