KNN最近邻算法原理

　　KNN英文全称K-nearst neighbor，中文名称为K近邻算法，它是由Cover和Hart在1968年提出来的　

　　KNN算法原理：

　　　　　　　　1. 计算已知类别数据集中的点与当前点之间的距离；

　　　　　　　　2. 按照距离递增次序排序；

　　　　　　　　3. 选择与当前距离最小的k个点；

　　　　　　　　4. 确定前k个点所在类别的出现概率

　　　　　　　　5. 返回前k个点出现频率最高的类别作为当前点的预测分类

　　如果数据集中序号1-12为已知的电影分类，分为喜剧片、动作片、爱情片三个种类，使用的特征值分别为搞笑镜头、打斗镜头、拥抱镜头的数量。那么来了一部新电影《唐人街探案》，它属于上述3个电影分类中的哪个类型？

代码实现如下

import pandas as pd

import numpy as np

def distance(v1, v2):

    """

    距离计算

    :param v1:点1

    :param v2: 点2

    :return: 距离

    """

    dist = np.sqrt(np.sum(np.power((v1 - v2), )))

    return dist

# 加载数据

data = pd.read_excel("./电影分类数据.xlsx")

print("data:\n", data)

print("*" * )

# 获取训练集

train = data.iloc[:, :]

print("train:\n", train)

# 获取训练集的特征值   与目标值

train_x = train.iloc[:, :-]

train_y = train.iloc[:, -]

# 获取测试集

print("*" * )

test = data.columns[-:]

print("test:\n", test)

# 进行计算距离

# 循环计算训练集每一个样本与测试集的距离

for i in range(train.shape[]):

    # 计算距离

    dist = distance(train_x.iloc[i,:],test[:])

    train.loc[i,'dist'] = dist

print(train)

#  对距离按照升序进行排序

train.sort_values(by='dist',inplace=True)

print("*" * )

print("排序后的train:\n",train)

# 确定K 值 k值不同结果不同

k =

res = train.loc[:,'电影类型'][:k].mode()[]

print("*" * )

print(res)

knn原理及借助电影分类实现knn算法的更多相关文章

机器学习实战1-1 KNN电影分类遇到的问题
为什么电脑排版效果和手机排版效果不一样~ 目前只学习了python的基础语法,有些东西理解的不透彻,希望能一边看<机器学习实战>,一边加深对python的理解,所以写的内容很浅显,也许还会 ...
K近邻法(KNN)原理小结
K近邻法(k-nearst neighbors,KNN)是一种很基本的机器学习方法了,在我们平常的生活中也会不自主的应用.比如,我们判断一个人的人品,只需要观察他来往最密切的几个人的人品好坏就可以得出 ...
kNN(K-Nearest Neighbor)最近的分类规则
KNN最近的规则,主要的应用领域是未知的鉴定,这一推断未知的哪一类,这样做是为了推断.基于欧几里得定理,已知推断未知什么样的特点和最亲密的事情特性: K最近的邻居(k-Nearest Neighbor ...
机器学习之KNN原理与代码实现
KNN原理与代码实现本文系作者原创,转载请注明出处:https://www.cnblogs.com/further-further-further/p/9670187.html 1. KNN原理 K ...
数学建模：2.监督学习--分类分析- KNN最邻近分类算法
1.分类分析分类(Classification)指的是从数据中选出已经分好类的训练集,在该训练集上运用数据挖掘分类的技术,建立分类模型,对于没有分类的数据进行分类的分析方法. 分类问题的应用场景:分 ...
基本分类方法——KNN(K近邻)算法
在这篇文章 http://www.cnblogs.com/charlesblc/p/6193867.html 讲SVM的过程中,提到了KNN算法.有点熟悉,上网一查,居然就是K近邻算法,机器学习的入门 ...
【数据挖掘】分类之kNN（转载）
[数据挖掘]分类之kNN 1.算法简介 kNN的思想很简单:计算待分类的数据点与训练集所有样本点,取距离最近的k个样本:统计这k个样本的类别数量:根据多数表决方案,取数量最多的那一类作为待测样本的类别 ...
KNN(k-nearest neighbor的缩写)又叫最近邻算法
KNN(k-nearest neighbor的缩写)又叫最近邻算法机器学习笔记--KNN算法1 前言 Hello ,everyone. 我是小花.大四毕业,留在学校有点事情,就在这里和大家吹吹我们的 ...
Atitit 贝叶斯算法的原理以及垃圾邮件分类的原理
Atitit 贝叶斯算法的原理以及垃圾邮件分类的原理 1.1. 最开始的垃圾邮件判断方法,使用contain包含判断,只能一个关键词,而且100%概率判断1 1.2. 元件部件串联定律1 1.3. 垃 ...

随机推荐

深入JavaScript之获取cookie以及删除cookie
cookie存在哪? 存在document.cookie中 ookie长啥样? cookie是一个字符串,长下面这样:“name=xxx; age=22;” 注意:分号后面有个空格,记住这一点,下面的 ...
Node.JS-经典教程
目录 1. 下载地址 2. 目录 1. 下载地址 https://www.cnblogs.com/coco56/p/11223189.html 在视频教程那里 2. 目录 00课件.rar 01.历史 ...
Linux架构之Nginx 负载均衡会话保持
案例No.50:Nginx负载均衡会话保持前期准备环境 web01.web02 (web01.web02.db01.nfs01都要优化基本源)[root@web01 ~]# vim /etc/yum ...
[Tyvj1423]GF和猫咪的玩具（最短路）
[Tyvj1423]GF和猫咪的玩具题目描述 GF同学和猫咪得到了一个特别的玩具,这个玩具由n个金属环(编号为1---n),和m条绳索组成,每条绳索连接两个不同的金属环,并且长度相同.GF左手拿起金 ...
ELK windows下部署测试
操作系统 win7 (当时想在linux下部署,虚拟内存过小,转而在windows下) 版本说明 elasticsearch-6.6.2 (elasticsearch-head-master插件) ...
php session生存周期
今天在我的微博(Laruence)上发出一个问题: 我在面试的时候, 经常会问一个问题: “如何设置一个30分钟过期的Session?”, 大家不要觉得看似简单, 这里面包含的知识挺多, 特别适合考察 ...
Xcode出现报错，但是没有给出详细信息，可以看这里
Xcode出现报错,"Xcode build:clang: error: linker command failed with exit code 1 (use -v to..." ...
【HDOJ6685】Rikka with Coin（DP）
题意:有10,20,30,100四种硬币,每种数量无限,给定n个a[i],问能组成所有a[i]的硬币的最小总数量 n<=1e2,a[i]<=1e9 思路: #include<bits ...
H700关闭Direct PD Mapping
Attached Enclosure doesn't support in controller's Direct mapping modePlease contact your system sup ...
Prefix
Prefix 南昌邀请赛的题,字典树 #include<bits/stdc++.h> using namespace std; typedef long long ll; ll A[]; ...

knn原理及借助电影分类实现knn算法

KNN最近邻算法原理

knn原理及借助电影分类实现knn算法的更多相关文章

随机推荐

热门专题