matlab练习程序（k-means聚类）

聚类算法，不是分类算法。

分类算法是给一个数据，然后判断这个数据属于已分好的类中的具体哪一类。

聚类算法是给一大堆原始数据，然后通过算法将其中具有相似特征的数据聚为一类。

这里的k-means聚类，是事先给出原始数据所含的类数，然后将含有相似特征的数据聚为一个类中。

所有资料中还是Andrew Ng介绍的明白。

首先给出原始数据{x1,x2,...,xn}，这些数据没有被标记的。

初始化k个随机数据u1,u2,...,uk。这些xn和uk都是向量。

根据下面两个公式迭代就能求出最终所有的u,这些u就是最终所有类的中心位置。

公式一：

意思就是求出所有数据和初始化的随机数据的距离，然后找出距离每个初始数据最近的数据。

公式二：

意思就是求出所有和这个初始数据最近原始数据的距离的均值。

然后不断迭代两个公式，直到所有的u都不怎么变化了，就算完成了。

先看看一些结果：

用三个二维高斯分布数据画出的图：

通过对没有标记的原始数据进行kmeans聚类得到的分类，十字是最终迭代位置：

下面是Matlab代码，这里我把测试数据改为了三维了，函数是可以处理各种维度的。

main.m

clear all;

close all;

clc;

%第一类数据

mu1=[0 0 0];  %均值

S1=[0.3 0 0;0 0.35 0;0 0 0.3];  %协方差

data1=mvnrnd(mu1,S1,100);   %产生高斯分布数据

%%第二类数据

mu2=[1.25 1.25 1.25];

S2=[0.3 0 0;0 0.35 0;0 0 0.3];

data2=mvnrnd(mu2,S2,100);

%第三个类数据

mu3=[-1.25 1.25 -1.25];

S3=[0.3 0 0;0 0.35 0;0 0 0.3];

data3=mvnrnd(mu3,S3,100);

%显示数据

plot3(data1(:,1),data1(:,2),data1(:,3),'+');

hold on;

plot3(data2(:,1),data2(:,2),data2(:,3),'r+');

plot3(data3(:,1),data3(:,2),data3(:,3),'g+');

grid on;

%三类数据合成一个不带标号的数据类

data=[data1;data2;data3];   %这里的data是不带标号的

%k-means聚类

[u re]=KMeans(data,3);  %最后产生带标号的数据，标号在所有数据的最后，意思就是数据再加一维度

[m n]=size(re);

%最后显示聚类后的数据

figure;

hold on;

for i=1:m

    if re(i,4)==1

         plot3(re(i,1),re(i,2),re(i,3),'ro');

    elseif re(i,4)==2

         plot3(re(i,1),re(i,2),re(i,3),'go');

    else

         plot3(re(i,1),re(i,2),re(i,3),'bo');

    end

end

grid on;

KMeans.m

%N是数据一共分多少类

%data是输入的不带分类标号的数据

%u是每一类的中心

%re是返回的带分类标号的数据

function [u re]=KMeans(data,N)

    [m n]=size(data);   %m是数据个数，n是数据维数

    ma=zeros(n);        %每一维最大的数

    mi=zeros(n);        %每一维最小的数

    u=zeros(N,n);       %随机初始化，最终迭代到每一类的中心位置

    for i=1:n

       ma(i)=max(data(:,i));    %每一维最大的数

       mi(i)=min(data(:,i));    %每一维最小的数

       for j=1:N

            u(j,i)=ma(i)+(mi(i)-ma(i))*rand();  %随机初始化，不过还是在每一维[min max]中初始化好些

       end

    end

    while 1

        pre_u=u;            %上一次求得的中心位置

        for i=1:N

            tmp{i}=[];      % 公式一中的x(i)-uj,为公式一实现做准备

            for j=1:m

                tmp{i}=[tmp{i};data(j,:)-u(i,:)];

            end

        end

        quan=zeros(m,N);

        for i=1:m        %公式一的实现

            c=[];

            for j=1:N

                c=[c norm(tmp{j}(i,:))];

            end

            [junk index]=min(c);

            quan(i,index)=norm(tmp{index}(i,:));

        end

        for i=1:N            %公式二的实现

           for j=1:n

                u(i,j)=sum(quan(:,i).*data(:,j))/sum(quan(:,i));

           end

        end

        if norm(pre_u-u)<0.1  %不断迭代直到位置不再变化

            break;

        end

    end

    re=[];

    for i=1:m

        tmp=[];

        for j=1:N

            tmp=[tmp norm(data(i,:)-u(j,:))];

        end

        [junk index]=min(tmp);

        re=[re;data(i,:) index];

    end

end

转载自：http://www.cnblogs.com/tiandsp/archive/2013/04/24/3040883.html

matlab练习程序（k-means聚类）的更多相关文章

【转】算法杂货铺——k均值聚类(K-means)
k均值聚类(K-means) 4.1.摘要在前面的文章中,介绍了三种常见的分类算法.分类作为一种监督学习方法,要求必须事先明确知道各个类别的信息,并且断言所有待分类项都有一个类别与之对应.但是很多时 ...
5-Spark高级数据分析-第五章基于K均值聚类的网络流量异常检测
据我们所知,有‘已知的已知’,有些事,我们知道我们知道:我们也知道,有 ‘已知的未知’,也就是说,有些事,我们现在知道我们不知道.但是,同样存在‘不知的不知’——有些事,我们不知道我们不知道. 上一章 ...
matlab练习程序（SUSAN检测）
matlab练习程序(SUSAN检测) SUSAN算子既可以检测角点也可以检测边缘,不过角点似乎比不过harris,边缘似乎比不过Canny.不过思想还是有点意思的. 主要思想就是:首先做一个和原图像 ...
（ZT）算法杂货铺——k均值聚类(K-means)
https://www.cnblogs.com/leoo2sk/category/273456.html 4.1.摘要在前面的文章中,介绍了三种常见的分类算法.分类作为一种监督学习方法,要求必须事先 ...
ML: 聚类算法-K均值聚类
基于划分方法聚类算法R包: K-均值聚类(K-means) stats::kmeans().fpc::kmeansruns() K-中心点聚类(K-Medoids) ...
k均值聚类算法原理和（TensorFlow）实现
顾名思义,k均值聚类是一种对数据进行聚类的技术,即将数据分割成指定数量的几个类,揭示数据的内在性质及规律. 我们知道,在机器学习中,有三种不同的学习模式:监督学习.无监督学习和强化学习: 监督学习,也 ...
SciPy k均值聚类
章节 SciPy 介绍 SciPy 安装 SciPy 基础功能 SciPy 特殊函数 SciPy k均值聚类 SciPy 常量 SciPy fftpack(傅里叶变换) SciPy 积分 SciPy ...
机器学习实战5：k-means聚类：二分k均值聚类+地理位置聚簇实例
k-均值聚类是非监督学习的一种,输入必须指定聚簇中心个数k.k均值是基于相似度的聚类,为没有标签的一簇实例分为一类. 一经典的k-均值聚类思路: 1 随机创建k个质心(k必须指定,二维的很容易确定 ...
Python实现kMeans(k均值聚类)
Python实现kMeans(k均值聚类) 运行环境 Pyhton3 numpy(科学计算包) matplotlib(画图所需,不画图可不必) 计算过程 st=>start: 开始 e=> ...

随机推荐

net npoi将List<实体>导出excel的最简单方法
只是临时导数据用的.方便.最基本的方法, [HttpGet] [Route("ExportEnterprise")] public BaseResponse ExportEnter ...
ReactiveCocoa(II)
RAC类关系图: RAC 信号源: 需要导入的头文件: import ReactiveCocoa import Result import ReactiveSwift 冷信号 //1.冷信号 let ...
Spark学习之路（五）Spark伪分布式安装
一.JDK的安装 JDK使用root用户安装 1.1 上传安装包并解压 [root@hadoop1 soft]# tar -zxvf jdk-8u73-linux-x64.tar.gz -C /usr ...
理解本真的 REST 架构风格
1. http://kb.cnblogs.com/page/186516/ 2. http://www.infoq.com/cn/articles/rest-introduction 3. http: ...
python复习冒泡排序
冒泡排序: 思路: 先找到最大值放到最右边: #encoding=utf-8 a=[1,9,2,8,3,6,4] print "a before change:",a for i ...
Linux基础命令---添加用户useradd
useradd 创建新的系统用户,useradd指令只能以管理员的身份运行,创建的用户都在“/etc/passwd”文件中.当不加-D参数,useradd指令使用命令列来指定新帐号的设定值and使用系 ...
常用正则表达式爬取网页信息及HTML分析总结
Python爬取网页信息时,经常使用的正则表达式及方法. 1.获取<tr></tr>标签之间内容 2.获取<a href..></a>超链接之间内容 3 ...
jpg、gif、png-8、png-24的区别
一.gif格式的特点 1.透明性.gif是一种布尔透明类型,即它可以是全透明,也可以是全不透明,但是没有半透明 2.动画.gif支持动画 3.无损耗性.gif是一种无损耗的图像格式,这意味着你可以对g ...
ads查询结果中文显示方框问题
刚安装aqua data studio查询结果中文会变成小方框选择File -->Options 找到General -->Appearance,把Editor Font , Text ...
建议使用nginx配合uwsgi,
试试gunicorn+supervisor+nginx. gunicorn是Python实现的的Web server,配置也比较简单. supervisor也是Python实现的,它用于进程管理. 这 ...

matlab练习程序（k-means聚类）

matlab练习程序（k-means聚类）的更多相关文章

随机推荐

热门专题