Logistic回归的使用和缺失值的处理

从疝气病预测病马的死亡率

数据集：

UCI上的数据，368个样本，28个特征

测试方法：

交叉测试

实现细节：

1.数据中因为存在缺失值所以要进行预处理，这点待会再单独谈
2.数据中本来有三个标签，这里为了简单直接将未能存活和安乐死合并了
3.代码中计算10次求均值

缺失值的处理：

一般来说有这么几种方法处理缺失值：

人工填写缺失值
使用全局变量填充缺失值
忽略有缺失值的样本
使用属性的中心度量（均值或中位数等）填充缺失值
使用与给定元祖同一类的所有样本的属性均值或中位数
使用最可能的值（需要机器学习算法推到）
对不同的数据我们要采用不同的方法，这里考虑到我们用Logistic回归那么我们可以采用0填充，因为用0在更新weight = weight + alpha * error * dataMatrix[randIndex]的时候不会产生更新，并且sigmoid（0）=0.5，他对结果也不会产生影响。

 #coding=utf-8

 from numpy import *

 def loadDataSet():

     dataMat = []

     labelMat = []

     fr = open('testSet.txt')

     for line in fr.readlines():

         lineArr = line.strip().split()

         dataMat.append([1.0, float(lineArr[0]), float(lineArr[1])])

         labelMat.append(int(lineArr[2]))

     return dataMat, labelMat

 def sigmoid(inX):

     return 1.0/(1+exp(-inX))

 def stocGradAscent1(dataMatrix, classLabels, numIter=150):

     m,n = shape(dataMatrix)

     #alpha = 0.001

     weight = ones(n)

     for j in range(numIter):

         dataIndex = range(m)

         for i in range(m):

             alpha = 4/ (1.0+j+i) +0.01

             randIndex = int(random.uniform(0,len(dataIndex)))

             h = sigmoid(sum(dataMatrix[randIndex]*weight))

             error = classLabels[randIndex] - h

             weight = weight + alpha * error * dataMatrix[randIndex]

             del(dataIndex[randIndex])

     return weight

 def classifyVector(inX, weights):

     prob = sigmoid(sum(inX*weights))

     if prob > 0.5: return 1.0

     else: return 0.0

 def colicTest():

     frTrain = open('horseColicTraining.txt'); frTest = open('horseColicTest.txt')

     trainingSet = []; trainingLabels = []

     for line in frTrain.readlines():

         currLine = line.strip().split('\t')

         lineArr =[]

         for i in range(21):

             lineArr.append(float(currLine[i]))

         trainingSet.append(lineArr)

         trainingLabels.append(float(currLine[21]))

     trainWeights = stocGradAscent1(array(trainingSet), trainingLabels, 1000)

     errorCount = 0; numTestVec = 0.0

     for line in frTest.readlines():

         numTestVec += 1.0

         currLine = line.strip().split('\t')

         lineArr =[]

         for i in range(21):

             lineArr.append(float(currLine[i]))

         if int(classifyVector(array(lineArr), trainWeights))!= int(currLine[21]):

             errorCount += 1

     errorRate = (float(errorCount)/numTestVec)

     print "the error rate of this test is: %f" % errorRate

     return errorRate

 def multiTest():

     numTests = 10; errorSum=0.0

     for k in range(numTests):

         errorSum += colicTest()

     print "after %d iterations the average error rate is: %f" % (numTests, errorSum/float(numTests))

 def main():

     multiTest()

 if __name__ == '__main__':

     main()

机器学习笔记索引

来自为知笔记(Wiz)

Logistic回归的使用的更多相关文章

神经网络、logistic回归等分类算法简单实现
最近在github上看到一个很有趣的项目,通过文本训练可以让计算机写出特定风格的文章,有人就专门写了一个小项目生成汪峰风格的歌词.看完后有一些自己的小想法,也想做一个玩儿一玩儿.用到的原理是深度学习里 ...
机器学习——Logistic回归
1.基于Logistic回归和Sigmoid函数的分类 2.基于最优化方法的最佳回归系数确定 2.1 梯度上升法参考:机器学习--梯度下降算法 2.2 训练算法:使用梯度上升找到最佳参数 Logis ...
logistic回归
logistic回归回归就是对已知公式的未知参数进行估计.比如已知公式是$y = a*x + b$,未知参数是a和b,利用多真实的(x,y)训练数据对a和b的取值去自动估计.估计的方法是在给定训练样 ...
Logistic回归 python实现
Logistic回归算法优缺点: 1.计算代价不高,易于理解和实现2.容易欠拟合,分类精度可能不高3.适用数据类型:数值型和标称型算法思想: 其实就我的理解来说,logistic回归实际上就是加了 ...
如何在R语言中使用Logistic回归模型
在日常学习或工作中经常会使用线性回归模型对某一事物进行预测,例如预测房价.身高.GDP.学生成绩等,发现这些被预测的变量都属于连续型变量.然而有些情况下,被预测变量可能是二元变量,即成功或失败.流失或 ...
SPSS数据分析—配对Logistic回归模型
Lofistic回归模型也可以用于配对资料,但是其分析方法和操作方法均与之前介绍的不同,具体表现在以下几个方面1.每个配对组共有同一个回归参数,也就是说协变量在不同配对组中的作用相同2.常数项随着配 ...
SPSS数据分析—多分类Logistic回归模型
前面我们说过二分类Logistic回归模型,但分类变量并不只是二分类一种,还有多分类,本次我们介绍当因变量为多分类时的Logistic回归模型. 多分类Logistic回归模型又分为有序多分类Logi ...
SPSS数据分析—二分类Logistic回归模型
对于分类变量,我们知道通常使用卡方检验,但卡方检验仅能分析因素的作用,无法继续分析其作用大小和方向,并且当因素水平过多时,单元格被划分的越来越细,频数有可能为0,导致结果不准确,最重要的是卡方检验不能 ...
Logistic回归分类算法原理分析与代码实现
前言本文将介绍机器学习分类算法中的Logistic回归分类算法并给出伪代码,Python代码实现. (说明:从本文开始,将接触到最优化算法相关的学习.旨在将这些最优化的算法用于训练出一个非线性的函数 ...

随机推荐

【BZOJ-2669】局部极小值状压DP + 容斥原理
2669: [cqoi2012]局部极小值 Time Limit: 3 Sec Memory Limit: 128 MBSubmit: 561 Solved: 293[Submit][Status ...
【bzoj1059】 ZJOI2007—矩阵游戏
http://www.lydsy.com/JudgeOnline/problem.php?id=1059 (题目链接) 题意一个01矩阵,可以任意交换两行或两列,问能否经过若干次交换后使主对角线全为 ...
Java Web的web.xml文件作用及基本配置（转）
其实web.xml就是asp.net的web.config一个道理. 说明: 一个web中完全可以没有web.xml文件,也就是说,web.xml文件并不是web工程必须的. web.xml文件是用来 ...
edit界面初始化加默认值
功能名称:modelCreateAction 切入类型:after 事件名称:com.kingdee.bos.eventbus.event.model.ModelCreateEvent package ...
SQL Server数据库常用函数
好久没学习新知识了.今天学了下sql的一些常用语句.人还是需要不断学习进步的否则只能停滞不前. 先从最简单的一句开始说起吧. select *from 表名这里*的含义表示了表的各字段,以逗号隔 ...
<<< eclipse软件部署修改项目的访问地址
在eclipse开发javaweb项目的时候,访问项目时需要在浏览器地址输入:localhost:8080/项目名但是大多数部署到服务器的时候访问的是根目录,就是不加localhost:8080后 ...
如何接触学习java
信息科技必将是未来的潮流,Java语言必将在时代的进步中发挥不可估量的作用,未来,掌握好一门实用而且有良好应用前景的技术是你们的首要任务. 零基础怎么学Java 多年Java教育培训经验事实表明,零基 ...
javaweb学习总结(五)——Servlet开发(一)
一.Servlet简介 Servlet是sun公司提供的一门用于开发动态web资源的技术. Sun公司在其API中提供了一个servlet接口,用户若想用发一个动态web资源(即开发一个Java程序向 ...
2012-2013 ACM-ICPC Northeastern European Regional Contest (NEERC 12)
Problems # Name A Addictive Bubbles1 addictive.in / addictive.out 2 s, 256 MB x438 B Blin ...
tyvj1102 单词的划分
描述有一个很长的由小写字母组成字符串.为了便于对这个字符串进行分析,需要将它划分成若干个部分,每个部分称为一个单词.出于减少分析量的目的,我们希望划分出的单词数越少越好.你就是来完成这一划分工作的. ...

Logistic回归的使用

Logistic回归的使用和缺失值的处理

从疝气病预测病马的死亡率

数据集：

测试方法：

实现细节：

缺失值的处理：

机器学习笔记索引

Logistic回归的使用的更多相关文章

随机推荐

热门专题