【机器学习学习】SKlearn + XGBoost 预测 Titanic 乘客幸存

Titanic 数据集是从 kaggle下载的，下载地址：https://www.kaggle.com/c/titanic/data

数据一共又3个文件，分别是：train.csv,test.csv,gender_submission.csv

先把需要视同的库导入：

import os

import datetime

import operator

import numpy as np

import pandas as pd

import xgboost as xgb

from sklearn.model_selection import train_test_split

from sklearn.preprocessing import Imputer, scale

import matplotlib.pyplot as plt

　np.random.seed(19260817) # 设置一下种子，看一下博客园有没有能看懂的

不管是做机器学习，还是深度学习，还是其他的先确定是 分类问题还是回归问题，当然这两个可以互相转换的，然后拿到数据第一步肯定是先观察数据，数据是否又缺失，乱码等。

这个看一下就知道是否存活，存活是1，否则 0 ，那么就是分类！

1，观察下数据

先观察一下数据，使用pandas读取数据：

DataFrame.head(n=5)：head 方法默认取5行数据，你可以自己随便传参数，我只去10行观察下看下

    pd_train = pd.read_csv('./data/titanic/train.csv')

    pd_test = pd.read_csv('./data/titanic/test.csv')

    pd_gender = pd.read_csv('./data/titanic/gender_submission.csv')

    print(pd_train.shape, pd_test.shape)

    print(pd_train.head(10))

根据观察可以看到，数据有数值类型，也有字符类型，数值类型我们称作连续变量，字符类型我们称作分类变量，连续变量是不用转换的，而分类变量是需要转成连续变量的，否则，无法运算。
还可以看到有些数据是缺失的，这部分缺失值我们也需要处理，填充或者删除

2，特征工程

　　根据第一步观察到的结果，我们对数据做处理。

　　1）将性别 Sex 列，做数值转换处理，代码如下：

    # 性别 将性别字段Sex中的值 female用0，male用1代替,类型 int

    pd_train['Sex'] = pd_train['Sex'].map({'female': 0, 'male': 1}).astype(int)

    pd_test['Sex'] = pd_test['Sex'].map({'female': 0, 'male': 1}).astype(int)

　　2）将分类变量转换位连续变量。我们使用 sklearn 库下面的 LabelEncoder() 来处理

    # 将类型变量转换位连续变量

    for f in pd_train.columns:

        if pd_train[f].dtype == 'object':

            label = LabelEncoder()

            label.fit(list(pd_train[f].values))

            pd_train[f] = label.transform(list(pd_train[f].values))

    for f in pd_test.columns:

        if pd_test[f].dtype == 'object':

            label = LabelEncoder()

            label.fit(list(pd_test[f].values))

            pd_test[f] = label.transform(list(pd_test[f].values))

　　3）统计缺失的列那些，观察缺失值有多少，再决定是删除，还是填充，如果某列值的缺失严重，那就没必要填充了，直接删除。

　　我们采用填充的方式，使用 Imputer类来处理缺失值，这个类提供了估算缺失值的基本策略，使用缺失值所在的行/列中的平均值、中位数或者众数来填充。这个类也支持不同的缺失值编码。

   # 统计缺失的列

    na_train = pd_train.isnull().sum().sort_values(ascending=False)

    print(na_train)

    # 使用均值填充缺失值

    train_data= pd_train.values

    imput = Imputer(missing_values="NaN", strategy="mean", axis=0)

    imput = imput.fit(train_data)

    train_data = imput.fit_transform(train_data)

    # 使用均值填充缺失值

    test_data= pd_test.values

    imput = Imputer(missing_values="NaN", strategy="mean", axis=0)

    imput = imput.fit(test_data)

    test_data = imput.fit_transform(test_data)

3，训练

　　经过对特征的处理，我们可以训练模型可，我使用了三个模型分别是，LogisticRegression，RandomForest，XGBClassifier

　　监督学习的模型都一样，必须拟合（fit）两个矩阵（数组），训练样本的矩阵 X，大小为 [n_samples, n_features]，和训练样本目标值（标签）的数组 Y，大小为 [n_samples]:

　　1）LogisticRegression ：逻辑回归，虽然名字叫回归，但是个分类模型

def train_logreistic():

    """

    逻辑回归

    """

    X_train, X_test, y_train, y_test = load_data()

    model = LogisticRegression(penalty='l2')

    model.fit(X_train, y_train)

    y_pred = model.predict(X_test)

    rfc_rate, rmse = calc_accuracy(y_pred, y_test)

    total = total_survival(y_pred)

    print("LogisticRegression acc_rate：{0:.4f},RMS:{1:.4f},存活：{2}".format( rfc_rate, rmse, total))

    return rfc_rate, rmse, total

　　2）RandomForest：随机森林，基于树的模型，通过在分类器构造过程中引入随机性来创建一组不同的分类器。

def train_randomForster():

    X_train, X_test, y_train, y_test = load_data()

    model = RandomForestClassifier(n_estimators=300,max_depth=12,random_state=7)

    model.fit(X_train,y_train)

    y_pred = model.predict(X_test)

    rfc_rate, rmse = calc_accuracy(y_pred, y_test)

    total = total_survival(y_pred)

    print("RandomForestClassifier acc_rate：{0:.4f},RMS:{1:.4f},存活：{2}".format(rfc_rate, rmse, total))

    return rfc_rate, rmse, total

　　3）XGBClassifier ：大规模并行boosted tree的工具,它是目前最快最好的开源boosted tree工具包,比常见的工具包快10倍以上，kaggle 比赛的神器

def train_XGBoost():

    X_train, X_test, y_train, y_test = load_data()

    model = xgb.XGBClassifier(max_delta_step=6, learning_rate=0.1, n_estimators=100, objective="binary:logistic",silent=True)

    eval_data = [(X_test, y_test)]

    model.fit(X_train, y_train, eval_set=eval_data, early_stopping_rounds=30)

    y_pred = model.predict(X_test)

    rfc_rate, rmse = calc_accuracy(y_pred, y_test)

    total = total_survival(y_pred)

    print("XGBClassifier acc_rate：{0:.4f},RMS:{1:.4f},存活：{2}".format(rfc_rate, rmse, total))

    return rfc_rate, rmse, total

4，预测

　　model.predict(X_test) 都在里面写了，我就不说了。

　　三个模型最后的结果：

def train():

    lg_rate, lg_rmse, lg_total = train_logreistic()

    rf_rate, rf_rmse, rf_total = train_randomForster()

    xg_rate, xg_rmse, xg_total = train_XGBoost()

    print("LogisticRegression acc_rate：{0:.4f},RMS:{1:.4f},存活：{2}".format( lg_rate, lg_rmse, lg_total))

    print("RandomForestClassifier acc_rate：{0:.4f},RMS:{1:.4f},存活：{2}".format(rf_rate, rf_rmse, rf_total))

    print("XGBClassifier acc_rate：{0:.4f},RMS:{1:.4f},存活：{2}".format(xg_rate, xg_rmse, xg_total))

XGBClassifier acc_rate：80.4469,RMS:0.4422,存活：56

LogisticRegression acc_rate：74.8603,RMS:0.5014,存活：60

RandomForestClassifier acc_rate：82.6816,RMS:0.4162,存活：54

XGBClassifier acc_rate：80.4469,RMS:0.4422,存活：56

好了，至于怎么调参，网格搜索我就不写了，简单的分析就完成了。。

参考：

1) http://xgboost.readthedocs.io/en/latest/

2) http://scikit-learn.org/stable/

3) https://www.kaggle.com/

源码地址：https://github.com/jarvisqi/machine_learning/blob/master/ml_xgboost/titanic.py

【机器学习学习】SKlearn + XGBoost 预测 Titanic 乘客幸存的更多相关文章

【机器学习】SKlearn + XGBoost 预测 Titanic 乘客幸存
Titanic 数据集是从 kaggle下载的,下载地址:https://www.kaggle.com/c/titanic/data 数据一共又3个文件,分别是:train.csv,test.csv, ...
机器学习总结-sklearn参数解释
本文转自:lytforgood 机器学习总结-sklearn参数解释实验数据集选取: 1分类数据选取 load_iris 鸢尾花数据集 from sklearn.datasets import lo ...
R语言与机器学习学习笔记
人工神经网络(ANN),简称神经网络,是一种模仿生物神经网络的结构和功能的数学模型或计算模型.神经网络由大量的人工神经元联结进行计算.大多数情况下人工神经网络能在外界信息的基础上改变内部结构,是一种自 ...
[ML学习笔记] XGBoost算法
[ML学习笔记] XGBoost算法回归树决策树可用于分类和回归,分类的结果是离散值(类别),回归的结果是连续值(数值),但本质都是特征(feature)到结果/标签(label)之间的映射. 这 ...
使用pmml跨平台部署机器学习模型Demo——房价预测
基于房价数据,在python中训练得到一个线性回归的模型,在JavaWeb中加载模型完成房价预测的功能. 一. 训练.保存模型工具:PyCharm-2017.Python-39.sklearn2 ...
Python机器学习库sklearn的安装
Python机器学习库sklearn的安装 scikit-learn是Python的一个开源机器学习模块,它建立在NumPy,SciPy和matplotlib模块之上能够为用户提供各种机器学习算法接口 ...
机器学习-学习笔记(二) --> 模型评估与选择
目录一.经验误差与过拟合二.评估方法模型评估方法 1. 留出法(hold-out) 2. 交叉验证法(cross validation) 3. 自助法(bootstrapping) 调参(par ...
机器学习之路: python 决策树分类DecisionTreeClassifier 预测泰坦尼克号乘客是否幸存
使用python3 学习了决策树分类器的api 涉及到特征的提取,数据类型保留,分类类型抽取出来新的类型需要网上下载数据集,我把他们下载到了本地, 可以到我的git下载代码和数据集: https: ...
【机器学习】集成学习之xgboost的sklearn版XGBClassifier使用教程
XGBClassifier是xgboost的sklearn版本.代码完整的展示了使用xgboost建立模型的过程,并比较xgboost和randomForest的性能. # -*- coding: u ...

随机推荐

Python：list 和 array的对比以及转换时的注意事项
Python:list 和 array的对比以及转换时的注意事项 zoerywzhou@163.com http://www.cnblogs.com/swje/ 作者:Zhouwan 2017-6-4 ...
svn协同开发下的dll版本管理最佳实践
作为一名开发人员,常常碰到的一个问题是,当使用svn签出一份最新代码时,经常不能一次编译通过,导致花费大量时间去解决编译问题,这里碰到的问题一般可以分为三类: 1. 由于提交代码的开发人员失误,忘记提 ...
ES6作用域和解构赋值
ES6 强制开启严格模式作用域 var 声明局部变量,for/if花括号中定义的变量在花括号外也可访问 let 声明的变量为块作用域,变量不可重复定义 const 声明常量,块作用域,声明时必须赋值 ...
APP安全--网络传输安全 AES/RSA/ECC/MD5/SHA
移动端App安全如果按CS结构来划分的话,主要涉及客户端本身数据安全,Client到Server网络传输的安全,客户端本身安全又包括代码安全和数据存储安全.所以当我们谈论App安全问题的时候一般来说在 ...
【Zookeeper】源码分析之服务器（五）之ObserverZooKeeperServer
一.前言前面分析了FollowerZooKeeperServer,接着分析ObserverZooKeeperServer. 二.ObserverZooKeeperServer源码分析 2.1 类的继 ...
C 函数参数 char **s与char *s[]
本文同时发表在https://github.com/zhangyachen/zhangyachen.github.io/issues/126 先来看一个小例子 : 编写函数遍历一个整型数组的元素,数组 ...
写给小白的JAVA链接MySQL数据库的步骤(JDBC):
作为复习总结的笔记,我罗列了几个jdbc步骤,后边举个简单的例子,其中的try块请读者自行处理. /* * 1.下载驱动包:com.mysql.jdbc.Driver;网上很多下载资源,自己找度娘,此 ...
lesson - 10 课程笔记
CTRL+C CTRL+D :前者用于结束一个程序,后者用于结束终端输入. --符号 *:匹配任意长度的任意字符 ?:匹配任意一个字符 #: shell 中表注释 \: 脱意符号 []:任意属于字符组 ...
Linux(CentOS6.5)下编译安装PHP5.6.22时报错”configure: error: ZLIB extension requires gzgets in zlib”的解决方式(确定已经编译安装Zlib，并已经指定Zlib路径)
本文地址http://comexchan.cnblogs.com/,作者Comex Chan,尊重知识产权,转载请注明出处,谢谢! 今天在CentOS6.5下编译安装PHP时,一直报错 confi ...
java 实现的c当中的几道题
package javastudy; /* * 利用条件运算符的嵌套来完成此题:学习成绩>=90分的同学用A表示,60-89分之间的用B表示, 60分以下的用C表示. */ import jav ...

【机器学习学习】SKlearn + XGBoost 预测 Titanic 乘客幸存

【机器学习学习】SKlearn + XGBoost 预测 Titanic 乘客幸存的更多相关文章

随机推荐

热门专题