一、关于spark ml pipeline与机器学习
一个典型的机器学习构建包含若干个过程
1、源数据ETL
2、数据预处理
3、特征选取
4、模型训练与验证
以上四个步骤可以抽象为一个包括多个步骤的流水线式工作,从数据收集开始至输出我们需要的最终结果。因此,对以上多个步骤、进行抽象建模,简化为流水线式工作流程则存在着可行性,对利用spark进行机器学习的用户来说,流水线式机器学习比单个步骤独立建模更加高效、易用。
受 scikit-learn 项目的启发,并且总结了MLlib在处理复杂机器学习问题的弊端(主要为工作繁杂,流程不清晰),旨在向用户提供基于DataFrame 之上的更加高层次的 API 库,以更加方便的构建复杂的机器学习工作流式应用。一个pipeline 在结构上会包含一个或多个Stage,每一个 Stage 都会完成一个任务,如数据集处理转化,模型训练,参数设置或数据预测等,这样的Stage 在 ML 里按照处理问题类型的不同都有相应的定义和实现。两个主要的stage为Transformer和Estimator。Transformer主要是用来操作一个DataFrame 数据并生成另外一个DataFrame 数据,比如svm模型、一个特征提取工具,都可以抽象为一个Transformer。Estimator 则主要是用来做模型拟合用的,用来生成一个Transformer。可能这样说比较难以理解,下面就以一个完整的机器学习案例来说明spark ml pipeline是怎么构建机器学习工作流的。

二、使用spark ml pipeline构建机器学习工作流
在此以Kaggle数据竞赛Display Advertising Challenge的数据集(该数据集为利用用户特征进行广告点击预测)开始,利用spark ml pipeline构建一个完整的机器学习工作流程。
Display Advertising Challenge的这份数据本身就不多做介绍了,主要包括3部分,numerical型特征集、Categorical类型特征集、类标签。

首先,读入样本集,并将样本集划分为训练集与测试集:

  1. //使用file标记文件路径,允许spark读取本地文件
  2. String fileReadPath = "file:\\D:\\dac_sample\\dac_sample.txt";
  3. //使用textFile读入数据
  4. SparkContext sc = Contexts.sparkContext;
  5. RDD<String> file = sc.textFile(fileReadPath,);
  6. JavaRDD<String> sparkContent = file.toJavaRDD();
  7. JavaRDD<Row> sampleRow = sparkContent.map(new Function<String, Row>() {
  8. public Row call(String string) {
  9. String tempStr = string.replace("\t",",");
  10. String[] features = tempStr.split(",");
  11. int intLable= Integer.parseInt(features[]);
  12. String intFeature1 = features[];
  13. String intFeature2 = features[];
              String CatFeature1 = features[];
  14. String CatFeature2 = features[];
  15. return RowFactory.create(intLable, intFeature1, intFeature2, CatFeature1, CatFeature2);
  16. }
  17. });
  18.  
  19. double[] weights = {0.8, 0.2};
  20. Long seed = 42L;
  21. JavaRDD<Row>[] sampleRows = sampleRow.randomSplit(weights,seed);

得到样本集后,构建出 DataFrame格式的数据供spark ml pipeline使用:

  1. List<StructField> fields = new ArrayList<StructField>();
  2. fields.add(DataTypes.createStructField("lable", DataTypes.IntegerType, false));
  3. fields.add(DataTypes.createStructField("intFeature1", DataTypes.StringType, true));
  4. fields.add(DataTypes.createStructField("intFeature2", DataTypes.StringType, true));
  5. fields.add(DataTypes.createStructField("CatFeature1", DataTypes.StringType, true));
  6. fields.add(DataTypes.createStructField("CatFeature2", DataTypes.StringType, true));
  7. //and so on
  8.  
  9. StructType schema = DataTypes.createStructType(fields);
  10. DataFrame dfTrain = Contexts.hiveContext.createDataFrame(sampleRows[], schema);//训练数据
  11. dfTrain.registerTempTable("tmpTable1");
  12. DataFrame dfTest = Contexts.hiveContext.createDataFrame(sampleRows[], schema);//测试数据
  13. dfTest.registerTempTable("tmpTable2");

由于在dfTrain、dfTest中所有的特征目前都为string类型,而机器学习则要求其特征为numerical类型,在此需要对特征做转换,包括类型转换和缺失值的处理。
首先,将intFeature由string转为double,cast()方法将表中指定列string类型转换为double类型,并生成新列并命名为intFeature1Temp,
之后,需要删除原来的数据列 并将新列重命名为intFeature1,这样,就将string类型的特征转换得到double类型的特征了。

  1. //Cast integer features from String to Double
  2. dfTest = dfTest.withColumn("intFeature1Temp",dfTest.col("intFeature1").cast("double"));
  3. dfTest = dfTest.drop("intFeature1").withColumnRenamed("intFeature1Temp","intFeature1");

如果intFeature特征是年龄或者特征等类型,则需要进行分箱操作,将一个特征按照指定范围进行划分:

  1. /*特征转换,部分特征需要进行分箱,比如年龄,进行分段成成年未成年等 */
  2. double[] splitV = {0.0,16.0,Double.MAX_VALUE};
  3. Bucketizer bucketizer = new Bucketizer().setInputCol("").setOutputCol("").setSplits(splitV);

再次,需要将categorical 类型的特征转换为numerical类型。主要包括两个步骤,缺失值处理和编码转换。 
缺失值处理方面,可以使用全局的NA来统一标记缺失值:

  1. /*将categoricalb类型的变量的缺失值使用NA值填充*/
  2. String[] strCols = {"CatFeature1","CatFeature2"};
  3. dfTrain = dfTrain.na().fill("NA",strCols);
  4. dfTest = dfTest.na().fill("NA",strCols);

缺失值处理完成之后,就可以正式的对categorical类型的特征进行numerical转换了。在spark ml中,可以借助StringIndexer和oneHotEncoder完成 
这一任务:

  1. // StringIndexer oneHotEncoder 将 categorical变量转换为 numerical 变量
  2. // 如某列特征为星期几、天气等等特征,则转换为七个0-1特征
  3. StringIndexer cat1Index = new StringIndexer().setInputCol("CatFeature1").setOutputCol("indexedCat1").setHandleInvalid("skip");
  4. OneHotEncoder cat1Encoder = new OneHotEncoder().setInputCol(cat1Index.getOutputCol()).setOutputCol("CatVector1");
  5. StringIndexer cat2Index = new StringIndexer().setInputCol("CatFeature2").setOutputCol("indexedCat2");
  6. OneHotEncoder cat2Encoder = new OneHotEncoder().setInputCol(cat2Index.getOutputCol()).setOutputCol("CatVector2");

至此,特征预处理步骤基本完成了。由于上述特征都是处于单独的列并且列名独立,为方便后续模型进行特征输入,需要将其转换为特征向量,并统一命名, 
可以使用VectorAssembler类完成这一任务:

  1. /*转换为特征向量*/
  2. String[] vectorAsCols = {"intFeature1","intFeature2","CatVector1","CatVector2"};
  3. VectorAssembler vectorAssembler = new VectorAssembler().setInputCols(vectorAsCols).setOutputCol("vectorFeature");

通常,预处理之后获得的特征有成千上万维,出于去除冗余特征、消除维数灾难、提高模型质量的考虑,需要进行选择。在此,使用卡方检验方法, 
利用特征与类标签之间的相关性,进行特征选取:

  1. /*特征较多时,使用卡方检验进行特征选择,主要是考察特征与类标签的相关性*/
  2. ChiSqSelector chiSqSelector = new ChiSqSelector().setFeaturesCol("vectorFeature").setLabelCol("label").setNumTopFeatures()
  3. .setOutputCol("selectedFeature");

在特征预处理和特征选取完成之后,就可以定义模型及其参数了。简单期间,在此使用LogisticRegression模型,并设定最大迭代次数、正则化项:

  1. /* 设置最大迭代次数和正则化参数 setElasticNetParam=0.0 为L2正则化 setElasticNetParam=1.0为L1正则化*/
  2. /*设置特征向量的列名,标签的列名*/
  3. LogisticRegression logModel = new LogisticRegression().setMaxIter().setRegParam(0.1).setElasticNetParam(0.0)
  4. .setFeaturesCol("selectedFeature").setLabelCol("lable");

在上述准备步骤完成之后,就可以开始定义pipeline并进行模型的学习了:

  1. /*将特征转换,特征聚合,模型等组成一个管道,并调用它的fit方法拟合出模型*/
  2. PipelineStage[] pipelineStage = {cat1Index,cat2Index,cat1Encoder,cat2Encoder,vectorAssembler,logModel};
  3. Pipeline pipline = new Pipeline().setStages(pipelineStage);
  4. PipelineModel pModle = pipline.fit(dfTrain);

上面pipeline的fit方法得到的是一个Transformer,我们可以使它作用于测试集得到模型在测试集上的预测结果:

  1. //拟合得到模型的transform方法进行预测
  2. DataFrame output = pModle.transform(dfTest).select("selectedFeature", "label", "prediction", "rawPrediction", "probability");
  3. DataFrame prediction = output.select("label", "prediction");
  4. prediction.show();

 分析计算,得到模型在训练集上的准确率,看看模型的效果怎么样:

  1. /*测试集合上的准确率*/
  2. long correct = prediction.filter(prediction.col("label").equalTo(prediction.col("'prediction"))).count();
  3. long total = prediction.count();
  4. double accuracy = correct / (double)total;
  5.  
  6. System.out.println(accuracy);

最后,可以将模型保存下来,下次直接使用就可以了:

  1. String pModlePath = ""file:\\D:\\dac_sample\\";
  2. pModle.save(pModlePath);

三,梳理和总结:

上述,借助代码实现了基于spark ml pipeline的机器学习,包括数据转换、特征生成、特征选取、模型定义及模型学习等多个stage,得到的pipeline
模型后,就可以在新的数据集上进行预测,总结为两部分并用流程图表示如下:
训练阶段:

预测阶段:

借助于Pepeline,在spark上进行机器学习的数据流向更加清晰,同时每一stage的任务也更加明了,因此,无论是在模型的预测使用上、还是
模型后续的改进优化上,都变得更加容易。

 

spark ml pipeline构建机器学习任务的更多相关文章

  1. 使用spark ml pipeline进行机器学习

    一.关于spark ml pipeline与机器学习 一个典型的机器学习构建包含若干个过程 1.源数据ETL 2.数据预处理 3.特征选取 4.模型训练与验证 以上四个步骤可以抽象为一个包括多个步骤的 ...

  2. 使用 ML Pipeline 构建机器学习工作流

    http://www.ibm.com/developerworks/cn/opensource/os-cn-spark-practice5/

  3. Spark ML Pipeline简介

    Spark ML Pipeline基于DataFrame构建了一套High-level API,我们可以使用MLPipeline构建机器学习应用,它能够将一个机器学习应用的多个处理过程组织起来,通过在 ...

  4. spark ML pipeline 学习

    一.pipeline 一个典型的机器学习过程从数据收集开始,要经历多个步骤,才能得到需要的输出.这非常类似于流水线式工作,即通常会包含源数据ETL(抽取.转化.加载),数据预处理,指标提取,模型训练与 ...

  5. spark ml 的例子

    一.关于spark ml pipeline与机器学习 一个典型的机器学习构建包含若干个过程 1.源数据ETL 2.数据预处理 3.特征选取 4.模型训练与验证 以上四个步骤可以抽象为一个包括多个步骤的 ...

  6. Spark ML机器学习库评估指标示例

    本文主要对 Spark ML库下模型评估指标的讲解,以下代码均以Jupyter Notebook进行讲解,Spark版本为2.4.5.模型评估指标位于包org.apache.spark.ml.eval ...

  7. 基于Spark ML的Titanic Challenge (Top 6%)

    下面代码按照之前参加Kaggle的python代码改写,只完成了模型的训练过程,还需要对test集的数据进行转换和对test集进行预测. scala 2.11.12 spark 2.2.2 packa ...

  8. Spark ML源码分析之二 从单机到分布式

            前一节从宏观角度给大家介绍了Spark ML的设计框架(链接:http://www.cnblogs.com/jicanghai/p/8570805.html),本节我们将介绍,Spar ...

  9. Spark.ML之PipeLine学习笔记

    地址: http://spark.apache.org/docs/2.0.0/ml-pipeline.html   Spark PipeLine 是基于DataFrames的高层的API,可以方便用户 ...

随机推荐

  1. 微信小程序API~检查登录状态

    wx.checkSession(Object object) 检查登录态是否过期. 通过 wx.login 接口获得的用户登录态拥有一定的时效性.用户越久未使用小程序,用户登录态越有可能失效.反之如果 ...

  2. 微信小程序~获取位置信息

    微信小程序提供的getlocation来获取用户的定位,能够得到用户的经纬度信息 (注:getloaction需要用户授权scope.userLocation)结合map组件能够得到用户的详细定位 & ...

  3. InvenSense 美国公司

    InvenSense为智能型运动处理方案的先驱.全球业界的领导厂商,驱动了运动感测人机接口在消费性电子产品上的应用.公司提供的集成电路(IC)整合了运动传感器-陀螺仪以及相对应的软件,有别于其他厂商, ...

  4. 工作中 99% 能用到的 Git 命令

    分支操作 暂存操作 回退操作 标签操作 常规操作 git创建项目仓库 忽略已加入到版本库中的文件 取消忽略文件 拉取.上传免密码. 分支操作 git branch 创建分支 git branch -b ...

  5. 【Python学习】Python3 基础语法

    ==================================================================================================== ...

  6. Linux本地内核提权CVE-2019-13272

    简介:当调用PTRACE_TRACEME时,ptrace_link函数将获得对父进程凭据的RCU引用,然后将该指针指向get_cred函数.但是,对象struct cred的生存周期规则不允许无条件地 ...

  7. 什么是ARP协议?

    ARP协议,全称“Address Resolution Protocol”,中文名是地址解析协议, 使用ARP协议可实现通过IP地址获得对应主机的物理地址(MAC地址). 在TCP/IP的网络环境下, ...

  8. asp.net之大文件分段上传、断点续传

    ASP.NET上传文件用FileUpLoad就可以,但是对文件夹的操作却不能用FileUpLoad来实现. 下面这个示例便是使用ASP.NET来实现上传文件夹并对文件夹进行压缩以及解压. ASP.NE ...

  9. 2017.10.3 国庆清北 D3T1 括号序列

    题目描述 LYK有一个括号序列,但这个序列不一定合法. 一个合法的括号序列如下: ()是合法的括号序列. 若A是合法的括号序列,则(A)是合法的括号序列. 若A和B分别是合法的括号序列,则AB是合法的 ...

  10. 红黑树 ------ luogu P3369 【模板】普通平衡树(Treap/SBT)

    二次联通门 : luogu P3369 [模板]普通平衡树(Treap/SBT) 近几天闲来无事...就把各种平衡树都写了一下... 下面是红黑树(Red Black Tree) 喜闻乐见拿到了luo ...