Spark基本函数学习

package cn.itcast.spark.czh

import org.apache.spark.{SparkConf, SparkContext}

object TestFun {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf().setMaster("local").setAppName("map")
    val sc = new SparkContext(conf)
    //    val rdd = sc.parallelize(1 to 10)  //创建RDD
    //    val map = rdd.map(_*2)             //对RDD中的每个元素都乘于2
    //    map.foreach(x => print(x+" "))
    //    sc.stop()
    //    fun1()
    //    val l = List(("kpop", "female"), ("zorro", "male"), ("mobin", "male"), ("lucy", "female"))
    //    val rdd = sc.parallelize(l, 2)
    //    /*写法一*/
    //    //        val mp = rdd.mapPartitions(fun2)
    //    /*val mp = rdd.mapPartitionsWithIndex(partitionsFun)*/
    //    //    mp.collect.foreach(x => (print(x + " "))) //将分区中的元素转换成Aarray再输出
    //    /*写法二*/
    //    //    rdd.mapPartitions(x=>x.filter(_._2=="female")).map(_._1).foreach(x=>print(x+" "))
    //    /*写法三*/
    //    val mp = rdd.mapPartitionsWithIndex(fun3)
    //    mp.collect().foreach(x => (print(x + " ")))
    //    fun4(sc)
    fun9(sc)
  }

  /*map 数据集中的每个元素经过用户自定义的函数转换成一个新的RDD，新的RDD交MappedRDD*/
  def fun0(): Unit = {
    val conf = new SparkConf().setMaster("local").setAppName("map")
    val sc = new SparkContext(conf)
    val rdd = sc.parallelize(1 to 10) //创建RDD
    val map = rdd.map(_ * 2) //对RDD中的每个元素都乘于2
    map.foreach(x => print(x + " "))
    sc.stop()
  }

  /*flatMap 与map类似，但每个元素输入项都可以被映射到0或者多个输出项，最终将结果扁平化输出*/
  def fun1(): Unit = {
    val conf = new SparkConf().setMaster("local").setAppName("flatMap")
    val sc = new SparkContext(conf)
    val rdd = sc.parallelize(1 to 10)
    val array = rdd.flatMap(x => (1 to x)).collect()
    array.foreach(a => print(a))
  }

  /*mapPartitions 类似于map，map作用于每个分区的每个元素，单mapPartitions作用于每个分区工*/
  def fun2(iterable: Iterator[(String, String)]): Iterator[String] = {
    var woman = List[String]()
    while (iterable.hasNext) {
      val next = iterable.next()
      next match {
        case (_, "female") => woman = next._1 :: woman
        case _ =>
      }
    }
    return woman.iterator
  }

  /*mapPartitionsWithIndex*/
  def fun3(index: Int, iterator: Iterator[(String, String)]): Iterator[String] = {
    var woman = List[String]()
    while (iterator.hasNext) {
      val next = iterator.next()
      next match {
        case (_, "female") => woman = "[" + index + "]" + next._1 :: woman
        case _ =>
      }
    }
    return woman.iterator
  }

  /* sample 对RDD进行抽样
  * 参数解释：withReplacement 为true表示抽样之后还放回RDD，可以被多次抽样，false表示不放回。
  * fraction 表示抽样比例
  * seed为随机数种子，比如时间戳
  * */
  def fun4(sc: SparkContext): Unit = {
    val rdd = sc.parallelize(1 to 10)
    val sample1 = rdd.sample(true, 0.5)
    sample1.collect().foreach(x => print(x + " "))
    sc.stop()
  }

  /*union 将两个RDD中的数据进行合并，并最终返回两个RDD的并集，若RDD中存在相同的元素也不会去重*/
  def fun5(sc: SparkContext): Unit = {
    var rdd1 = sc.parallelize(1 to 10)
    var rdd2 = sc.parallelize(6 to 15)
    rdd1.union(rdd2).collect().foreach(x => print(x + " "))
  }

  /*intersection 返回两个RDD的交集*/
  def fun6(sc: SparkContext): Unit = {
    val rdd1 = sc.parallelize(1 to 10)
    val rdd2 = sc.parallelize(5 to 20)
    rdd1.intersection(rdd2).collect().foreach(x => print(x + " "))
  }

  /*distinct 对RDD中的元素进行去重*/
  def fun7(sc: SparkContext): Unit = {
    val rdd1 = sc.parallelize(List(1, 1, 2, 3, 4, 5, 5))
    rdd1.distinct().collect().foreach(x => print(x + " "))
  }

  /*cartesian 对两个RDD中所有的元素进行笛卡尔积操作*/
  def fun8(sc : SparkContext): Unit ={
    val rdd1 = sc.parallelize(1 to 3)
    val rdd2 = sc.parallelize(1 to 4)
    rdd1.cartesian(rdd2).collect().foreach(x=>print(x+" "))
  }

  /*coalesce(numPartitions,shuffle) 对RDD的分区进行重新分区，shuffle默认值为false，当shuffle=false时，不能增加分区数目，但不会报错，只是分区个数还是原来的*/
  def fun9(sc :SparkContext): Unit ={
    /*shuffle 为 false*/
    val rdd1 = sc.parallelize(1 to 16,4)
    val rdd2 = rdd1.coalesce(3)
    print(rdd2.partitions.size)

  }

}

Spark基本函数学习的更多相关文章

Spark 基本函数学习笔记一
Spark 基本函数学习笔记一¶ spark的函数主要分两类,Transformations和Actions. Transformations为一些数据转换类函数,actions为一些行动类函数: ...
Spark菜鸟学习营Day6 分布式代码运行调试
Spark菜鸟学习营Day6 分布式代码运行调试作为代码调试,一般会分成两个部分语法调试,也就是确定能够运行结果调试,也就是确定程序逻辑的正确其实这个都离不开运行,所以我们说一下如何让开发的S ...
Spark菜鸟学习营Day5 分布式程序开发
Spark菜鸟学习营Day5 分布式程序开发这一章会和我们前面进行的需求分析进行呼应,完成程序的开发. 开发步骤分布式系统开发是一个复杂的过程,对于复杂过程,我们需要分解为简单步骤的组合. 针对每 ...
Spark菜鸟学习营Day4 单元测试程序的编写
Spark菜鸟学习营Day4 单元测试程序的编写 Spark相比于传统代码是比较难以调试的,单元测试的编写是非常必要的. Step0:需求分析在测试案例编写前,需完成需求分析工作,明确程序所有的输入 ...
Spark菜鸟学习营Day3 RDD编程进阶
Spark菜鸟学习营Day3 RDD编程进阶 RDD代码简化对于昨天练习的代码,我们可以从几个方面来简化: 使用fluent风格写法,可以减少对于中间变量的定义. 使用lambda表示式来替换对象写 ...
Spark菜鸟学习营Day2 分布式系统需求分析
Spark菜鸟学习营Day2 分布式系统需求分析本分析主要针对从原有代码向Spark的迁移.要注意的是Spark和传统开发有着截然不同的思考思路,所以我们需要首先对原有代码进行需求分析,形成改造思路 ...
Spark菜鸟学习营Day1 从Java到RDD编程
Spark菜鸟学习营Day1 从Java到RDD编程菜鸟训练营主要的目标是帮助大家从零开始,初步掌握Spark程序的开发. Spark的编程模型是一步一步发展过来的,今天主要带大家走一下这段路,让我 ...
【Spark深入学习-11】Spark基本概念和运行模式
----本节内容------- 1.大数据基础 1.1大数据平台基本框架 1.2学习大数据的基础 1.3学习Spark的Hadoop基础 2.Hadoop生态基本介绍 2.1Hadoop生态组件介绍 ...
【Spark 深入学习 01】 Spark是什么鬼？
经过一段时间的学习和测试,是时候给spark的学习经历做一个总结了,对于spark的了解相对晚了写.春节期间(预计是无大事),本博准备推出20篇左右spark系列原创文章(先把牛吹出去再说) ,尽量将 ...

随机推荐

c语言进阶11-算法设计思想
一. 算法设计的要求: 为什么要学算法? /* 输出Hello word! */ #include "stdio.h" void main() { printf("He ...
[PTA] L3-015 球队“食物链”
原题链接思路: 如果有环,则起点一定为"1".如果没有可以胜过"1"的,则无环. 根据W,L来建立图,用dfs从1节点遍历+回溯. 剪枝:dfs到某个子序列时 ...
Redis（一）--- 概述
使用redis很长时间了,但只是限于使用,一直也没有进行系统的学习与底层研究,现系统的学习一下redis并记录笔记. Redis 1.Nosql 非关系型数据库,key-value键值对存贮. 2.内 ...
【Java中级】（五）异常处理
1.什么是异常异常定义:导致程序的正常流程被中断的事件,叫做异常. 2.异常处理 try catch finally throws package exception; import java.io ...
Flutter学习笔记（11）--文本组件、图标及按钮组件
如需转载,请注明出处:Flutter学习笔记(10)--容器组件.图片组件文本组件文本组件(text)负责显示文本和定义显示样式,下表为text常见属性 Text组件属性及描述属性名类型默认 ...
前端js性能优化的要点
1 尽量少使用全局查找,比如全局变量,如果要多次使用,可以将全局变量存为局部变量再使用 eg:function(){ var body=document.body; alert(body): body ...
【Machine Learning·机器学习】决策树之ID3算法(Iterative Dichotomiser 3)
目录 1.什么是决策树 2.如何构造一棵决策树? 2.1.基本方法 2.2.评价标准是什么/如何量化评价一个特征的好坏? 2.3.信息熵.信息增益的计算 2.4.决策树构建方法 3.算法总结 @ 1. ...
JDK的命令行工具系列 (三) jhat、jstack
jhat: heapdump文件分析工具在前两篇系列文章JDK的命令行工具系列 (一) jps.jstat.JDK的命令行工具系列 (二) javap.jinfo.jmap中, 我们已经介绍过了jp ...
放出一批jsp图书管理系统图书借阅系统源码代码运行
基于jsp+mysql的JSP图书销售管理系统 https://www.icodedock.com/article/105.html基于jsp+Spring+Spring MVC的Spring图书借阅 ...
Java编程基础阶段笔记 day 07 面向对象编程（上）
面向对象编程笔记Notes 面向对象三条学习主线面向过程 VS 面向对象类和对象创建对象例子面向对象的内存分析类的属性:成员变量成员变量 VS 局部变量类的方法方法的重载可变个 ...

Spark基本函数学习

Spark基本函数学习的更多相关文章

随机推荐

热门专题