DataFrames与RDDs的相互转换

Spark SQL支持两种RDDs转换为DataFrames的方式

使用反射获取RDD内的Schema

当已知类的Schema的时候，使用这种基于反射的方法会让代码更加简洁而且效果也很好。

通过编程接口指定Schema

通过Spark SQL的接口创建RDD的Schema，这种方式会让代码比较冗长。

这种方法的好处是，在运行时才知道数据的列以及列的类型的情况下，可以动态生成Schema。

使用反射获取Schema（Inferring the Schema Using Reflection）

import org.apache.spark.sql.{DataFrameReader, SQLContext}

import org.apache.spark.{SparkConf, SparkContext}

object InferringSchema {

  def main(args: Array[String]) {

    //创建SparkConf()并设置App名称

    val conf = new SparkConf().setAppName("SQL-intsmaze")

    //SQLContext要依赖SparkContext

    val sc = new SparkContext(conf)

    //创建SQLContext

    val sqlContext = new SQLContext(sc)

    //从指定的地址创建RDD

    val lineRDD = sc.textFile("hdfs://192.168.19.131:9000/person.tzt").map(_.split(","))

    //创建case class

    //将RDD和case class关联

    val personRDD = lineRDD.map(x => Person(x().toInt, x(), x().toInt))

    //导入隐式转换，如果不导入无法将RDD转换成DataFrame

    //将RDD转换成DataFrame

    import sqlContext.implicits._

    val personDF = personRDD.toDF

    //注册表

    personDF.registerTempTable("intsmaze")

    //传入SQL

    val df = sqlContext.sql("select * from intsmaze order by age desc limit 2")

    //将结果以JSON的方式存储到指定位置

    df.write.json("hdfs://192.168.19.131:9000/personresult")

    //停止Spark Context

    sc.stop()

  }

}

//case class一定要放到外面

case class Person(id: Int, name: String, age: Int)

spark shell中不需要导入sqlContext.implicits._是因为spark shell默认已经自动导入了。

打包提交到yarn集群：

/home/hadoop/app/spark/bin/spark-submit --class InferringSchema \

--master yarn \

--deploy-mode cluster \

--driver-memory 512m \

--executor-memory 512m \

--executor-cores  \

--queue default \

/home/hadoop/sparksql-1.0-SNAPSHOT.jar

通过编程接口指定Schema（Programmatically Specifying the Schema）

当JavaBean不能被预先定义的时候，编程创建DataFrame分为三步：

从原来的RDD创建一个Row格式的RDD.

创建与RDD中Rows结构匹配的StructType，通过该StructType创建表示RDD的Schema.

通过SQLContext提供的createDataFrame方法创建DataFrame，方法参数为RDD的Schema.

import org.apache.spark.sql.{Row, SQLContext}

import org.apache.spark.sql.types._

import org.apache.spark.{SparkContext, SparkConf}

object SpecifyingSchema {

  def main(args: Array[String]) {

    //创建SparkConf()并设置App名称

    val conf = new SparkConf().setAppName("SQL-intsmaze")

    //SQLContext要依赖SparkContext

    val sc = new SparkContext(conf)

    //创建SQLContext

    val sqlContext = new SQLContext(sc)

    //从指定的地址创建RDD

    val personRDD = sc.textFile(args()).map(_.split(","))

    //通过StructType直接指定每个字段的schema

    val schema = StructType(

      List(

        StructField("id", IntegerType, true),

        StructField("name", StringType, true),

        StructField("age", IntegerType, true)

      )

    )

    //将RDD映射到rowRDD

    val rowRDD = personRDD.map(p => Row(p().toInt, p().trim, p().toInt))

    //将schema信息应用到rowRDD上

    val personDataFrame = sqlContext.createDataFrame(rowRDD, schema)

    //注册表

    personDataFrame.registerTempTable("intsmaze")

    //执行SQL

    val df = sqlContext.sql("select * from intsmaze order by age desc ")

    //将结果以JSON的方式存储到指定位置

    df.write.json(args())

    //停止Spark Context

    sc.stop()

  }

}

将程序打成jar包，上传到spark集群，提交Spark任务

/home/hadoop/app/spark/bin/spark-submit --class SpecifyingSchema \

--master yarn \

--deploy-mode cluster \

--driver-memory 512m \

--executor-memory 512m \

--executor-cores  \

--queue default \

/home/hadoop/sparksql-1.0-SNAPSHOT.jar \

hdfs://192.168.19.131:9000/person.txt hdfs://192.168.19.131:9000/intsmazeresult

/home/hadoop/app/spark/bin/spark-submit --class SpecifyingSchema \

--master yarn \

--deploy-mode client \

--driver-memory 512m \

--executor-memory 512m \

--executor-cores  \

--queue default \

/home/hadoop/sparksql-1.0-SNAPSHOT.jar \

hdfs://192.168.19.131:9000/person.txt hdfs://192.168.19.131:9000/intsmazeresult

在maven项目的pom.xml中添加Spark SQL的依赖

<dependency>

　　<groupId>org.apache.spark</groupId>

　　<artifactId>spark-sql_2.</artifactId>

　　<version>1.6.</version>

</dependency>

DataFrames与RDDs的相互转换的更多相关文章

2.sparkSQL--DataFrames与RDDs的相互转换
Spark SQL支持两种RDDs转换为DataFrames的方式使用反射获取RDD内的Schema 当已知类的Schema的时候,使用这种基于反射的方法会让代码更加简洁而且效果也很好. 通 ...
Spark SQL 之 DataFrame
Spark SQL 之 DataFrame 转载请注明出处:http://www.cnblogs.com/BYRans/ 概述(Overview) Spark SQL是Spark的一个组件,用于结构化 ...
Spark SQL 官方文档-中文翻译
Spark SQL 官方文档-中文翻译 Spark版本:Spark 1.5.2 转载请注明出处:http://www.cnblogs.com/BYRans/ 1 概述(Overview) 2 Data ...
SparkSql官方文档中文翻译(java版本)
1 概述(Overview) 2 DataFrames 2.1 入口:SQLContext(Starting Point: SQLContext) 2.2 创建DataFrames(Creating ...
Spark记录-SparkSql官方文档中文翻译（部分转载）
1 概述(Overview) Spark SQL是Spark的一个组件,用于结构化数据的计算.Spark SQL提供了一个称为DataFrames的编程抽象,DataFrames可以充当分布式SQL查 ...
转】Spark SQL 之 DataFrame
原博文出自于: http://www.cnblogs.com/BYRans/p/5003029.html 感谢! Spark SQL 之 DataFrame 转载请注明出处:http://www.cn ...
DataFrames，Datasets，与 SparkSQL
v\:* {behavior:url(#default#VML);} o\:* {behavior:url(#default#VML);} w\:* {behavior:url(#default#VM ...
A Tale of Three Apache Spark APIs: RDDs, DataFrames, and Datasets（中英双语）
文章标题 A Tale of Three Apache Spark APIs: RDDs, DataFrames, and Datasets 且谈Apache Spark的API三剑客:RDD.Dat ...
Spark RDDs vs DataFrames vs SparkSQL
简介 Spark的 RDD.DataFrame 和 SparkSQL的性能比较. 2方面的比较单条记录的随机查找 aggregation聚合并且sorting后输出使用以下Spark的三种方式来解 ...

随机推荐

Unity在协程内部停止协程自身后代码执行问题
当在协程内部停止自身后,后面的代码块还会继续执行,直到遇到yield语句才会终止. 经测试:停止协程,意味着就是停止yield,所以在停止协程后,yield之后的语句也就不会执行了. 代码如下: us ...
如何用MathType编辑化学等式
MathType在数学中应用非常广泛,被大量用于编辑数学公式,MathType不仅可以用来编辑数学公式,还可以编辑化学反应式,那么MathType编辑化学等式怎么操作的呢? 具体操作如下: 1.打开M ...
QlikView报表显示连续若干个月内活跃用户的数量
之前有朋友提到了这样一个需求,要计算三年中每年都有销售记录的客户量,仅仅有近期两年有销售纪录的客户量(假如某个用户2012年和2014年都有记录,在2013年没有则不计算在内).以及近期一年的新增客户 ...
MySQL<多表操作>
多表操作外键什么是外键外键是指引用另一个表中的一列或多列,被引用的列应该具有主键约束或唯一性约束. 外键用于建立和加强两个表数据之间的链接. 为表添加外键约束想要真正连接两个表的数据,就需要为 ...
Ubuntu12.04 Skype4.2 提示Skype can't connect，安装Skype4.3
最近几天Skype突然不能登录啦,以为是自己密码记错啦,重置啦一下密码,发现仍然提示”Skype can't connect“,我的版本是Ubuntu12.04 Skype4.2 尝试啦很多办法仍然不 ...
long()
long() 用于将一个对象转换为长整数 In [35]: long(') # 将纯数字的字符串转换为长整数 Out[35]: 123L In [36]: long(12.3) # 将浮点数转换为长整 ...
with revoked permission android.permission.CAMERA
1,刚出现这样的问题我是直接把 CAMERA 移除掉 2.第一步判断时候授权. if (Build.VERSION.SDK_INT >= 23) { int checkCallPhonePerm ...
shiro-filter执行流程
web中在xml中配置 <filter> <filter-name>shiroFilter</filter-name> <filter-class>o ...
《C#高级编程》学习笔记------抗变和协变
1.协变和抗变在.NET 4之前,泛型接口是不变的..NET 4通过协变和抗变为泛型接口和泛型委托添加了一个重要的扩展.协变和抗变指对参数和返回值的类型进行转换.例如,可以给一个需要Shape参数的 ...
java 集合之HashMap
原文出处http://zhangshixi.iteye.com/blog/672697 1. HashMap概述: HashMap是基于哈希表的Map接口的非同步实现.此实现提供所有可选的映射操 ...

DataFrames与RDDs的相互转换

DataFrames与RDDs的相互转换的更多相关文章

随机推荐

热门专题