Spark学习之Spark SQL（8）

1. Spark用来操作结构化和半结构化数据的接口——Spark SQL、

2. Spark SQL的三大功能

2.1 Spark SQL可以从各种结构化数据（例如JSON、Hive、Parquet等）中读取数据。

2.2 Spark SQL不仅支持在Spark程序内使用SQL语句进行查询，也支持从类似商业智能软件Tableau这样的外部工具中通过标准数据库连接器（JDBC/ODBC）连接Spark SQL进行查询。

2.3 当在Spark程序内使用Spark SQL时，Spark SQL支持SQ与常规的Python/Java/Scala代码高度整合，包括连接RDD与SQL表、公开的自定义SQL函数接口等。

3. SchemaRDD（1.3版本后为DataFrame）是存放Row对象的RDD，每个Row对象代表一行记录。SchemaRDD还包含记录的结果信息（即数据字段）。

4. 连接Spark SQL

带有Hive支持的Spark SQL的Maven索引

    groupID =org.apache.spark

    artifactID = spark-hive_2.10

    version = 1.2.0

5. 在应用使用Spark

5.1 初始化Spark

        //Sacla中SQL的import的声明

        import org.apache.spark.sql.hive.HiveContext

        import org.apache.spark.sql.SQLContext

        //Scala中SQL导入隐式转换支持

        val hiveCtx = ...//创建HiveContext

        import hiveCtx._//导入隐式转换支持

        //创建SQL上下文环境

        val sc = new SparkContext(...)

        val hiveCtx = new HiveContext(sc)

5.2 基本的查询示例

        val input = hiveCtx.jsonFile(inputFile)

        //注册输入的SchemaRDD

        input.registerTempTable("tweets")

        //依据tetwwtCount（转发计算）宣传推文

        val topTweeter = hiveCtx.sql("SELECT text,retweetCount FROM tweets ORDER　BY retweetCount LIMIT 10")

6. 用户自定义函数(UDF)

Scala版本的字符串长度UDF

    registerFunction("strLenScala",(_:string).length)

    val tweetLength = hiveCtx.sql("SELECT strLenScala('tweet') FROM tweets LIMIT 10")

Spark学习之Spark SQL（8）的更多相关文章

Spark学习之Spark Streaming（9）
Spark学习之Spark Streaming(9) 1. Spark Streaming允许用户使用一套和批处理非常接近的API来编写流式计算应用,这就可以大量重用批处理应用的技术甚至代码. 2. ...
Spark学习之Spark调优与调试（7）
Spark学习之Spark调优与调试(7) 1. 对Spark进行调优与调试通常需要修改Spark应用运行时配置的选项. 当创建一个SparkContext时就会创建一个SparkConf实例. 2. ...
Spark学习之Spark SQL
一.简介 Spark SQL 提供了以下三大功能. (1) Spark SQL 可以从各种结构化数据源(例如 JSON.Hive.Parquet 等)中读取数据. (2) Spark SQL 不仅支持 ...
Spark学习一:Spark概述
1.1 什么是Spark Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎. 一站式管理大数据的所有场景(批处理,流处理,sql) spark不涉及到数据的存储,只 ...
Spark学习笔记--Spark在Windows下的环境搭建
本文主要是讲解Spark在Windows环境是如何搭建的一.JDK的安装 1.1 下载JDK 首先需要安装JDK,并且将环境变量配置好,如果已经安装了的老司机可以忽略.JDK(全称是JavaTM P ...
Spark学习(一) Spark初识
一.官网介绍 1.什么是Spark 官网地址:http://spark.apache.org/ Apache Spark™是用于大规模数据处理的统一分析引擎. 从右侧最后一条新闻看,Spark也用于A ...
Spark学习笔记--Spark在Windows下的环境搭建（转）
本文主要是讲解Spark在Windows环境是如何搭建的一.JDK的安装 1.1 下载JDK 首先需要安装JDK,并且将环境变量配置好,如果已经安装了的老司机可以忽略.JDK(全称是JavaTM P ...
Spark学习(4) Spark Streaming
什么是Spark Streaming Spark Streaming类似于Apache Storm,用于流式数据的处理 Spark Streaming有高吞吐量和容错能力强等特点.Spark Stre ...
Spark学习之Spark Streaming
一.简介许多应用需要即时处理收到的数据,例如用来实时追踪页面访问统计的应用.训练机器学习模型的应用,还有自动检测异常的应用.Spark Streaming 是 Spark 为这些应用而设计的模型.它 ...

随机推荐

Codeforces 104C Cthulhu dfs暴力 || 点双连通缩点
题目链接:点击打开链接题意: 给定n个点m条边的无向图问图中是否存在有且仅有一个简单环和一些树,且这些树的root都在这个简单环上. 瞎写了个点双. . == #include <stdi ...
Xcode中使用git
项目中添加git 也可在开始新建项目时勾选git,这是针对开始没有勾选git的情况打开终端 cd 项目文件目录 //初始化一个代码仓库, git init //将当前目录及子目录中的文件标记为要添加 ...
Delphi中accesss实现树形结构查询系统（一次性生成比较方便）
主要是要读取数据库的信息,而delphi界面是一个树形结构. 例如有一个Ascess数据库:示例.MDB,内有一张表:“国家”,表的内容如下: 编号名称 01 ...
HR-部门内部调动报表
*&---------------------------------------------------------------------* *& Report ZHRPA038 ...
Get started with Sourcetree
Understand the interface Bookmarks window From that window, select the Local or Remote buttons to vi ...
如何完成dedecms外部数据库调用|跨数据库数据调用
第1步:打开网站include\taglib文件夹中找到sql.lib.php文件,并直接复制一些此文件出来,并把复制出来的这个文件重命名为mysql.lib.php. 注:mysql.lib.php ...
Educational Codeforces Round 14E. Xor-sequences（矩阵快速幂）
传送门题意给定序列,从序列中选择k(1≤k≤1e18)个数(可以重复选择),使得得到的排列满足\(x_i与x_{i+1}\)异或的二进制表示中1的个数是3的倍数.问长度为k的满足条件的序列有多少种 ...
SpringMVC异步调用,Callable和DeferredResult的使用
Callable和DeferredResult都是springMVC里面的异步调用,Callable主要用来处理一些简单的逻辑,DeferredResult主要用于处理一些复杂逻辑 1.Callabl ...
JavaScript编程艺术-第7章代码汇总（1）
1.document.write()(HTML与JS未分离) HTML: JS: 2..innerHTML(直接覆盖) HTML: JS: 3.getAttribute.setAttribute.ge ...
[POI2007]山峰和山谷Grz
Description FGD小朋友特别喜欢爬山,在爬山的时候他就在研究山峰和山谷.为了能够让他对他的旅程有一个安排,他想知道山峰和山谷的数量.给定一个地图,为FGD想要旅行的区域,地图被分为\(n\ ...

Spark学习之Spark SQL（8）

Spark学习之Spark SQL（8）

1. Spark用来操作结构化和半结构化数据的接口——Spark SQL、

2. Spark SQL的三大功能

3. SchemaRDD（1.3版本后为DataFrame）是存放Row对象的RDD，每个Row对象代表一行记录。SchemaRDD还包含记录的结果信息（即数据字段）。

4. 连接Spark SQL

5. 在应用使用Spark

6. 用户自定义函数(UDF)

Spark学习之Spark SQL（8）的更多相关文章

随机推荐

热门专题