实验5 Spark SQL编程初级实践

今天做实验【Spark SQL 编程初级实践】，虽然网上有答案，但都是用scala语言写的，于是我用java语言重写实现一下。

1 ．Spark SQL 基本操作
将下列 JSON 格式数据复制到 Linux 系统中，并保存命名为 employee.json。
{ "id":1 , "name":" Ella" , "age":36 }
{ "id":2, "name":"Bob","age":29 }
{ "id":3 , "name":"Jack","age":29 }
{ "id":4 , "name":"Jim","age":28 }
{ "id":4 , "name":"Jim","age":28 }
{ "id":5 , "name":"Damon" }
{ "id":5 , "name":"Damon" }
为 employee.json 创建 DataFrame，并写出 Scala 语句完成下列操作：
(1) 查询所有数据；
(2) 查询所有数据，并去除重复的数据；
(3) 查询所有数据，打印时去除 id 字段；
(4) 筛选出 age>30 的记录；
(5) 将数据按 age 分组；
(6) 将数据按 name 升序排列；
(7) 取出前 3 行数据；
(8) 查询所有记录的 name 列，并为其取别名为 username；
(9) 查询年龄 age 的平均值；
(10) 查询年龄 age 的最小值。
2 ．编程实现将 RDD 转换为 DataFrame
源文件内容如下（包含 id,name,age）：
1,Ella,36
2,Bob,29
3,Jack,29
请将数据复制保存到 Linux 系统中，命名为 employee.txt，实现从 RDD 转换得到
DataFrame，并按“id:1,name:Ella,age:36”的格式打印出 DataFrame 的所有数据。请写出程序代
码。
3. 编程实现利用 DataFrame 读写 MySQL 的数据
（1）在 MySQL 数据库中新建数据库 sparktest，再创建表 employee，包含如表 6-2 所示的
两行数据。
表表 6-2 employee 表原有数据
id name gender Age
1 Alice F 22
2 John M 25
（2）配置 Spark 通过 JDBC 连接数据库 MySQL，编程实现利用 DataFrame 插入如表 6-3 所
示的两行数据到 MySQL 中，最后打印出 age 的最大值和 age 的总和。
表表 6-3 employee 表新增数据
id name gender age
3 Mary F 26
4 Tom M 23

实验5 Spark SQL编程初级实践的更多相关文章

实验 5 Spark SQL 编程初级实践
实验 5 Spark SQL 编程初级实践参考厦门大学林子雨 1． Spark SQL 基本操作将下列 json 数据复制到你的 ubuntu 系统/usr/local/spark 下,并 ...
spark实验(五)--Spark SQL 编程初级实践(1)
一.实验目的 (1)通过实验掌握 Spark SQL 的基本编程方法: (2)熟悉 RDD 到 DataFrame 的转化方法: (3)熟悉利用 Spark SQL 管理来自不同数据源的数据. 二.实 ...
第五周周二练习：实验 5 Spark SQL 编程初级实践
1.题目: 源码: import java.util.Properties import org.apache.spark.sql.types._ import org.apache.spark.sq ...
实验5 Spark SQL 编程初级实践
源文件内容如下(包含 id,name,age),将数据复制保存到 ubuntu 系统/usr/local/spark 下, 命名为 employee.txt,实现从 RDD 转换得到 DataFram ...
Spark SQL 编程初级实践
一.实验目的 (1) 通过实验掌握 Spark SQL 的基本编程方法: (2) 熟悉 RDD 到 DataFrame 的转化方法: (3) 熟悉利用 Spark ...
实验 2 Scala 编程初级实践
实验 2 Scala 编程初级实践一.实验目的 1.掌握 Scala 语言的基本语法.数据结构和控制结构: 2.掌握面向对象编程的基础知识,能够编写自定义类和特质: 3.掌握函数式编程的基础知识,能 ...
Spark SQL 编程API入门系列之SparkSQL的依赖
不多说,直接上干货! 不带Hive支持 <dependency> <groupId>org.apache.spark</groupId> <artifactI ...
spark SQL编程
1.编程实现将 RDD 转换为 DataFrame源文件内容如下(包含 id,name,age): 1,Ella,362,Bob,293,Jack,29 请将数据复制保存到 Linux 系统中,命名为 ...
Spark SQL编程指南（Python）
前言 Spark SQL允许我们在Spark环境中使用SQL或者Hive SQL执行关系型查询.它的核心是一个特殊类型的Spark RDD:SchemaRDD. SchemaRDD类似于传统关 ...

随机推荐

emos邮件系统的web密码修改方法
作者:邓聪聪 1.修改web管理界面的登陆密码,数据库修改管理员密码,有root用root,没root用系统用户.查看方法进入数据库查看到管理表项中的root管理账户信息, mysql> u ...
WPF 10天修炼第七天- WPF资源、样式、控件模板
WPF资源对象资源 WPF允许在XAML标记的任意位置定义资源.比如在特定的控件.窗口或应用程序级别定义资源,WPF资源系统提供的对象资源有如下好处: 1. 高效:使用对象资源可以在一个地方定义而 ...
IntelliJ IDEA使用SVN检出项目到本地工作空间
基于keil平台下STM32L系列移植FreeRTOS操作系统
1,下载FreeRTOS https://www.freertos.org/a00104.html 点击下载后,会进入如下界面之后会弹出下载界面,格式为.EXE,不用怀疑.不是木马. 等待下载完成, ...
论文阅读笔记五十：CornerNet: Detecting Objects as Paired Keypoints(ECCV2018)
论文原址:https://arxiv.org/pdf/1808.01244.pdf github:https://github.com/princeton-vl/CornerNet 摘要本文提出了目 ...
Python-数据类型之字典
一: 概述字典是有大括号,逗号分隔,有k/v组成字典的键必须hashable,如数字,字符串,布尔值,元组二: 操作 2.1 增 2.1.1 直接赋值如果键不存在,则增加 dic = {'n ...
unity3d优化-代码篇（不定期更新）
1.Update 大多数情况是需要在update中处理很多逻辑的,然而unity3d底层是c/c++编写,逻辑层是c#,通过monobehaviour挂载于对象中,实现一些unity3d接口的重载. ...
js常见的面试题
css 选择符有哪些通配选择符 *类选择符 classid选择符 id属性选择符 input[name=button]包含选择符类似 div span子对象选择符类似 div > span ...
shiro登录密码加密
密码加密 String passwd = new SimpleHash("SHA-1", "username", "password").t ...
8、socket以及socketserver
Python 提供了两个基本的 socket 模块.第一个是 Socket,它提供了标准的 BSD Sockets API.第二个是 SocketServer, 它提供了服务器中心类,可以简化网络服务 ...

实验5 Spark SQL编程初级实践

实验5 Spark SQL编程初级实践的更多相关文章

随机推荐

热门专题