Spark高速上手之交互式分析

1.1 Spark交互式分析

执行Spark脚本前，启动Hadoop的HDFS和YARN。Spark的shell提供

了简单方式去识别API。相同也有一个强大的工具去交互式地分析数据。

两种语言有这种交换能力，各自是Scala 和 Python。以下将演示怎样使用Python来分析数据文件。

进入Spark安装主文件夹，输入以下的命令。python命令行模式将会启动。

./bin/pyspark

Spark的主要抽象是一个称之为弹性分布式数据集（Resilient Distributed Dataset，RDD）。RDD可以从Hadoop输入格式（InputFormat。比方HDFS文件），或者通过转换其他RDDs。这里。我们将上传Spark主文件夹下的README文件上传到Hadoop的文件系统/user/app(app是我的linuxusername)文件夹下。详细的命令例如以下：

hdfs dfs –mkdir–p /user/app

hdfs dfs –putREADME.md /usr/app

使用Python创建一个新的弹性分布式数据集，定义例如以下。

>>>textFile = sc.textFile("README.md")

RDD有actions,。它可以返回值以及转换transformations，也可以返回指向新的RDD的指针。以下就是几个RDD的action操作。

>>>textFile.count() # 返回这个RDD的数据项个数

126

>>>textFile.first() # 返回这个RDD的第一项数据

u'# ApacheSpark'

如今让我们使用一个转换（transformation）。我们将使用filter转换返回一个新的RDD，伴随着文件里的数据项的子集。

>>>linesWithSpark=textFile.filter(lambdaline:"Spark"inline)

我们可以链式化转换和动作:

>>> textFile.filter(lambda line:"Spark"inline).count()# How many linescontain "Spark"?

15

RDD动作和转换可以被用作更为复杂的计算，看以下的样例。

>>> textFile.map(lambdaline: len(line.split())).reduce(lambda a, b: aif (a > b)elseb)

15

这个參数的第一项映射一行的数据到一个integer值，创建一个新的RDD。

reduce在RDD上被调用。用于找到一个最大的行数。map和reduce的參数是Python匿名函数lambdas。与此同一时候，你也可以传入不论什么你想要的顶级Python函数。

不如，以下就是传入的一个Python函数。

>>> defmax(a, b):

...     if a > b:

...         return a

...     else:

...         return b

...

>>>textFile.map(lambda line: len(line.split())).reduce(max)

15

Spark高速上手之交互式分析的更多相关文章

Spark高速入门指南(Quick Start Spark)
版权声明:本博客已经不再更新.请移步到Hadoop技术博客:https://www.iteblog.com https://blog.csdn.net/w397090770/article/detai ...
Spark SQL慕课网日志分析（1）--系列软件(单机)安装配置使用
来源: 慕课网 Spark SQL慕课网日志分析_大数据实战目标: spark系列软件的伪分布式的安装.配置.编译 spark的使用系统: mac 10.13.3 /ubuntu 16.06,两个 ...
【原】Spark中Client源码分析（二）
继续前一篇的内容.前一篇内容为: Spark中Client源码分析(一)http://www.cnblogs.com/yourarebest/p/5313006.html DriverClient中的 ...
【原】Spark中Master源码分析（二）
继续上一篇的内容.上一篇的内容为: Spark中Master源码分析(一) http://www.cnblogs.com/yourarebest/p/5312965.html 4.receive方法, ...
【原】Spark中Master源码分析（一）
Master作为集群的Manager,对于集群的健壮运行发挥着十分重要的作用.下面,我们一起了解一下Master是听从Client(Leader)的号召,如何管理好Worker的吧. 1.家当(静态属 ...
【原】 Spark中Worker源码分析（二）
继续前一篇的内容.前一篇内容为: Spark中Worker源码分析(一)http://www.cnblogs.com/yourarebest/p/5300202.html 4.receive方法, r ...
Spark Scheduler模块源码分析之TaskScheduler和SchedulerBackend
本文是Scheduler模块源码分析的第二篇,第一篇Spark Scheduler模块源码分析之DAGScheduler主要分析了DAGScheduler.本文接下来结合Spark-1.6.0的源码继 ...
Spark Scheduler模块源码分析之DAGScheduler
本文主要结合Spark-1.6.0的源码,对Spark中任务调度模块的执行过程进行分析.Spark Application在遇到Action操作时才会真正的提交任务并进行计算.这时Spark会根据Ac ...
Apache 流框架 Flink，Spark Streaming，Storm对比分析（一）
本文由网易云发布. 1.Flink架构及特性分析 Flink是个相当早的项目,开始于2008年,但只在最近才得到注意.Flink是原生的流处理系统,提供high level的API.Flink也提 ...

随机推荐

(2).net web api 请求方式与参数
一.GET 二.POST 如果方法名前缀不带GET 默认为POST请求方法 1.无参数 2.带一个参数客户端请求时,名称必须为空,不能是dictCategory.不是空的话,会返回空数据 [ ] 3 ...
Codeforces Round #306 (Div. 2) A. Two Substrings【字符串/判断所给的字符串中是否包含不重叠的“BA” “AB”两个字符串】
A. Two Substrings time limit per test 2 seconds memory limit per test 256 megabytes input standard i ...
python 设计模式之代理模式
代理模式在一般形式上是一个类函数接口.代理可以是这些事物的接口:网络连接,存储的对象,文件,或者其他资源(昂贵的或者不容易复制的). 一个众所周知的代理模式的例子就是引用计数的指针对象. 代理模式是结 ...
SQL表操作习题5 26~35题
【译】PHP之道（PHP the right way）
刚入门的同学觉得自己能用PHP写出各种程序就很NB了,但其实作为一个专业程序员,你得有个全面点的知识结构.单元测试总得听过,文档工具总得用用,Xss总得会防.推荐大家把<PHP the righ ...
bmp，jpg，png，tif，wmf，emf与eps图片格式转换
wmf/emf是两种Microsoft Windows的图形文件格式.它是一个矢量图格式,但是也允许包含位图.本质上,一个WMF文件保存一系列可以用来重建图片的Windows GDI命令.在某种程度上 ...
iOS：新浪微博OAuth认证
新浪微博OAuth认证 1.资源的授权 •在互联网行业,比如腾讯.新浪,那用户人群是非常巨大的 •有时候要把某些用户资源共享出去,比如第三方想访问用户的QQ数据.第三方想访问用户的新浪微博数据 • ...
Vue自定义指令和路由
一.自定义指令除了默认设置的核心指令( v-model 和 v-show ), Vue 也允许注册自定义指令. 下面我们注册一个全局指令 v-focus,该指令的功能是在页面加载时,元素获得焦点: ...
leetcode题解：Valid Parentheses（栈的应用-括号匹配）
题目: Given a string containing just the characters '(', ')', '{', '}', '[' and ']', determine if the ...
wsdl2java在mac中点配置
1.打开终端,默认是用户目录,输入以下命令: ls -a 显示隐藏文件 2.打开.bash_profile,输入以下命令 open .bash_profile 配置JAVA_HOME,AXIS2_HO ...

Spark高速上手之交互式分析

1.1 Spark交互式分析

Spark高速上手之交互式分析的更多相关文章

随机推荐

热门专题