SparkStreaming API using DataSets and DataFrames (New)

使用流式DataSets和流式DataFrames的API

　　◆ 1.创建流式DataFrames和流式Datasets(重点)
　　◆ 2.流式DataFrames/Datasets的操作(重点)
　　◆ 3.启动流查询(重点)
　　◆ 4.管理流查询(了解)
　　◆ 5.监控流查询(了解)
　　◆ 6.使用检查点从故障中恢复(重点)

1.创建流式DataFrames和流式Datasets(重点)

　　◆ 输入源(Input Source)　　　

　　　　File Source
　　　　Kafka Source
　　　　Socket Source (测试)
　　　　Rate Source (测试,实验性)

　　◆ 流式DataFrames/Datasets的结构类型推断与划分

FileSource：

◆ 须知:从目录中读取文件来作为输入数据流。
支持文件的格式有: text, csv, json, orc, parquet。
◆ 注意:支持glob路径，但不支持多个逗号分隔路径golbs。
◆ 属性:有五个option可以设置：
➢ path:输入目录的路径，对所有文件格式都是通用的
➢ maxFilesPerTrigger:在每个触发器中要考虑的新文件的最大数目（默认值：没有最大值）
➢ latestFirst:首先是否处理最新的新文件，当有大量的文件积压时是有用的（默认值：false）
➢ maxFileAge:默认值是7d 一周:如果latestFirst=true和maxFilesPerTrigger被设置,此配置不生效
➢ fileNameOnly:是否只基于文件名检查新文件而不是完整路径（默认值：false）
将这个值设置为“true”时,下面的文件将被视为同一个文件，
因为它们的文件名“dataset .txt”是相同的: “file：///dataset”
“s3://a/dataset”
“s3n://a/b/dataset”
“s3a://a/b/c/dataset””
◆ 其他配置可以参照以下这个类：
➢ org.apache.spark.sql.execution.streaming.FileStreamOptions

Kafka Source

◆ 须知:Kafka broker的版本需要是0.10.0或者更高版本。
◆ 要使用Kafka，项目的pom.xml需要引入Kafka的依赖
➢ 
<dependency>
<groupId>org.apache.spark</groupId>
<artifactId>spark-sql-kafka-0-10_2.11</artifactId>
<version>2.3.0</version>
</dependency>

◆ Options 必须设置：
➢ kafka.bootstrap.servers （指定kafka的访问地址host1:port1,host2:port2）
➢ subscribe/subscribepattern/assign（指定kafka中的主题）
➢ failondataloss（数据丢失报错）
➢ startingoffsets 读取数据的起始偏移量
➢ endingoffsets 读取数据的截止偏移量(在流式操作中此配置不生效)
◆ 其他配置可以参照以下这两个类：
➢ org.apache.kafka.clients.CommonClientConfigs
➢ org.apache.kafka.clients.consumer.ConsumerConfig

SocketSource

◆ 须知:从Socket连接中读取UTF8文本数据。在驱动器程序中监听服务网络端口。
◆ 注意:Socket Source只适用于测试,因为它不支持端到端的容错保证。
◆ 有三个option可以设置:
➢ host(必须)
➢ port(必须)
➢ includeTimestamp 默认值false 不生成时间戳日期
◆ 其他配置可以参照以下这个类：
➢ org.apache.spark.sql.execution.streaming.TextSocketSource

RateSource

◆ 须知:只支持测试
◆ 注意: 只有在连续模式中支持的选项才是Nuffice分区和RayScript第二个。

流式DataFrames/Datasets的结构类型推断与划分

　　◆ 默认情况下，基于文件源的结构化流要求必须指定schema，这种限制确保即
　　使在失败的情况下也会使用一致的模式来进行流查询。
　　◆ 对于特殊用例，可以通过设置spark.sql.streaming.schemaInference = true。
　　此时将会开启Spark自动类型推断功能。
　　◆ 注意：默认Spark sql中自动类型推断为启动状态。
　　◆ 当读取数据的目录中出现/key=value/ 的子目录时，Spark将自动递归这些子目
　　录，产生分区发现。
　　◆ 如果用户提供的 schema 中出现了这些列， Spark将会根据正在读取的文件路
　　径进行填充。
　　◆ 构成分区结构的目录必须在查询开始时是存在的，并且必须保持static 。
　　➢ 例如，当 /data/year=2015/ 存在时，可以添加 /data/year=2016/，但是更改
　　分区列将无效的(即通过创建目录 /data/date=2016-04-17/ ）。
　　◆ 注意：如果希望得到的数据可以按照/key=value/这种目录生成时，可以在输出
　　数据时借助于partitionBy(“columnName”)

StructuredStreaming(New)的更多相关文章

2，StructuredStreaming的事件时间和窗口操作
推荐阅读:1,StructuredStreaming简介使用Structured Streaming基于事件时间的滑动窗口的聚合操作是很简单的,很像分组聚合.在一个分组聚合操作中,聚合值被唯一保存在 ...
StructuredStreaming简单的例子（NewAPI）
StructuredStreaming简单的例子(NewAPI)(wordCount) package com.briup.streaming.structed import org.apache.l ...
StructuredStreaming编程模型
StructuredStreaming编程模型基本概念 ◆ Time ◆ Trigger ◆ Input ◆ Query ◆ Result ◆ Output 案例模型:实时处理流单词统计编程模型 ...
spark structured-streaming 最全的使用总结
一.spark structured-streaming 介绍我们都知道spark streaming 在v2.4.5 之后就进入了维护阶段,不再有新的大版本出现,而且 spark strea ...
Structured-Streaming之窗口操作
Structured Streaming 之窗口事件时间聚合操作 Spark Streaming 中 Exactly Once 指的是: 每条数据从输入源传递到 Spark 应用程序 Exactly ...
StructuredStreaming基础操作和窗口操作
一.流式DataFrames/Datasets的结构类型推断与划分 ◆ 默认情况下,基于文件源的结构化流要求必须指定schema,这种限制确保即使在失败的情况下也会使用一致的模式来进行流查询. ◆ ...
Spark学习之路（十八）SparkSQL简单使用
一.SparkSQL的进化之路 1.0以前: Shark 1.1.x开始: SparkSQL(只是测试性的) SQL 1.3.x: SparkSQL(正式版本)+Dataframe 1.5.x: S ...
Spark（十二）SparkSQL简单使用
一.SparkSQL的进化之路 1.0以前: Shark 1.1.x开始:SparkSQL(只是测试性的) SQL 1.3.x: SparkSQL(正式版本)+Datafram ...
Flink 靠什么征服饿了么工程师？
Flink 靠什么征服饿了么工程师? 2018-08-13 易伟平阿里妹导读:本文将为大家展示饿了么大数据平台在实时计算方面所做的工作,以及计算引擎的演变之路,你可以借此了解Storm.Spa ...

随机推荐

使用expect在script中切换到root用户(精华)
使用expect在script中切换到root用户 1.尚观版本 http://www.uplook.cn/biancheng/133/1335040/ 1 a. 命令行: /usr/bin/expe ...
linux gdb 入门级教程（小白专用）
送给包含我在内的所有小白: 对于养linux真姬的本小白来说,既然你选择养它,那你就要满足他．如果你养了它是为了码代码,那我觉得gdb应该是它的基本需求了吧?! 然而gdb哪有那些IDE来的简单啊, ...
第二章 Java基础知识（下）
2.1.分支结构(if.switch) 2.1.1.if语句格式一: if (关系表达式) { 语句体; } 流程一: ①首先计算关系表达式的值 ②如果关系表达式的值为true就执行语句体 ③如果关 ...
Spring学习之动态代理的简单实现
先说一下代理模式的好处 1.可以使真实角色的操作更加纯粹,不用去关注一些公共的业务 2.公共的交给代理角色,实现了业务的分工 3.公共业务发生扩展的时候,方便集中管理静态代理模式的缺点 1.一个真实 ...
IntelliJ IDEA 2020.2正式发布，诸多亮点总有几款能助你提效
向工具人致敬.本文已被 https://www.yourbatman.cn 收录,里面一并有Spring技术栈.MyBatis.JVM.中间件等小而美的专栏供以免费学习.关注公众号[BAT的乌托邦]逐 ...
获取全部 txt 文本中出现次数最多的前N个词汇
1.使用 chain 对 allwords 二维列表进行解包 from itertools import chain allwords = [] allwords.append(列表) 解包: cha ...
PHP ftp_nb_fput() 函数
定义和用法 ftp_nb_fput() 函数上传本地一个已经打开的文件,并在 FTP 服务器上把它保存为一个文件.(无阻塞) 该函数返回下列值之一: FTP_FAILED(发送/获取失败) FTP_F ...
PHP xml_set_element_handler() 函数
定义和用法 xml_set_element_handler() 函数规定在 XML 文档中元素的起始和终止调用的函数. 如果成功,该函数则返回 TRUE.如果失败,则返回 FALSE.高佣联盟 www ...
基于asp.net core 从零搭建自己的业务框架（二）
前言对于项目的迭代,如何降低复杂性的要求高于性能以及技术细节的一个易用的项目,才能迭代到比拼性能,最后拼刺刀的阶段传统单体项目,都是传统三层,直接请求响应的模式,这类称为Rpc模式,易用性上非常 ...
ios企业签名为什么会掉签？
我们都知道ios用户无法直接安装App Store之外的应用,对于那些无法上架苹果应用商店的APP,开发者们一般会选择苹果签名的形式. 目前的苹果签名有ios企业签名.超级签名和TF上架这三种 ...