sparkStreaming消费kafka-0.8方式：direct方式（存储offset到zookeeper）

生产中，为了保证kafka的offset的安全性，并且防止丢失数据现象，会手动维护偏移量（offset）

版本：kafka：0.8

其中需要注意的点：

1：获取zookeeper记录的分区偏移量

2：获取broker中实际的最小和最大偏移量

3：将实际的偏移量和zookeeper记录的偏移量进行对比，如果zookeeper中记录的偏移量在实际的偏移量范围内则使用zookeeper中的偏移量

4：反之，使用实际的broker中的最小偏移量

KafkaHelper：

import kafka.common.TopicAndPartition

import kafka.message.MessageAndMetadata

import kafka.serializer.StringDecoder

import kafka.utils.{ZKGroupTopicDirs, ZkUtils}

import org.I0Itec.zkclient.ZkClient

import org.apache.spark.SparkException

import org.apache.spark.streaming.StreamingContext

import org.apache.spark.streaming.dstream.InputDStream

import org.apache.spark.streaming.kafka.{KafkaCluster, KafkaUtils, OffsetRange}

import org.apache.spark.streaming.kafka.KafkaCluster.Err

/**

  * KafkaHelper类提供两个共有方法，一个用来创建direct方式的DStream，另一个用来更新zookeeper中的消费偏移量

  * @param kafkaPrams kafka配置参数

  * @param zkQuorum zookeeper列表

  * @param group 消费组

  * @param topic 消费主题

  */

class KafkaHelper(kafkaPrams:Map[String,String],zkQuorum:String,group:String,topic:String) extends Serializable{

  private val kc = new KafkaCluster(kafkaPrams)

  private val zkClient = new ZkClient(zkQuorum)

  private val topics = Set(topic)

  /**

    * 获取消费组group下的主题topic在zookeeper中的保存路径

    * @return

    */

  private def getZkPath():String={

    val topicDirs = new ZKGroupTopicDirs(group,topic)

    val zkPath = topicDirs.consumerOffsetDir

    zkPath

  }

  /**

    * 获取偏移量信息

    * @param children 分区数

    * @param zkPath zookeeper中的topic信息的路径

    * @param earlistLeaderOffsets broker中的实际最小偏移量

    * @param latestLeaderOffsets broker中的实际最大偏移量

    * @return

    */

  private def getOffsets(children:Int,zkPath:String,earlistLeaderOffsets:Map[TopicAndPartition, KafkaCluster.LeaderOffset],latestLeaderOffsets: Map[TopicAndPartition, KafkaCluster.LeaderOffset]): Map[TopicAndPartition, Long] = {

    var fromOffsets: Map[TopicAndPartition, Long] = Map()

    for(i <- 0 until children){

      //获取zookeeper记录的分区偏移量

      val zkOffset = zkClient.readData[String](s"${zkPath}/${i}").toLong

      val tp = TopicAndPartition(topic,i)

      //获取broker中实际的最小和最大偏移量

      val earlistOffset: Long = earlistLeaderOffsets(tp).offset

      val latestOffset: Long = latestLeaderOffsets(tp).offset

      //将实际的偏移量和zookeeper记录的偏移量进行对比，如果zookeeper中记录的偏移量在实际的偏移量范围内则使用zookeeper中的偏移量，

      //反之，使用实际的broker中的最小偏移量

      if(zkOffset>=earlistOffset && zkOffset<=latestOffset) {

        fromOffsets += (tp -> zkOffset)

      }else{

        fromOffsets += (tp -> earlistOffset)

      }

    }

    fromOffsets

  }

  /**

    * 创建DStream

    * @param ssc

    * @return

    */

  def createDirectStream(ssc:StreamingContext):InputDStream[(String, String)]={

    //----------------------获取broker中实际偏移量---------------------------------------------

    val partitionsE: Either[Err, Set[TopicAndPartition]] = kc.getPartitions(topics)

    if(partitionsE.isLeft)

      throw new SparkException("get kafka partitions failed:")

    val partitions = partitionsE.right.get

    val earlistLeaderOffsetsE: Either[Err, Map[TopicAndPartition, KafkaCluster.LeaderOffset]] = kc.getEarliestLeaderOffsets(partitions)

    if(earlistLeaderOffsetsE.isLeft)

      throw new SparkException("get kafka earlistLeaderOffsets failed:")

    val earlistLeaderOffsets: Map[TopicAndPartition, KafkaCluster.LeaderOffset] = earlistLeaderOffsetsE.right.get

    val latestLeaderOffsetsE: Either[Err, Map[TopicAndPartition, KafkaCluster.LeaderOffset]] = kc.getLatestLeaderOffsets(partitions)

    if(latestLeaderOffsetsE.isLeft)

      throw new SparkException("get kafka latestLeaderOffsets failed:")

    val latestLeaderOffsets: Map[TopicAndPartition, KafkaCluster.LeaderOffset] = latestLeaderOffsetsE.right.get

    //----------------------创建kafkaStream----------------------------------------------------

    var kafkaStream:InputDStream[(String, String)]=null

    val zkPath: String = getZkPath()

    val children = zkClient.countChildren(zkPath)

    //根据zookeeper中是否有偏移量数据判断有没有消费过kafka中的数据

    if(children > 0){

      val fromOffsets:Map[TopicAndPartition, Long] = getOffsets(children,zkPath,earlistLeaderOffsets,latestLeaderOffsets)

      val messageHandler = (mmd: MessageAndMetadata[String, String]) => (mmd.topic, mmd.message())

      //如果消费过，根据偏移量创建Stream

      kafkaStream = KafkaUtils.createDirectStream[String, String, StringDecoder, StringDecoder, (String, String)](

        ssc, kafkaPrams, fromOffsets, messageHandler)

    }else{

      //如果没有消费过，根据kafkaPrams配置信息从最早的数据开始创建Stream

      kafkaStream = KafkaUtils.createDirectStream[String, String, StringDecoder, StringDecoder](ssc, kafkaPrams, topics)

    }

    kafkaStream

  }

  /**

    * 更新zookeeper中的偏移量

    * @param offsetRanges

    */

  def updateZkOffsets(offsetRanges:Array[OffsetRange])={

    val zkPath: String = getZkPath()

    for( o <- offsetRanges){

      val newZkPath = s"${zkPath}/${o.partition}"

      //将该 partition 的 offset 保存到 zookeeper

      ZkUtils.updatePersistentPath(zkClient, newZkPath, o.fromOffset.toString)

    }

  }

}

驱动类：

package CC

import org.apache.spark.SparkConf

import org.apache.spark.sparkStreaming.kafka.KafkaHelper

import org.apache.spark.streaming.dstream.InputDStream

import org.apache.spark.streaming.kafka.{HasOffsetRanges, OffsetRange}

import org.apache.spark.streaming.{Seconds, StreamingContext}

/**

  * Created by angel；

  */

object TestKafkaHelper {

  def main(args: Array[String]): Unit = {

    val Array(timeInterval,brokerList,zkQuorum,topic,group) = Array(

      "2"

      , "hadoop01:9092,hadoop02:9092,hadoop03:9092"

      , "hadoop01:2181,hadoop02:2181,hadoop03:2181"

      , "CustomerContacts"

      , "CustomerContacts"

    )

    val conf = new SparkConf().setAppName("KafkaDirectStream").setMaster("local[2]")

    val ssc = new StreamingContext(conf,Seconds(timeInterval.toInt))

    //kafka配置参数

    val kafkaParams = Map(

      "metadata.broker.list" -> brokerList,

      "group.id" -> group,

      "auto.offset.reset" -> kafka.api.OffsetRequest.SmallestTimeString

    )

    val kafkaHelper = new KafkaHelper(kafkaParams,zkQuorum,topic,group)

    val kafkaStream: InputDStream[(String, String)] = kafkaHelper.createDirectStream(ssc)

    var offsetRanges = Array[OffsetRange]()

    kafkaStream.transform( rdd =>{

      offsetRanges = rdd.asInstanceOf[HasOffsetRanges].offsetRanges

      rdd

    }).map( msg => msg._2)

      .foreachRDD( rdd => {

        rdd.foreachPartition( partition =>{

          partition.foreach( record =>{

            //处理数据的方法

            println(record)

          })

        })

        kafkaHelper.updateZkOffsets(offsetRanges)

      })

    ssc.start()

    ssc.awaitTermination()

    ssc.stop()

  }

}

sparkStreaming消费kafka-0.8方式：direct方式（存储offset到zookeeper）的更多相关文章

SparkStreaming获取kafka数据的两种方式：Receiver与Direct
简介: Spark-Streaming获取kafka数据的两种方式-Receiver与Direct的方式,可以简单理解成: Receiver方式是通过zookeeper来连接kafka队列, Dire ...
SparkStreaming与Kafka，SparkStreaming接收Kafka数据的两种方式
SparkStreaming接收Kafka数据的两种方式 SparkStreaming接收数据原理一.SparkStreaming + Kafka Receiver模式二.SparkStreami ...
sparkStreaming消费kafka-1.0.1方式：direct方式（存储offset到zookeeper）-- 2
参考上篇博文:https://www.cnblogs.com/niutao/p/10547718.html 同样的逻辑,不同的封装 package offsetInZookeeper /** * Cr ...
sparkStreaming消费kafka-1.0.1方式：direct方式（存储offset到zookeeper）
版本声明: kafka:1.0.1 spark:2.1.0 注意:在使用过程中可能会出现servlet版本不兼容的问题,因此在导入maven的pom文件的时候,需要做适当的排除操作 <?xml ...
SparkStreaming消费kafka中数据的方式
有两种:Direct直连方式.Receiver方式 1.Receiver方式: 使用kafka高层次的consumer API来实现,receiver从kafka中获取的数据都保存在spark exc ...
Spark-Streaming获取kafka数据的两种方式：Receiver与Direct的方式
简单理解为:Receiver方式是通过zookeeper来连接kafka队列,Direct方式是直接连接到kafka的节点上获取数据 Receiver 使用Kafka的高层次Consumer API来 ...
解析SparkStreaming和Kafka集成的两种方式
spark streaming是基于微批处理的流式计算引擎,通常是利用spark core或者spark core与spark sql一起来处理数据.在企业实时处理架构中,通常将spark strea ...
工具篇-Spark-Streaming获取kafka数据的两种方式（转载）
转载自:https://blog.csdn.net/weixin_41615494/article/details/7952173 一.基于Receiver的方式原理 Receiver从Kafka中 ...
spark-streaming获取kafka数据的两种方式
简单理解为:Receiver方式是通过zookeeper来连接kafka队列,Direct方式是直接连接到kafka的节点上获取数据一.Receiver方式: 使用kafka的高层次Consumer ...

随机推荐

QT 开发小记
1.开发socket网络通信时,需要在.pro 文件中添加 network项 QT += network 2. 报错: mutilple definition of 时,查看 .pro ...
HDU 5446
题意: 大组合数取余 (素数连乘) 思路: 对于答案 X X % pi = ai === C(m,n) % pi: 然后就是用孙子定理求出X, ai 用卢卡斯定理求得中间 LL * LL 会爆, ...
HDU 1796 (容斥原理）
容斥原理练习题,忘记处理gcd 和 lcm,wa了几发0.0. #include<iostream> #include<cstdio> #include<cstring& ...
HDU 5297
用x ^ (1 / n) 来求个数,容斥原理 , Num会向后移动, 迭代到不再变化,退出循环 #include<iostream> #include<cstdio> #inc ...
【原创】Linux基础之命令行浏览器links
有时服务器环境受限,比如在内网环境不能暴露端口从外网访问,用curl看html代码比较累,这时可以使用命令行浏览器来查看相关页面 links 官方:http://links.twibright.com ...
word在线预览编辑器
https://blog.csdn.net/liuli283/article/details/73776685 https://blog.csdn.net/mxljiayou/article/deta ...
C# 防止content-type修改后上传恶意文件
以图片为例子.在上传图片的时候,使用Fiddler抓取通过js判断文件类型是不安全的,所以通过后台来判断,代码如下: ) { HttpPostedFile file0 = Request.Files ...
7)django-示例(cbv)
CBV(class base view)一个url根据method方式调用相应的方法.method常用有get,post 如果是GET请求,Home类会调用get方法,如果是POST提交数据,则类会调 ...
机器学习之线性回归---logistic回归---softmax回归
在本节中,我们介绍Softmax回归模型,该模型是logistic回归模型在多分类问题上的推广,在多分类问题中,类标签可以取两个以上的值. Softmax回归模型对于诸如MNIST手写数字分类等问题 ...
Ubuntu16.04配置Tomcat的80端口访问
[问题描述] 在阿里云 ECS 服务器 Ubuntu16.04 下部署 Java Web 应用时,发现配置的 Tomcat 服务启动后 80 端口无法被监听. [问题原因] 出现该问题的主要原因是:非 ...

sparkStreaming消费kafka-0.8方式：direct方式（存储offset到zookeeper）

KafkaHelper：

驱动类：

sparkStreaming消费kafka-0.8方式：direct方式（存储offset到zookeeper）的更多相关文章

随机推荐

热门专题