Spark Streaming、Kafka结合Spark JDBC External DataSouces处理案例

场景：使用Spark Streaming接收Kafka发送过来的数据与关系型数据库中的表进行相关的查询操作；

Kafka发送过来的数据格式为：id、name、cityId，分隔符为tab

       zhangsan

       lisi

       wangwu

       zhaoliu

MySQL的表city结构为：id int, name varchar

    bj

    sz

    sh

本案例的结果为：select s.id, s.name, s.cityId, c.name from student s join city c on s.cityId=c.id;

Kafka安装参见：Kafka单机版环境搭建

启动Kafka：

zkServer.sh start

kafka-server-start.sh  $KAFKA_HOME/config/server.properties  &

kafka-topics.sh --create --zookeeper hadoop000: --replication-factor  --partitions   --topic luogankun_topic

kafka-console-producer.sh --broker-list hadoop000: --topic luogankun_topic

实例代码：

package com.asiainfo.ocdc

case class Student(id: Int, name: String, cityId: Int)

package com.asiainfo.ocdc

import org.apache.spark.streaming._

import org.apache.spark.{SparkContext, SparkConf}

import org.apache.spark.sql.hive.HiveContext

import org.apache.spark.storage.StorageLevel

import org.apache.spark.streaming.kafka._

/**

 * Spark Streaming处理Kafka的数据并结合Spark JDBC外部数据源处理

 *

 * @author luogankun

 */

object KafkaStreaming {

  def main(args: Array[String]) {

    if (args.length < 4) {

      System.err.println("Usage: KafkaStreaming <zkQuorum> <group> <topics> <numThreads>")

      System.exit(1)

    }

    val Array(zkQuorum, group, topics, numThreads) = args

    val sparkConf = new SparkConf()

    val sc = new SparkContext(sparkConf)

    val ssc = new StreamingContext(sc, Seconds(5))

    val sqlContext = new HiveContext(sc)

    import sqlContext._

    import com.luogankun.spark.jdbc._

    //使用External Data Sources处理MySQL中的数据

    val cities = sqlContext.jdbcTable("jdbc:mysql://hadoop000:3306/test", "root", "root", "select id, name from city")

    //将cities RDD注册成city临时表

    cities.registerTempTable("city")

    val topicpMap = topics.split(",").map((_, numThreads.toInt)).toMap

    val inputs = KafkaUtils.createStream(ssc, zkQuorum, group, topicpMap, StorageLevel.MEMORY_AND_DISK_SER).map(_._2)

    inputs.foreachRDD(rdd => {

      if (rdd.partitions.length > 0) {

        //将Streaming中接收到的数据注册成student临时表

        rdd.map(_.split("\t")).map(x => Student(x(0).toInt, x(1), x(2).toInt)).registerTempTable("student")

        //关联Streaming和MySQL表进行查询操作

        sqlContext.sql("select s.id, s.name, s.cityId, c.name from student s join city c on s.cityId=c.id").collect().foreach(println)

      }

    })

    ssc.start()

    ssc.awaitTermination()

  }

}

提交到集群执行脚本：sparkstreaming_kafka_jdbc.sh

#!/bin/sh

. /etc/profile

set -x

cd $SPARK_HOME/bin

spark-submit \

--name KafkaStreaming \

--class com.asiainfo.ocdc.KafkaStreaming \

--master spark://hadoop000:7077 \

--executor-memory 1G \

--total-executor-cores  \

/home/spark/software/source/streaming-app/target/streaming-app-V00B01C00-SNAPSHOT-jar-with-dependencies.jar \

hadoop000: test-consumer-group luogankun_topic

Spark Streaming、Kafka结合Spark JDBC External DataSouces处理案例的更多相关文章

Spark Streaming、HDFS结合Spark JDBC External DataSouces处理案例
场景:使用Spark Streaming接收HDFS上的文件数据与关系型数据库中的表进行相关的查询操作: 使用技术:Spark Streaming + Spark JDBC External Data ...
Spark踩坑记——Spark Streaming+Kafka
[TOC] 前言在WeTest舆情项目中,需要对每天千万级的游戏评论信息进行词频统计,在生产者一端,我们将数据按照每天的拉取时间存入了Kafka当中,而在消费者一端,我们利用了spark strea ...
Spark Streaming+Kafka
Spark Streaming+Kafka 前言在WeTest舆情项目中,需要对每天千万级的游戏评论信息进行词频统计,在生产者一端,我们将数据按照每天的拉取时间存入了Kafka当中,而在消费者一端, ...
spark streaming kafka example
// scalastyle:off println package org.apache.spark.examples.streaming import kafka.serializer.String ...
spark streaming - kafka updateStateByKey 统计用户消费金额
场景餐厅老板想要统计每个用户来他的店里总共消费了多少金额,我们可以使用updateStateByKey来实现从kafka接收用户消费json数据,统计每分钟用户的消费情况,并且统计所有时间所有用户 ...
Spark Streaming + Kafka整合(Kafka broker版本0.8.2.1+)
这篇博客是基于Spark Streaming整合Kafka-0.8.2.1官方文档. 本文主要讲解了Spark Streaming如何从Kafka接收数据.Spark Streaming从Kafka接 ...
【Spark】Spark Streaming + Kafka direct 的 offset 存入Zookeeper并重用
Spark Streaming + Kafka direct 的 offset 存入Zookeeper并重用 streaming offset设置_百度搜索将 Spark Streaming + K ...
Spark踩坑记：Spark Streaming+kafka应用及调优
前言在WeTest舆情项目中,需要对每天千万级的游戏评论信息进行词频统计,在生产者一端,我们将数据按照每天的拉取时间存入了Kafka当中,而在消费者一端,我们利用了spark streaming从k ...
Spark streaming + Kafka 流式数据处理，结果存储至MongoDB、Solr、Neo4j（自用）
KafkaStreaming.scala文件 import kafka.serializer.StringDecoder import org.apache.spark.SparkConf impor ...

随机推荐

Hadoop生态上几个技术的关系与区别：hive、pig、hbase 关系与区别
初接触Hadoop技术的朋友肯定会对它体系下寄生的个个开源项目糊涂了,我敢保证Hive,Pig,HBase这些开源技术会把你搞的有些糊涂,不要紧糊涂的不止你一个,如某个菜鸟的帖子的疑问,when to ...
VMware Workstation 10.0.4.2249910 CN
VMware Workstation 10.0.4.2249910.exe Workstation10.0.4修复了微软Windows 8.1和Windows Server 2012操作系统中的内存问 ...
Using Interface Builder记录
1.interface builder的作用主要是用来设计视图,文件的拓展名诶.storyboard或者.xib :这两文件的区别是,.xib文件只能设计一个视图控制器,也就只能显示一个视图,.sto ...
php大力力 [043节] 现在要做个删除前的提示功能
php大力力 [043节] 现在要做个删除前的提示功能
Mark一下，一上午就这么过去了，关于客户端连接oracle10G的问题
Mark一下,一上午就这么过去了,关于客户端连接oracle10G的问题正常的客户端PLSQL和Navicat都可以正常连接Oracle(局域网内),但代码生成器和VS2015死活连不上,在网上找了 ...
简单的线性分类——MATLAB，python3实现
看李政轩老师讲的Kernel,讲的非常好!前面有几道作业题,用MATLAB简单做了下,不知道对不对,错误之处还请指出. 题目是这样的. 一.MATLAB版本: clear; clc % 生成train ...
[Java Basics] multi-threading
1, Process&Threads Most implementations of the Java virtual machine run as a single process. Thr ...
YII2.0 验证表单
控制器代码 <?php namespace app\modules\pub\controllers; use Yii; use backend\base\BaseController; use ...
委托Delegate，多播委托和委托链
定义一个委托 public delegate void CalculateDelegate(int 32 x,int 32 y); 定义一个委托类型的变量 public static Calculat ...
P,NP,NPC,NPC-HARD
P: 能在多项式时间内解决的问题 NP: 不能在多项式时间内解决或不确定能不能在多项式时间内解决,但能在多项式时间验证的问题 NPC: NP完全问题,所有NP问题在多项式时间内都能约化(Reducib ...

Spark Streaming、Kafka结合Spark JDBC External DataSouces处理案例

Spark Streaming、Kafka结合Spark JDBC External DataSouces处理案例的更多相关文章

随机推荐

热门专题