【慕课网实战】Spark Streaming实时流处理项目实战笔记二之铭文升级版

铭文一级：

第二章：初识实时流处理

需求：统计主站每个(指定)课程访问的客户端、地域信息分布
地域：ip转换 Spark SQL项目实战
客户端：useragent获取 Hadoop基础课程
==> 如上两个操作：采用离线(Spark/MapReduce)的方式进行统计

实现步骤：
课程编号、ip信息、useragent
进行相应的统计分析操作：MapReduce/Spark

项目架构
日志收集：Flume
离线分析：MapReduce/Spark
统计结果图形化展示

问题
小时级别
10分钟
5分钟
1分钟
秒级别

如何解决？？？ ==》实时流处理框架

离线计算与实时计算的对比
1) 数据来源
离线： HDFS 历史数据数据量比较大
实时：消息队列(Kafka)，实时新增/修改记录过来的某一笔数据

2）处理过程
离线： MapReduce： map + reduce
实时： Spark(DStream/SS)

3) 处理速度
离线：慢
实时：快速

4）进程
离线：启动+销毁
实时： 7*24

第三章：分布式日志收集框架Flume

现状分析：见图

如何解决我们的数据从其他的server上移动到Hadoop之上？？？
shell cp hadoop集群的机器上， hadoop fs -put ..... /

===> Flume

铭文二级：

第二章：初识实时流处理

实时流处理框架的产生背景：时效性高数据量大

实时流处理与离线处理的对比=>

1.数据来源 2.处理过程 3.处理速度 4.进程（MapReduce进程启动与销毁需要消耗大量资源而且实时性跟不上）

实时流框架对比=>

Storm（真正的来一个处理一个）、Spark Streaming（时间间隔小批次处理）、IBM Stream、Yahoo！S4、LinkedIn kafka、Flink（可离线可实时）

实时流处理流程=>

Webapp->WebServer->Flume->Kafka->Spark/Storm->RDBMS/NoSQL->可视化展示

　　　产生　　采集清洗分析入库可视化

实时流处理在企业中的应用：电信行业（实时监控流量是否超出）电商行业

第三章：分布式日志收集框架Flume

传统从Server到Hadoop处理上存在的问题=>

1.难以监控 2.IO的读写开销大 3.容错率高，负载均衡差 4.高延时，需隔一段时间启动

【慕课网实战】Spark Streaming实时流处理项目实战笔记二之铭文升级版的更多相关文章

【慕课网实战】Spark Streaming实时流处理项目实战笔记十之铭文升级版
铭文一级: 第八章:Spark Streaming进阶与案例实战 updateStateByKey算子需求:统计到目前为止累积出现的单词的个数(需要保持住以前的状态) java.lang.Illega ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记七之铭文升级版
铭文一级: 第五章:实战环境搭建 Spark源码编译命令:./dev/make-distribution.sh \--name 2.6.0-cdh5.7.0 \--tgz \-Pyarn -Phado ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记十四之铭文升级版
铭文一级: 第11章 Spark Streaming整合Flume&Kafka打造通用流处理基础 streaming.conf agent1.sources=avro-sourceagent1 ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记十六之铭文升级版
铭文一级: linux crontab 网站:http://tool.lu/crontab 每一分钟执行一次的crontab表达式: */1 * * * * crontab -e */1 * * * ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记十五之铭文升级版
铭文一级:[木有笔记] 铭文二级: 第12章 Spark Streaming项目实战行为日志分析: 1.访问量的统计 2.网站黏性 3.推荐 Python实时产生数据访问URL->IP信息- ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记十二之铭文升级版
铭文一级: ======Pull方式整合 Flume Agent的编写: flume_pull_streaming.conf simple-agent.sources = netcat-sources ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记十一之铭文升级版
铭文一级: 第8章 Spark Streaming进阶与案例实战黑名单过滤访问日志 ==> DStream20180808,zs20180808,ls20180808,ww ==> ( ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记九之铭文升级版
铭文一级: 核心概念:StreamingContext def this(sparkContext: SparkContext, batchDuration: Duration) = { this(s ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记八之铭文升级版
铭文一级: Spark Streaming is an extension of the core Spark API that enables scalable, high-throughput, ...

随机推荐

微信网页JS分享，微信二次分享无缩略图问题
很多时候我们要在微信中分享h5网页,这个时候就得用微信的分享接口来自定义分享的地址.标题.描述.缩略图了. 分享到微信的时候遇到一个问题,就是第一次分享到微信里,是正确的,但是在微信打开分享的链接,再 ...
ROS与深度相机入门教程-在ROS使用kinect v1摄像头
ROS与深度相机入门教程-在ROS使用kinect v1摄像头说明: 介绍在ros安装和使用kinect v1摄像头介绍freenect包安装驱动 deb安装 $ sudo apt-get in ...
Python中setup.py一些不为人知的技巧
http://python.jobbole.com/80912/ 在我开始之前,我想先说清楚我将要解释的是些“窍门”.他们不是“最好的做法”,至少在一种情况下是不可取的. 说到不可取的做法,我会适时写 ...
poj 2777(线段树+lazy思想) 小小粉刷匠
http://poj.org/problem?id=2777 题目大意涂颜色,输入长度,颜色总数,涂颜色次数,初始颜色都为1,然后当输入为C的时候将x到y涂为颜色z,输入为Q的时候输出x到y的颜色总 ...
Java界面编程—事件的种类
Java处理事件相应的类和监听接口大多位于 awt 包中. 在 java.swing.event 包中有专门用于 swing 组件的事件类和监听接口. awt 事件类继承自 AWTEvent,其超类是 ...
Spring 中参数名称解析 - ParameterNameDiscoverer
Spring 中参数名称解析 - ParameterNameDiscoverer Spring 系列目录(https://www.cnblogs.com/binarylei/p/10198698.ht ...
【jquery+easyUI】-- $.messager.show 弹框显示
三种基本弹框 1.提示框,一秒停留 $.messager.show({ title: '提示', msg: '修改成功!', showType: 'fade', //设置显示类型 style: { l ...
3DES加密及.NET弱密钥处理
背景智能pos机开发项目需要指定Key加密某些关键字符串.商定采用3DES加密算法. 实践网海中很多.NET C#编写3DES加密的函数.采集一段简明.成熟的代码,归置于常用程序集.但当指定Key ...
mac install brew
$ ruby -e "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/master/install)" ...
网上流行的linux内核漫画

【慕课网实战】Spark Streaming实时流处理项目实战笔记二之铭文升级版

【慕课网实战】Spark Streaming实时流处理项目实战笔记二之铭文升级版的更多相关文章

随机推荐

热门专题