《OD学storm》20160828

一、Storm项目

1. 架构

javasdk -> nginx -> 日志文件 -> flume agent(collector) -> hdfs

　　　　　　　　　　　　　　　　　　　　　　　　　　　　-> kafka -> storm -> hbased

kafka吞吐量达，可以被不同的消费者重复消费

2. 项目需求

电商

用户提交订单并且成功支付

收集订单详情

分析：

（1）每天（每小时、每分钟）电商网站的总销售额、订单笔数

（2）基于地域（国家、省份、城市）、时段

（3）从客户角度，统计客户消费情况

（4）客户在电商网站消费行为，客户流失趋势

3. 技术框架

Storm Trident

准确度，批次

4. 实现

1）从kafka上读取数据

Trident kafkaspout

TransactionalTridentKafkaSpout：

消息处理失败重试：只能在之前的批次内进行重试，而且如果一直不成功，将会挂起Storm任务应用程序

OpaqueTridentKafkaSpout：

提供容错机制

处理失败的消息可以在其他批次内进行重试，但是只会被成功处理一次。

exactly-once 有且只有一次。

select sum(price), count(1), date

from 订单记录表

group by date

分组统计：

（1）直接进行全局统计（跨网络数据传输）

（2）先在同一批次个分区内进行局部统计（不需要进行跨网络传输），然后对局部统计好的结果进行全局统计。

group by

partitionAggregate 局部统计

persistentAggregate 全局统计

5. 使用HBase数据库进行存储统计结果状态

rowkey value：

NON-TRANSACTIONAL 统计值

TRANSACTIONAL BATCH_ID 统计值

OPAQUE TRANSACTIONAL BATCH_ID 统计值，上个批次的统计值

作业：

从客户角度，统计客户消费情况

使用trident，统计分析订单记录，求出客户每天、每小时的消费总额，消费笔数（要求使用HBase存储统计结果，能够通过drpc客户端查询）。

拓展学习：

JStorm

二、回顾

storm两条线

storm

Topology

Trident

Tuple 数据流格式 Tuple keyvalue对的集合

Storm流计算本质：对Tuple进行各种转换操作

普通Storm，转换操作写在Bolt中，msgtimeout 30秒

Trident 抽象成各种operation

Tuple Tree：启用消息可靠性保障机制后才会产生。

Spark： RDD RDD弹性分布式数据集集合

cloudera manager 如何安装

8 6 6 20G内存

8 4 4

旅游数据离线分析 3天

scala

spark 5天项目3天

《OD学storm》20160828的更多相关文章

《OD学storm》20160827
http://www.cnblogs.com/lujinhong2/p/4686512.html http://blog.csdn.net/paul_wei2008/article/details/2 ...
《OD学hive》第四周0717
一.Hive基本概念.安装部署与初步使用 1. 后续课程 Hive 项目:hadoop hive sqoop flume hbase 电商离线数据分析 CDH Storm:分布式实时计算框架 Spar ...
《OD学hadoop》20160903某旅游网项目实战
一.大数据的落地点 1.数据出售数据商城:以卖数据为公司的核心业务 2. 数据分析百度统计友盟 GA IBM analysis 3.搜索引擎 4. 推荐系统 mahout 百分比 5.精准营销 ...
《OD学HBase》20160821
一.HBase性能调优 1. JVM内存调优 MemStore内存空间,设置合理大小 memstore.flush.size 刷写大小 134217728 = 128M memstore.mslab. ...
《OD学Oozie》20160807Oozie
一.引入 MapReduce Job Hive 脚本任务同一个业务:先后.定时调度工作流: 定义工作流程 activity jbpm oozie: 大数据工作流定义与调度框架专门定义与调度Map ...
《OD学Flume》20160806Flume和Kafka
一.Flume http://flume.apache.org/FlumeUserGuide.html Flume是一个分布式的,可靠的,可用的,非常有效率的对大数据量的日志数据进行收集.聚集.移动信 ...
《OD学spark》20160924scala基础
拓展: Hadoop 3.0 NameNode HA NameNode是Active NameNode是Standby可以有多个 HBase Cluster 单节点故障? HBaster -> ...
《OD学HBase》20160820
一.案例微博: 微博内容: 关注用户和粉丝用户: 添加或移除关注用户查看关注用户的微博内容微博数据存储: 响应时间秒级无延迟 (1)mysql分布式 (2)hbase数据库使用HBase数 ...
《OD学HBase》20160814
一.HBase引入 http://hbase.apache.org/ 大数据的数据库 1. 概述 Hadoop生态系统中的一个分布式.可拓展.面向列.可伸缩,具有自动容错功能的数据库. NoSQL数据 ...

随机推荐

php/js/linux: js加密（rsa公钥加密） php解密（rsa私钥解密）
php/js/linux: js加密(rsa公钥加密) php解密(rsa私钥解密) 一: js rsa 插件 https://github.com/UFO0001/WX_RSA 或者: https: ...
分享知识-快乐自己：遍历Map集合
import java.util.HashMap; import java.util.Iterator; import java.util.Map; public class TestMap { pu ...
文本去重之MinHash算法——就是多个hash函数对items计算特征值，然后取最小的计算相似度
来源:http://my.oschina.net/pathenon/blog/65210 1.概述跟SimHash一样,MinHash也是LSH的一种,可以用来快速估算两个集合的相似度.Mi ...
IDEA-Eclipse结构项目转移到 Idea教程
1.确定Idea的svn配置 2.从svn导出项目 3.检出项目完成,开始设置 4.配置完成,设置svn忽略文件,忽略掉idea配置文件等 5. 设置完毕
java中变量的分类
•按被声明的位置划分: –成员变量:方法外部.类的内部定义的变量 –局部变量:方法或语句块内部定义的变量 –注意:类外面(类对应的大括号外面)不能有变量的声明 •按所属的数据类型划分: ...
Windows PCM音频捕获与播放实现
在WINDOWS下,音频函数有多种类型,如MCI.多媒体OLE控制.高级音频等,使用方法都比较简单.但如果想编写一个功能较强大的音频处理程序,那就必须使用低级音频函数和多媒体文件I/O来控制音频设备的 ...
Arc066_E Addition and Subtraction Hard
传送门题目大意给定一个加减法的表达式,让你任意的添加合法的括号对,使的表达式最大. 题解考虑到任意左括号一定加在减号右边,那么对于第一个左括号,与该左括号相邻的只含有加号的子序列的贡献一定为负, ...
[POI 2018] Plan Metra
[题目链接] https://www.lydsy.com/JudgeOnline/problem.php?id=5100 [算法] 首先分两类考虑 : 1. 1 -> N的路径不经过其它节点 , ...
windows7下c++11环境搭建
1.安装codeblocks 13.12 2.下载安装tdm-gcc-4.8.1-3 3.配置coldblocks的编译器(settings->compiler->compiler set ...
Poj 1017 Packets(贪心策略)
一.题目大意: 一个工厂生产的产品用正方形的包裹打包,包裹有相同的高度h和1*1, 2*2, 3*3, 4*4, 5*5, 6*6的尺寸.这些产品经常以产品同样的高度h和6*6的尺寸包袱包装起来运送给 ...

《OD学storm》20160828

《OD学storm》20160828的更多相关文章

随机推荐

热门专题