第一步: 需求分析

需要哪些字段(时间:每一天,各个时段,id,url,guid,tracTime)
需要分区为天/时
PV(统计记录数)
UV(guid去重)

第二步: 实施步骤

建Hive表,表列分隔符和文件保持一至
Load数据到Hive表中
写HiveSql进行统计,将结果放入Hive另一张表中(数据清洗)
从Hive的另一张表中的数据导出到Mysql,使用sqoop
网站项目从Mysql读取这张表的信息

预期结果

日期		小时		PV		UV

第三步: 实施

# 建源表(注意进入beeline用户名密码是linux的)
  create database if not exists track_log;
  use track_log;
  create table if not exists yhd_source(
  id string,
  url string,
  referer string,
  keyword string,
  type string,
  guid string,
  pageId string,
  moduleId string,
  linkId string,
  attachedInfo string,
  sessionId string,
  trackerU string,
  trackerType string,
  ip string,
  trackerSrc string,
  cookie string,
  orderCode string,
  trackTime string,
  endUserId string,
  firstLink string,
  sessionViewNo string,
  productId string,
  curMerchantId string,
  provinceId string,
  cityId string,
  fee string,
  edmActivity string,
  edmEmail string,
  edmJobId string,
  ieVersion string,
  platform string,
  internalKeyword string,
  resultSum string,
  currentPage string,
  linkPosition string,
  buttonPosition string
  )row format delimited fields terminated by '\t'
  stored as textfile
  load data local inpath '/home/liuwl/opt/datas/2015082818' into table yhd_source;
  load data local inpath '/home/liuwl/opt/datas/2015082819' into table yhd_source;
# 创建清洗表
  create table if not exists yhd_clean(
  id string,
  url string,
  guid string,
  date string,
  hour string)
  row format delimited fields terminated by '\t'
  insert into table yhd_clean select id,url,guid,substring(trackTime,9,2) date,substring(trackTime,12,2) hour from yhd_source;
  select id,date,hour from yhd_clean limit 5;
# 改建分区表(静态分区)
  create table if not exists yhd_part1(
  id string,
  url string,
  guid string
  ) partitioned by (date string,hour string)
  row format delimited fields terminated by '\t'
  insert into table yhd_part1 partition (date='28',hour='18') select id,url,guid from yhd_clean where date='28' and hour='18';
  insert into table yhd_part1 partition (date='28',hour='19') select id,url,guid from yhd_clean where date='28' and hour='19';
  select id,date ,hour from yhd_part1 where date ='28' and hour='18' limit 10;
# 使用动态分区需要修改部分参数
 hive.exec.dynamic.partition--true
 hive.exec.dynamic.partition.mode--nonstrict
  create table if not exists yhd_part2(
  id string,
  url string,
  guid string
  ) partitioned by (date string,hour string)
  row format delimited fields terminated by '\t'
# 动态分区根据partition字段进行匹配
  insert into table yhd_part2 partition (date,hour) select * from yhd_clean;
  select id,date ,hour from yhd_part2 where date ='28' and hour='18' limit 10;
# 实现需求
  PV: select date,hour,count(url) PV from yhd_part1 group by date,hour;
  0: jdbc:hive2://hadoop09-linux-01.ibeifeng.co> select date,hour,count(url) PV from yhd_part1 group by date,hour;
  +-------+-------+--------+--+
  | date | hour | pv |
  +-------+-------+--------+--+
  | 28 | 18 | 64972 |
  | 28 | 19 | 61162 |
  +-------+-------+--------+--+
  UV: select date,hour,count(distinct(guid)) UV from yhd_part1 group by date,hour;
  0: jdbc:hive2://hadoop09-linux-01.ibeifeng.co> select date,hour,count(distinct(guid)) UV from yhd_part1 group by date,hour;
  +-------+-------+--------+--+
  | date | hour | uv |
  +-------+-------+--------+--+
  | 28 | 18 | 23938 |
  | 28 | 19 | 22330 |
  +-------+-------+--------+--+
# 结合放入log_result表
  create table if not exists log_result as select date,hour,count(url) PV,count(distinct(guid)) UV from yhd_part1 group by date,hour;
  select date,hour,pv,uv from log_result;
  0: jdbc:hive2://hadoop09-linux-01.ibeifeng.co> select date,hour,pv,uv from log_result;
  +-------+-------+--------+--------+--+
  | date | hour | pv | uv |
  +-------+-------+--------+--------+--+
  | 28 | 18 | 64972 | 23938 |
  | 28 | 19 | 61162 | 22330 |
  +-------+-------+--------+--------+--+
# 将结果表导出到Mysql,使用Sqoop
# 在Mysql中创建数据库和表
  create database if not exists track_result;
  use track_result;
  create table if not exists log_track_result(
  date varchar(10) not null,
  hour varchar(10) not null,
  pv varchar(10) not null,
  uv varchar(10) not null,
  primary key(date,hour)
  );
# 使用sqoop export 导出到log_track_result表
  bin/sqoop export \
  --connect jdbc:mysql://hadoop09-linux-01.ibeifeng.com:3306/track_result \
  --username root \
  --password root \
  --table log_track_result \
  --export-dir /user/hive/warehouse/track_log.db/log_result \
  --num-mappers 1 \
  --input-fields-terminated-by '\001'
# 在Mysql中查询测试
  select * from log_track_result;
  mysql> select * from log_track_result;
  +------+------+-------+-------+
  | date | hour | pv | uv |
  +------+------+-------+-------+
  | 28 | 18 | 64972 | 23938 |
  | 28 | 19 | 61162 | 22330 |
  +------+------+-------+-------+
  2 rows in set (0.00 sec)  

日志分析_统计每日各时段的的PV,UV的更多相关文章

  1. 日志分析_使用shell完整日志分析案例

    一.需求分析 1. 日志文件每天生成一份(需要将日志文件定时上传至hdfs) 2. 分析日志文件中包含的字段:访问IP,访问时间,访问URL,访问状态,访问流量 3. 现在有"昨日" ...

  2. 统计_statistics_不同的人_大样本_分析_统计方法_useful ?

    统计_statistics_不同的人_大样本_分析_

  3. 日志分析-mime统计

    提取日志中未落入标准字段的mime,分adx,adtype 统计mime的数量和包含js的数量占比 require 'date' require 'net/http' require 'uri' re ...

  4. 使用Spark进行搜狗日志分析实例——统计每个小时的搜索量

    package sogolog import org.apache.spark.rdd.RDD import org.apache.spark.{SparkConf, SparkContext} /* ...

  5. nginx日志分析及其统计PV、UV、IP

    一.nginx日志结构 nginx中access.log 的日志结构: $remote_addr 客户端地址 211.28.65.253 $remote_user 客户端用户名称 -- $time_l ...

  6. yhd日志分析(二)

    yhd日志分析(二) 继续yhd日志分析,统计数据 日期 uv pv 登录人数 游客人数 平均访问时长 二跳率 独立ip数 1 分析 登录人数 count(distinct endUserId) 游客 ...

  7. Spark SQL慕课网日志分析(1)--系列软件(单机)安装配置使用

    来源: 慕课网 Spark SQL慕课网日志分析_大数据实战 目标: spark系列软件的伪分布式的安装.配置.编译 spark的使用 系统: mac 10.13.3 /ubuntu 16.06,两个 ...

  8. mtools 是由MongoDB 官方工程师实现的一套工具集,可以很快速的日志查询分析、统计功能,此外还支持本地集群部署管理.

    mtools 是由MongoDB 官方工程师实现的一套工具集,可以很快速的日志查询分析.统计功能,此外还支持本地集群部署管理 https://www.cnblogs.com/littleatp/p/9 ...

  9. shell常用命令及正则辅助日志分析统计

    https://www.cnblogs.com/wj033/p/3451618.html 正则日志分析统计 3 grep 'onerror'  v3-0621.log | egrep  -v '(\d ...

随机推荐

  1. 消息队列通信,王明学learn

    消息队列通信 消息队列就是一个消息(一个结构)的链表.而一条消息则可看作一个记录,具有特定的格式.进程可以从中按照一定的规则添加新消息:另一些进程则可以从消息队列中读走消息. 每一个消息都是一个结构体 ...

  2. Sizeof与Strlen的区别与联系(转)

    Sizeof与Strlen的区别与联系 一.sizeof     sizeof(...)是运算符,在头文件中typedef为unsigned int,其值在编译时即计算好了,参数可以是数组.指针.类型 ...

  3. 趣味算法:字符串反转的N种方法(转)

    老赵在反对北大青鸟的随笔中提到了数组反转.这的确是一道非常基础的算法题,然而也是一道很不平常的算法题(也许所有的算法深究下去都会很不平常).因为我写着写着,就写出来8种方法……现在我们以字符串的反转为 ...

  4. MongoDB学习(1)—在Windows系统中安装MongoDB

    概述 本文主要介绍在Windows系统安装MongoDB的方法. MongoDB官方网址:http://www.mongodb.org/,最新版本为2.6.7. 注意: 从2.2版本开始,MongoD ...

  5. POJ 2406 KMP/后缀数组

    题目链接:http://poj.org/problem?id=2406 题意:给定一个字符串,求由一个子串循环n次后可得到原串,输出n[即输出字符串的最大循环次数] 思路一:KMP求最小循环机,然后就 ...

  6. 静态成员函数(面向对象的static关键字)

    静态成员函数 与静态数据成员一样,我们也可以创建一个静态成员函数,它为类的全部服务而不是某一个类的具体对象服务.静态成员函数与静态数据成员一样,都是类的内部实现,属于类定义的一部分.普通的成员函数一般 ...

  7. Codeforces Round #245 (Div. 2) A - Points and Segments (easy)

    水到家了 #include <iostream> #include <vector> #include <algorithm> using namespace st ...

  8. [Leetcode] Permutation Sequence

    The set [1,2,3,…,n] contains a total of n! unique permutations. By listing and labeling all of the p ...

  9. jquery 最简单的动画效果

    <p style="border: 1px solid red"> 我会慢慢变大 </p> <a>dianji</a> <sc ...

  10. [iOS-UI]给输入框添加清除按钮的代码

    UIButton *clearButton = [self.textField valueForKey:@"_clearButton"]; [clearButton setImag ...