Hive的分析函数又叫窗口函数,在oracle中就有这样的分析函数,主要用来做数据统计分析的。

Lag和Lead分析函数可以在同一次查询中取出同一字段的前N行的数据(Lag)和后N行的数据(Lead)作为独立的列。
这种操作可以代替表的自联接,并且LAG和LEAD有更高的效率,其中over()表示当前查询的结果集对象,括号里面的语句则表示对这个结果集进行处理。
 

函数介绍

LAG

LAG(col,n,DEFAULT) 用于统计窗口内往上第n行值
参数1为列名,参数2为往上第n行(可选,默认为1),参数3为默认值(当往上第n行为NULL时候,取默认值,如不指定,则为NULL)

LEAD

与LAG相反
LEAD(col,n,DEFAULT) 用于统计窗口内往下第n行值
参数1为列名,参数2为往下第n行(可选,默认为1),参数3为默认值(当往下第n行为NULL时候,取默认值,如不指定,则为NULL)

 

场景

问题

用户Peter在浏览网页,在某个时刻,Peter点进了某个页面,过一段时间后,Peter又进入了另外一个页面,如此反复,那怎么去统计Peter在某个特定网页的停留时间呢,又或是怎么统计某个网页用户停留的总时间呢?

数据准备

现在用户的行为都被采集了,处理转换到hive数据表,表结构如下:
  1. create table test.user_log(
  2. userid string,
  3. time string,
  4. url string
  5. ) row format delimited fields terminated by ',';

记录数据:

  1. +------------------+----------------------+---------------+--+
  2. | user_log.userid  |    user_log.time     | user_log.url  |
  3. +------------------+----------------------+---------------+--+
  4. | Peter            | 2015-10-12 01:10:00  | url1          |
  5. | Peter            | 2015-10-12 01:15:10  | url2          |
  6. | Peter            | 2015-10-12 01:16:40  | url3          |
  7. | Peter            | 2015-10-12 02:13:00  | url4          |
  8. | Peter            | 2015-10-12 03:14:30  | url5          |
  9. | Marry            | 2015-11-12 01:10:00  | url1          |
  10. | Marry            | 2015-11-12 01:15:10  | url2          |
  11. | Marry            | 2015-11-12 01:16:40  | url3          |
  12. | Marry            | 2015-11-12 02:13:00  | url4          |
  13. | Marry            | 2015-11-12 03:14:30  | url5          |
  14. +------------------+----------------------+---------------+--+

分析步骤

获取用户在某个页面停留的起始与结束时间

  1. select userid,
  2. time stime,
  3. lead(time) over(partition by userid order by time) etime,
  4. url
  5. from test.user_log;

结果:

  1. +---------+----------------------+----------------------+-------+--+
  2. | userid  |        stime         |        etime         |  url  |
  3. +---------+----------------------+----------------------+-------+--+
  4. | Marry   | 2015-11-12 01:10:00  | 2015-11-12 01:15:10  | url1  |
  5. | Marry   | 2015-11-12 01:15:10  | 2015-11-12 01:16:40  | url2  |
  6. | Marry   | 2015-11-12 01:16:40  | 2015-11-12 02:13:00  | url3  |
  7. | Marry   | 2015-11-12 02:13:00  | 2015-11-12 03:14:30  | url4  |
  8. | Marry   | 2015-11-12 03:14:30  | NULL                 | url5  |
  9. | Peter   | 2015-10-12 01:10:00  | 2015-10-12 01:15:10  | url1  |
  10. | Peter   | 2015-10-12 01:15:10  | 2015-10-12 01:16:40  | url2  |
  11. | Peter   | 2015-10-12 01:16:40  | 2015-10-12 02:13:00  | url3  |
  12. | Peter   | 2015-10-12 02:13:00  | 2015-10-12 03:14:30  | url4  |
  13. | Peter   | 2015-10-12 03:14:30  | NULL                 | url5  |
  14. +---------+----------------------+----------------------+-------+--+

计算用户在页面停留的时间间隔(实际分析当中,这里要做数据清洗工作,如果一个用户停留了4、5个小时,那这条记录肯定是不可取的。)

  1. select userid,
  2. time stime,
  3. lead(time) over(partition by userid order by time) etime,
  4. UNIX_TIMESTAMP(lead(time) over(partition by userid order by time),'yyyy-MM-dd HH:mm:ss')- UNIX_TIMESTAMP(time,'yyyy-MM-dd HH:mm:ss') period,
  5. url
  6. from test.user_log;

结果:

  1. +---------+----------------------+----------------------+---------+-------+--+
  2. | userid  |        stime         |        etime         | period  |  url  |
  3. +---------+----------------------+----------------------+---------+-------+--+
  4. | Marry   | 2015-11-12 01:10:00  | 2015-11-12 01:15:10  | 310     | url1  |
  5. | Marry   | 2015-11-12 01:15:10  | 2015-11-12 01:16:40  | 90      | url2  |
  6. | Marry   | 2015-11-12 01:16:40  | 2015-11-12 02:13:00  | 3380    | url3  |
  7. | Marry   | 2015-11-12 02:13:00  | 2015-11-12 03:14:30  | 3690    | url4  |
  8. | Marry   | 2015-11-12 03:14:30  | NULL                 | NULL    | url5  |
  9. | Peter   | 2015-10-12 01:10:00  | 2015-10-12 01:15:10  | 310     | url1  |
  10. | Peter   | 2015-10-12 01:15:10  | 2015-10-12 01:16:40  | 90      | url2  |
  11. | Peter   | 2015-10-12 01:16:40  | 2015-10-12 02:13:00  | 3380    | url3  |
  12. | Peter   | 2015-10-12 02:13:00  | 2015-10-12 03:14:30  | 3690    | url4  |
  13. | Peter   | 2015-10-12 03:14:30  | NULL                 | NULL    | url5  |
  14. +---------+----------------------+----------------------+---------+-------+--+

计算每个页面停留的总时间,某个用户访问某个页面的总时间

  1. select nvl(url,'-1') url,
  2. nvl(userid,'-1') userid,
  3. sum(period) totol_peroid from (
  4. select userid,
  5. time stime,
  6. lead(time) over(partition by userid order by time) etime,
  7. UNIX_TIMESTAMP(lead(time) over(partition by userid order by time),'yyyy-MM-dd HH:mm:ss')- UNIX_TIMESTAMP(time,'yyyy-MM-dd HH:mm:ss') period,
  8. url
  9. from test.user_log
  10. ) a group by url, userid with rollup;

结果:

  1. +-------+---------+---------------+--+
  2. |  url  | userid  | totol_peroid  |
  3. +-------+---------+---------------+--+
  4. | -1    | -1      | 14940         |
  5. | url1  | -1      | 620           |
  6. | url1  | Marry   | 310           |
  7. | url1  | Peter   | 310           |
  8. | url2  | -1      | 180           |
  9. | url2  | Marry   | 90            |
  10. | url2  | Peter   | 90            |
  11. | url3  | -1      | 6760          |
  12. | url3  | Marry   | 3380          |
  13. | url3  | Peter   | 3380          |
  14. | url4  | -1      | 7380          |
  15. | url4  | Marry   | 3690          |
  16. | url4  | Peter   | 3690          |
  17. | url5  | -1      | NULL          |
  18. | url5  | Marry   | NULL          |
  19. | url5  | Peter   | NULL          |
  20. +-------+---------+---------------+--+

Hive 分析函数lead、lag实例应用的更多相关文章

  1. Hive 窗口函数LEAD LAG FIRST_VALUE LAST_VALUE

    窗口函数(window functions)对多行进行操作,并为查询中的每一行返回一个值. OVER()子句能将窗口函数与其他分析函数(analytical functions)和报告函数(repor ...

  2. oracle函数中lead,lag,over,partition by 的使用

    lead,lag函数的分析 http://blog.csdn.net/mazongqiang/article/details/7621328 举例如下: SQL> select *  from ...

  3. Hive窗口函数之LAG、LEAD、FIRST_VALUE、LAST_VALUE的用法

    一.创建表: create table windows_ss ( polno string, eff_date string, userno string ) ROW FORMAT DELIMITED ...

  4. 大数据学习day28-----hive03------1. null值处理,子串,拼接,类型转换 2.行转列,列转行 3. 窗口函数(over,lead,lag等函数) 4.rank(行号函数)5. json解析函数 6.jdbc连接hive,企业级调优

    1. null值处理,子串,拼接,类型转换 (1) 空字段赋值(null值处理) 当表中的某个字段为null时,比如奖金,当你要统计一个人的总工资时,字段为null的值就无法处理,这个时候就可以使用N ...

  5. Oracle 分析函数之 lag和lead

    Lag和Lead分析函数可以在同一次查询中取出同一字段的前N行的数据(Lag)和后N行的数据(Lead)作为独立的列. 这种操作可以代替表的自联接,并且LAG和LEAD有更高的效率. /*语法*/   ...

  6. oracle 列相减——(Oracle分析函数Lead(),Lag())

    lag和lead函数,用于取出数据的前n行的数据和后n行的数据,当然要和over(order by)一起组合 其实这2个函数的作用非常好理解,Lead()就是取当前顺序的下一条记录,相对Lag()就是 ...

  7. oracle listagg函数、lag函数、lead函数 实例

    Oracle大师Thomas Kyte在他的经典著作中,反复强调过一个实现需求方案选取顺序: “如果你可以使用一句SQL解决的需求,就使用一句SQL:如果不可以,就考虑PL/SQL是否可以:如果PL/ ...

  8. over 分析函数之 lag() lead()

    /*语法*/ lag(exp_str,offset,defval) over()  取前 Lead(exp_str,offset,defval) over()  取后 --exp_str要取的列 -- ...

  9. Oracle Sql优化之lead,lag分析函数

    1.表中有四个字段:人员编号,开始时间,结束时间,类型,数据ID,需要实现如下需求 a.当类型为-1时,丢弃该记录 b.当类型为-1时,且前一行结束时间为null,当前行的开始时间-1作为前一行的结束 ...

随机推荐

  1. ajax实现异步请求的过程

    var xhr;        xhr = new XMLHttpRequest(); //创建一个异步对象        xhr.open("Get", "test.a ...

  2. <Android 应用 之路> 天气预报(四)

    前言 第二次尝试完成天气预报应用,与上次不同的是,个人感觉这次的Ui不那么丑陋,整体的实用性和界面效果,用户体验相较上一次有所提升,但是还是有很多地方需要完善. 这次使用到的内容比较丰富,包括聚合数据 ...

  3. JS案例练习 — 给div添加样式选择功能

    附加效果图: CSS内容: <style> ; padding:0px} li{list-style:none} body{font:24px 'Microsoft YaHei'; col ...

  4. 查看mysql表和数据库的大小

    转自:http://xiaosu.blog.51cto.com/2914416/687835 1.查看数据库的大小 use 数据库名SELECT sum(DATA_LENGTH)+sum(INDEX_ ...

  5. w3cschool中jQuery测试结果总结

    1.jQuery 是 W3C 标准. 2.$("div#intro .head") 选择器选取:class="intro" 的任何 div 元素中的首个 id= ...

  6. Redis分片(分区)

    分区的概念 分区是分割数据到多个Redis实例的处理过程,因此每个实例只保存key的一个子集. 如果只使用一个redis实例时,其中保存了服务器中全部的缓存数据,这样会有很大风险,如果单台redis服 ...

  7. VMware Workstation Pro 11、12 密钥

    11:1F04Z-6D111-7Z029-AV0Q4-3AEH8 12:5A02H-AU243-TZJ49-GTC7K-3C61N

  8. 利用Python实现 队列的算法

    以下内容都是来自“悟空“大神的讲解,听他的视频课,利用Python实现堆栈的算法,自己做了一些小总结,可能会存在自己理解的一些误区, 1.栈的实现 队列的特征是先进先出,同我们生活中的队列具有相同的特 ...

  9. Codeforces Round #324 (Div. 2) A B C D E

    A,水题不多说. #include<bits/stdc++.h> using namespace std; //#define LOCAL int main() { #ifdef LOCA ...

  10. UVA 11600 Masud Rana(概率dp)

    当两个城市之间有安全的道路的时候,他们是互相可到达的,这种关系满足自反.对称和传递性, 因此是一个等价关系,在图论中就对应一个连通块. 在一个连通块中,当前点是那个并不影响往其他连通块的点连边,因此只 ...