hive的窗口函数ntile、row

一、ntile

序列函数不支持window子句

数据准备：

cookie1,--,

cookie1,--,

cookie1,--,

cookie1,--,

cookie1,--,

cookie1,--,

cookie1,--,

cookie2,--,

cookie2,--,

cookie2,--,

cookie2,--,

cookie2,--,

cookie2,--,

cookie2,--,

把数据load到表中

hive (default)> select * from cookie;

OK

cookie.cookieid    cookie.createtime    cookie.pv

cookie1    --

cookie1    --

cookie1    --

cookie1    --

cookie1    --

cookie1    --

cookie1    --

cookie2    --

cookie2    --

cookie2    --

cookie2    --

cookie2    --

cookie2    --

cookie2    --

Time taken: 0.086 seconds, Fetched:  row(s)

NTILE(n)，用于将分组数据按照顺序切分成n片，返回当前切片值
NTILE不支持ROWS BETWEEN，比如 NTILE(2) OVER(PARTITION BY cookieid ORDER BY createtime ROWS BETWEEN 3 PRECEDING AND CURRENT ROW)
如果切片不均匀，默认增加第一个切片的分布

select cookieid,createtime,pv,

ntile(2) over(partition by cookieid order by createtime) as rn1,--分组内将数据分为2片

ntile(3) over(partition by cookieid order by createtime) as rn2,--分组内将数据分为3片

ntile(4) over(order by createtime) as rn3

from cookie order by cookieid,createtime;

结果是：

OK

cookieid    createtime    pv    rn1    rn2    rn3

cookie1        2015-04-10    1    1    1    1

cookie1        2015-04-11    5    1    1    1

cookie1        2015-04-12    7    1    1    2

cookie1        2015-04-13    3    1    2    2

cookie1        2015-04-14    2    2    2    3

cookie1        2015-04-15    4    2    3    4

cookie1        2015-04-16    4    2    3    4

cookie2        2015-04-10    2    1    1    1

cookie2        2015-04-11    3    1    1    1

cookie2        2015-04-12    5    1    1    2

cookie2        2015-04-13    6    1    2    2

cookie2        2015-04-14    3    2    2    3

cookie2        2015-04-15    9    2    3    3

cookie2        2015-04-16    7    2    3    4

Time taken: 76.302 seconds, Fetched: 14 row(s)

比如，统计一个cookie，pv数最多的前1/3的天

select cookieid,createtime,pv,

ntile(3) over(partition by cookieid order by pv desc) as rn

from cookie;

结果是：

OK

cookieid    createtime    pv    rn

cookie1        2015-04-12    7    1

cookie1        2015-04-11    5    1

cookie1        2015-04-16    4    1

cookie1        2015-04-15    4    2

cookie1        2015-04-13    3    2

cookie1        2015-04-14    2    3

cookie1        2015-04-10    1    3

cookie2        2015-04-15    9    1

cookie2        2015-04-16    7    1

cookie2        2015-04-13    6    1

cookie2        2015-04-12    5    2

cookie2        2015-04-11    3    2

cookie2        2015-04-14    3    3

cookie2        2015-04-10    2    3

Time taken: 22.654 seconds, Fetched: 14 row(s)

rn=1就是我们想要的结果

二、ROW_NUMBER

ROW_NUMBER()–从1开始，按照顺序，生成分组内记录的序列
–比如，按照pv降序排列，生成分组内每天的pv名次
ROW_NUMBER() 的应用场景非常多，再比如，获取分组内排序第一的记录;获取一个session中的第一条refer等。

select cookieid,createtime,pv,

row_number() over(partition by cookieid order by pv desc) as rn

from cookie;

结果：

OK

cookieid    createtime    pv    rn

cookie1    2015-04-12    7    1

cookie1    2015-04-11    5    2

cookie1    2015-04-16    4    3

cookie1    2015-04-15    4    4

cookie1    2015-04-13    3    5

cookie1    2015-04-14    2    6

cookie1    2015-04-10    1    7

cookie2    2015-04-15    9    1

cookie2    2015-04-16    7    2

cookie2    2015-04-13    6    3

cookie2    2015-04-12    5    4

cookie2    2015-04-11    3    5

cookie2    2015-04-14    3    6

cookie2    2015-04-10    2    7

Time taken: 22.657 seconds, Fetched: 14 row(s)

三、rank和dense_rank

—RANK() 生成数据项在分组中的排名，排名相等会在名次中留下空位
—DENSE_RANK() 生成数据项在分组中的排名，排名相等会在名次中不会留下空位

select cookieid,createtime,pv,

rank() over(partition by cookieid order by pv desc) as rn1,

dense_rank() over(partition by cookieid order by pv desc) as rn2,

row_number() over(partition by cookieid order by pv desc) as rn3

from cookie

where cookieid='cookie1';

结果：

OK

cookieid    createtime    pv    rn1    rn2    rn3

cookie1    2015-04-12    7    1    1    1

cookie1    2015-04-11    5    2    2    2

cookie1    2015-04-16    4    3    3    3

cookie1    2015-04-15    4    3    3    4

cookie1    2015-04-13    3    5    4    5

cookie1    2015-04-14    2    6    5    6

cookie1    2015-04-10    1    7    6    7

Time taken: 23.841 seconds, Fetched: 7 row(s)

rn1: 15号和16号并列第3, 13号排第5
rn2: 15号和16号并列第3, 13号排第4
rn3: 如果相等，则按记录值排序，生成唯一的次序，如果所有记录值都相等，或许会随机排吧。

hive的窗口函数ntile、row_number、rank的更多相关文章

Hive学习之路（十四）Hive分析窗口函数(二) NTILE,ROW_NUMBER,RANK,DENSE_RANK
概述本文中介绍前几个序列函数,NTILE,ROW_NUMBER,RANK,DENSE_RANK,下面会一一解释各自的用途. 注意: 序列函数不支持WINDOW子句.(ROWS BETWEEN) 数据 ...
Hive（七）Hive分析窗口函数
一数据准备 cookie1,2015-04-10,1 cookie1,2015-04-11,5 cookie1,2015-04-12,7 cookie1,2015-04-13,3 cookie1,20 ...
hive 中窗口函数row_number,rank,dense_ran,ntile分析函数的用法
hive中一般取top n时,row_number(),rank,dense_ran()这三个函数就派上用场了, 先简单说下这三函数都是排名的,不过呢还有点细微的区别. 通过代码运行结果一看就明白了. ...
知方可补不足~row_number,rank,dense_rank,ntile排名函数的用法
回到目录这篇文章介绍SQL中4个很有意思的函数,我称它的行标函数,它们是row_number,rank,dense_rank和ntile,下面分别进行介绍. 一 row_number:它为数据表加一 ...
ROW_NUMBER()/RANK()/DENSE_RANK()/ntile() over()
ROW_NUMBER()/RANK()/DENSE_RANK()/ntile() over() 今天女票问我SqlServer的四种排序,当场写了几句Sql让她了解,现把相关Sql放上来. 首先, ...
SQL Server - 四种排序, ROW_NUMBER() /RANK() /DENSE_RANK() /ntile() over()
>>>>英文版 (更简洁易懂)<<<< 转载自:https://dzone.com/articles/difference-between-rownum ...
SQL Server中排名函数row_number,rank,dense_rank,ntile详解
SQL Server中排名函数row_number,rank,dense_rank,ntile详解从SQL SERVER2005开始,SQL SERVER新增了四个排名函数,分别如下:1.row_n ...
hive中一般取top n时，row_number(),rank,dense_ran()常用三个函数
一. 分区函数Partition By与row_number().rank().dense_rank()的用法(获取分组(分区)中前几条记录) 一.数据准备 --1.创建学生成绩表 id int, ...
【Hadoop离线基础总结】hive的窗口函数
hive的窗口函数概述 hive中一般求取TopN时就需要用到窗口函数专业窗口函数一般有三个 rank() over dense rank() over row_number() over 实例 ...

随机推荐

LINUX内核分析第四周——扒开系统调用的三层皮
LINUX内核分析第四周--扒开系统调用的三层皮李雪琦 + 原创作品转载请注明出处 + <Linux内核分析>MOOC课程http://mooc.study.163.com/course ...
Hbase(一)基础知识
一.Hbase数据库介绍 1.简介 HBase 是 BigTable 的开源 java 版本.是建立在 HDFS 之上,提供高可靠性.高性能.列存储. 可伸缩.实时读写 NoSQL 的数据库系统. N ...
Codeforces Round #441 Div. 2题解
比赛的时候E调了好久...F没时间写T T A:直接走到短的路上来回走就好了 #include<iostream> #include<cstring> #include< ...
【CF Gym100228】Graph of Inversions
Portal --> qwq(貌似是CodeForces Gym 100228 (ECNA2003) - I) Description 对于长度为 \(n\) 的序列 \(A\) ,定义其逆序图 ...
1.UiDevice API 详细介绍
1.UiDevice按键与keycode使用返回值方法名说明 boolean pressBack() 模拟短按返回back键 boolean pressDPadCenter() 模拟按轨迹球中点 ...
SQL Server清理Log文件
---SQL 2008 在SQL2008中清除日志就必须在简单模式下进行,等清除动作完毕再调回到完全模式. USE [master] go ALTER DATABASE PS SET RECOVERY ...
Install Terraform on Windows, Linux and Mac OS
Step-by-step tutorial of how to download and install Terraform on Windows, Linux and Mac OS. Terrafo ...
python---Scrapy模块的使用（二）
出处:http://www.cnblogs.com/wupeiqi/ 一:去除重复URL scrapy默认使用 scrapy.dupefilter.RFPDupeFilter 进行去重,相关配置有: ...
写文章使用conda管理python环境
使用conda管理python环境
数学&动态规划：期望DP
BZOJ3036 给定一张有向无环图,起点为1,终点为N,每个点i有ki条出边,从每个点走其中一条出边的概率是1/ki,求从1到N的期望步数我们注意到一点,走每条边都是等概率的,那么就相当于给定一 ...

hive的窗口函数ntile、row_number、rank

hive的窗口函数ntile、row_number、rank的更多相关文章

随机推荐

热门专题