Hive与MapReduce相关排序及自定义UDF函数

原文链接：

https://www.toutiao.com/i6770870821809291788/

Hive和mapreduce相关的排序和运行的参数

1.设置每个reduce处理的数据量（单位是字节）

我们在hive中查看下

配置文件hive-site.xml.template

我们打开配置文件可以看到

这是256MB

如果超过1G，将使用4个reducers

2、设置最大运行的reduce的个数

同上我们可以在配置中找到下面的内容

复制到记事本里，简化了描述，从配置中我们可以看到默认reduce个数是1009

3．实际运行的reduce的个数

这个去哪里看呢？我们用之前执行过的reduce

访问8088端口，查看历史history

进入后在configuration中可以搜索到，可以看到我们的语句是否有reduce。

默认设置在hive中可以看到

如果我们使用下面的排序，是否reduce的数量有关系呢？

order by 全局排序

sort by：局部排序

distribute by （底层是MR分区）

cluster by：相当于distribute by + sort by组合使用

假如我们设置成3个

执行语句

select * from emp order by sal;

所以对于order by 全局排序，设置多个reduce的没有太大作用。

执行语句

Insert overwrite local directory '/data/hivetest/export_local_emp' select * from emp sort by sal desc;

查看结果，reduce是3个

生成文件

查看文件内容，可以看到每个都排序了

所以对于sort by 局部排序，设置多个reduce的是有作用的。

执行语句

insert overwrite local directory '/opt/hivetest/distribute_test' ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' select * from emp distribute by deptno sort by sal ;

我们查看文件

查看文件内容，都已经排序了

所以对于distribute by 局部排序，设置多个reduce的是有作用的。有两个注意的地方

（1）可以按照指定的字段进行分区

（2）先分区后排序，一般和sort by联合使用

执行语句

insert overwrite local directory '/data/hivetest/cluster_test' ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' select * from emp cluster by sal ;

查看文件

查看内容

所以对于cluster by 局部排序，设置多个reduce的是有作用的，排序只能降序排序，不能指定排序规则

自定义函数（UDF）一进一出

实现一个功能，转换大小写，

首先创建一个maven项目

添加依赖

下面是依赖的主要内容

org.apache.hadoop

hadoop-client

2.7.3

org.apache.hive

hive-exec

1.2.1

org.apache.hive

hive-jdbc

1.2.1

创建一个类

编写代码

编写一个测试方法，测试代码

将写好的代码打成jar包，上传linx

一直点击下一步，其中注意主类的选择

将jar添加到hive里面去

add jar /data/hivetest/hive_udf.jar;

将包上传

我们进入hive，使用db_deptemp库

执行命令

list jars 和 delete jar 分别是显示jar和删除jar

创建临时函数

create temporary function convert_bl as 'com.xlglvc.xxx.mapredece.hiveudf.TestHiveUDF';

可以利用show functions查看函数

我们查看已有表的数据，可以看到很多大写的名字

执行我们的函数就可以了

Hive与MapReduce相关排序及自定义UDF函数的更多相关文章

自定义UDF函数应用异常
自定义UDF函数应用异常版权声明:本文为yunshuxueyuan原创文章.如需转载请标明出处: http://www.cnblogs.com/sxt-zkys/QQ技术交流群:299142667 ...
如何给Apache Pig自定义UDF函数？
近日由于工作所需,需要使用到Pig来分析线上的搜索日志数据,散仙本打算使用hive来分析的,但由于种种原因,没有用成,而Pig(pig0.12-cdh)散仙一直没有接触过,所以只能临阵磨枪了,花了两天 ...
047 SparkSQL自定义UDF函数
一:程序部分 1.需求 Double数据类型格式化,可以给定小数点位数 2.程序 package com.scala.it import org.apache.spark.{SparkConf, Sp ...
三种方法实现Hadoop(MapReduce)全局排序(1)
我们可能会有些需求要求MapReduce的输出全局有序,这里说的有序是指Key全局有序.但是我们知道,MapReduce默认只是保证同一个分区内的Key是有序的,但是不保证全局有序.基于此,本文提供三 ...
自定义udf添加一列
//创建得分窗口字典 var dict= new mutable.HashMap[Double, Int]() ){ dict.put(result_Score(i),i) } //自定义Udf函数 ...
Spark注册UDF函数，用于DataFrame DSL or SQL
import org.apache.spark.sql.SparkSession import org.apache.spark.sql.functions._ object Test2 { def ...
2.13 Hive中自带Function使用及自定义UDF编程
UDF:User Definition Function 一.function #查看自带的函数 hive (db_hive)> show functions; #查看一个函数的详细用法 hiv ...
Hive UDF IP解析（二）：使用geoip2数据库自定义UDF
开发中经常会碰到将IP转为地域的问题,所以以下记录Hive中自定义UDF来解析IP. 使用到的地域库位maxmind公司的geoIP2数据库,分为免费版GeoLite2-City.mmdb和收费版Ge ...
Hive 自定义UDF操作步骤
Hive 自定义UDF操作步骤需要自定义类,然后继承UDF 然后在方法envluate()方法里面实现具体的业务逻辑,打包上传到linux(以免出错打包成RunningJar) 一.创建临时函数 ( ...

随机推荐

C++内存管理：简易内存池的实现
什么是内存池? 在上一篇 C++内存管理:new / delete 和 cookie中谈到,频繁的调用 malloc 会影响运行效率以及产生额外的 cookie, 而内存池的思想是预先申请一大块内存, ...
为什么重写equals()就要重写hashcode()
阿里巴巴开发规范只要重写 equals,就必须重写 hashCode 因为 Set 存储的是不重复的对象,依据 hashCode 和 equals 进行判断,所以 Set 存储的对象必须重写这两个方 ...
车载以太网第二弹|测试之实锤 -DoIP测试开发实践
前言车载以太网测试之实锤系列,之前我们已经从环境设备组成.被测对象组成再到测试过程和测试结果分析,分享了完整的PMA测试 .IOP测试 .TC8中的TCP/IP协议一致性测试 .也分享了1000BA ...
vue在某页面监听键盘输入事件
需求:在某一网页,通过上下左右键控制一些操作实现: 1.基本代码: 因为没有绑定特定的元素.所以我们将事件绑定到document上. //当前页面监视键盘输入 document.onkeydown ...
pwnable_start (内联汇编)
第一次写内联汇编的题目,以前见师傅们在exp中写汇编,感觉很厉害,今天碰到了,也记录一下. 下载附件发现是32位程序,什么保护都没开,ida看一下伪代码. 可以说是很简洁了,调用了一个write和re ...
href超级链接里加上javascript代码的，还有target问题
href超级链接里加上javascript代码的,还有target问题得把target="_blank"去掉才好用,在google浏览器有这个也没事,但是在Ie里有这个就不行了
使用vi编辑时，上下左右键显示为字符的问题
1.此问题是因为ubuntu系统自带的 vi 不完整导致,解决方法:安装完整的vi,执行命令: # sudo apt-get install vim-gtk
Postman环境变量的使用
前言请注意,Postman新版有ui上的改动,本文使用的Postman 版本8.4.0 for Mac, ui有调整,但是功能无改变. Postman是一款接口调测的软件,服务端开发的同学肯定会对自 ...
辅助函数和高阶函数 map、filter、reduce
辅助函数和高阶函数 map.filter.reduce: 一.辅助函数:(1-1)响应式函数 (数组更新检测): push() pop() shift() unshift() ...
visual studio c++项目文件分类混乱整理
演示环境: win10 + vs2015 (下面简称VS)+ visual assist (下面简称VA) 1.混乱装了VA的VS,有个快捷键,可快速切换 .h 文件和 .cpp(.cc, .cxx ...

Hive与MapReduce相关排序及自定义UDF函数

Hive与MapReduce相关排序及自定义UDF函数的更多相关文章

随机推荐

热门专题