Hive Tunning（二）优化存储

接着上一章我们讲的hive的连接策略，现在我们讲一下hive的数据存储。

下面是hive支持的数据存储格式，有我们常见的文本，JSON，XML，这里我们主要讲一下ORCFile。

Built-in Formats:
– ORCFile
– RCFile
– Avro
– Delimited Text
– Regular Expression
– S3 Logfile
– Typed Bytes
• 3
rd
-Party Addons:
– JSON
– XML

这种格式非常适合HDFS，它有以下的优点：

•高压缩
– 高压缩比.
– 字典编码.
•高性能
– 自带索引.
– 高效的精确查询.
• 灵活的数据模型
– 支持所有的hive类型，包括maps.

从图中可以看出，orc格式的文件存储大小仅为文本的30%左右，比gz格式的都小，采用zlib压缩的话，更小，仅有22%左右。

使用orc格式存储的方式很简单，在建表的时候STORED AS orc即可

CREATE TABLE sale (
      id    int,   timestamp timestamp,
      productsk   int, storesk int,
      amount   decimal, state string
)    STORED   AS   orc;

相关参数，自己看，不解释了。

不适用zlib压缩的话，查询速度更快，但是也大一些。

CREATE    TABLE    sale    (
                id    int,    timestamp    timestamp,
productsk    int,    storesk    int,
                amount    decimal,    state    string
)    STORED    AS    orc    tblproperties    ("orc.compress"="NONE");

下面是加快hive查询的一些可以参考的方式：

（1）跳跃读取：采用分区Partition或者使用Skew，才用ORCFile二次排序。

（2）在连接字段上排序并且bucket，在连接小表的时候采用Broadcast joins。

（3）对经常使用的数据，增加备份因子，激活Short-Circuit Read，采用Tez。

当某个表很大的时候，我们往往要对其进行分区，比如按照时间来分区。

CREATE    TABLE    sale    (
                id    int,    amount    decimal,    ...
)    partitioned    by    (xdate    string,    state    string);

其中的xdate和state是不存在的列，你可以认为它们是虚拟列，虚拟列会在HDFS当中建立子目录，属于分区的记录会存在那个子文件夹中。

使用分区之后，在查询和插入的时候，就必须带有至少一个分区字段，否则查询将会失败。

INSERT    INTO    sale    (xdate=‘2013-03-01’,    state=‘CA’)
SELECT    *    FROM    staging_table
WHERE    xdate    =    ‘2013-03-01’    AND    state    =    ‘CA’;

如果你想一次查出所有数据，不想受这个限制的话，你可以 hive.exec.dynamic.partition.mode参数置为nonstrict。

set    hive.exec.dynamic.partition.mode=nonstrict;

INSERT    INTO    sale    (xdate,    state)
SELECT    *    FROM    staging_table;

有时候插入数据的时候，我们需要重新排序,在select 语句里面把虚拟列也加上，这样会有排序的效果。

INSERT    INTO    sale    (xdate,    state=‘CA’)
SELECT
            id,    amount,    other_stuff,
xdate,    state
FROM    staging_table
WHERE    state    =    ‘CA’;

下面我们讲一下常用的hive查询调优

mapred.max.split.size和mapred.min.split.size

min    太大->   太少mapper.
max    太小->   mapper太多.

Example:
– set    mapred.max.split.size=100000000;
– set    mapred.min.split.size=1000000;

当然也有个原则，当mappers出现抢占资源的时候，才调整这些参数。

– set    io.sort.mb=100;

• All    the    time:
– set    hive.optmize.mapjoin.mapreduce=true;
– set    hive.optmize.bucketmapjoin=true;
– set    hive.optmize.bucketmapjoin.sortedmerge=true;
– set    hive.auto.convert.join=true;
– set    hive.auto.convert.sortmerge.join=true;
– set    hive.auto.convert.sortmerge.join.nocondi1onaltask=true;
• When    bucketing    data:
– set    hive.enforce.bucketing=true;
– set    hive.enforce.sortng=true;
• These    and    more    are    set    by    default    in    HDP    1.3（明显的广告词，说明HDP比较强大，已经给我们设置好了）.
这些参数我们可以在hive-site.xml中查询到，我们也可以在shell中查询。

（1）查询所有的参数

（2）查询某一个参数

（3）修改参数

Hive Tunning（二）优化存储的更多相关文章

Hive 的企业优化
优化数据优化一.从大表拆分成小表(更快地检索) 引用:Hive LanguageManual DDL eg2:常用于分表 create table if not exists default.ce ...
深入浅出Hive企业级架构优化、Hive Sql优化、压缩和分布式缓存(企业Hadoop应用核心产品)
一.本课程是怎么样的一门课程(全面介绍) 1.1.课程的背景作为企业Hadoop应用的核心产品,Hive承载着FaceBook.淘宝等大佬 95%以上的离线统计,很多企业里的离线统 ...
HDP Hive StorageHandler 下推优化的坑
关键词:hdp , hive , StorageHandler 了解Hive StorageHandler的同学都知道,StorageHandler作为Hive适配不同存储的拓展类,同时肩负着Hive ...
{MySQL存储引擎介绍}一存储引擎解释二 MySQL存储引擎分类三不同存储引擎的使用
MySQL存储引擎介绍 MySQL之存储引擎本节目录一存储引擎解释二 MySQL存储引擎分类三不同存储引擎的使用一存储引擎解释首先确定一点,存储引擎的概念是MySQL里面才有的,不是 ...
Mongodb同步数据到hive（二）
Mongodb同步数据到hive(二) 1. 概述上一篇文章主要介绍了mongodb-based,通过直连mongodb的方式进行数据映射来进行数据查询,但是那种方式会对线上的 ...
Hive（二）CentOS7.5安装Hive2.3.3
一 Hive的下载软件下载地址:https://mirrors.tuna.tsinghua.edu.cn/apache/hive/ 这里下载的版本是:apache-hive-2.3.3-bin.t ...
《C#图解教程》读书笔记之二：存储、类型和变量
本篇已收录至<C#图解教程>读书笔记目录贴,点击访问该目录可获取更多内容. 一.类型初窥:掀起你的盖头来 (1)C程序是一组函数和数据类型,C++程序是一组函数和类,而C#程序是一组类型声 ...
【原创】构建高性能ASP.NET站点之二优化HTTP请求(前端)
原文:[原创]构建高性能ASP.NET站点之二优化HTTP请求(前端) 构建高性能ASP.NET站点之二优化HTTP请求(前端) 前言: 这段时间比较的忙,文章写不是很勤,希望大家谅解. 上一篇文 ...
Apache Hive （二）Hive安装
转自:https://www.cnblogs.com/qingyunzong/p/8708057.html Hive的下载下载地址http://mirrors.hust.edu.cn/apache/ ...
MySQL优化-存储引擎
MySQL优化-存储引擎标签(空格分隔): mysql 存储引擎查看存储引擎 show engines Myisam: 表锁全文索引 Innodb: 行锁事物外键 Memory: 内存存储引 ...

随机推荐

android 布局权重问题（最近布局经常坑爹）
android 布局权重 With layout_weight you can specify a size ratio between multiple views. E.g. you have ...
进程在Linux内核中的角色扮演
在Linux内核中,内核将进程.线程和内核线程一视同仁,即内核使用唯一的数据结构task_struct来分别表示他们:内核使用相同的调度算法对这三者进行调度:并且内核也使用同一个函数do_fork() ...
Oracle免费版和付费版，各版本的说明
Oracle免费版和付费版的区别: 首先这里给出一个答案,oracle确实是免费的给学习的人员使用.oracle的策略就是你可以随意下载我的产品,包括oracle,weblogic等产品用于学习, ...
Leaf——美团点评分布式ID生成系统
背景在复杂分布式系统中,往往需要对大量的数据和消息进行唯一标识.如在美团点评的金融.支付.餐饮.酒店.猫眼电影等产品的系统中,数据日渐增长,对数据分库分表后需要有一个唯一ID来标识一条数据或消息,数 ...
从github上下载项目到eclipse
第一步:把代码下载到本地的仓库中到github后选择自己想下载的项目,拷贝它的URL,图示如下: 进入eclipse中点击后如下: 继续按照图片指示继续(大白菜next教程) fin ...
Spring Cloud 概述
1. Spring Cloud 引言首先我们打开spring 的官网:https://spring.io/ 我们会看到这样一张图片这个图片告诉我们,开发我们的应用程序就像盖楼一样, 首先我们需要搭 ...
leetcode ---双指针+滑动窗体
一:Minimum Size Subarray Sum(最小长度子数组的和O(N)) 题目: Given an array of n positive integers and a positive ...
angular学习笔记(七)-迭代2
视图的迭代和它的ng-repeat属性绑定的数据是实时绑定的,一旦数据发生了改变,视图也会立即更新迭代. 还是刚才的那个例子,给它添加一个添加数据按钮和一个删除数据按钮. <!DOCTYPE h ...
ubantu下安装软件
Linux系统中,软件通常以源代码或者预编译包的形式提供.(1)软件源代码需要编译为二进制的机器代码才能够使用,安装比较耗时,不过您可以自行调节编译选项,决定需要的功能或组件,或者针对硬件平台作一些优 ...
ny655 光棍的yy 大数处理
光棍的yy 时间限制:1000 ms | 内存限制:65535 KB 难度:2 描述 yy经常遇见一个奇怪的事情,每当他看时间的时候总会看见11:11,这个很纠结啊. 现在给你m个1,你可以把2个 ...

Hive Tunning（二）优化存储

下面是加快hive查询的一些可以参考的方式：

下面我们讲一下常用的hive查询调优

Hive Tunning（二）优化存储的更多相关文章

随机推荐

热门专题