060 关于Hive的调优（本身，sql，mapreduce）

1.关于hive的优化

　　-》大表拆分小表
　　　　-》过滤字段
　　　　-》按字段分类存放

　　-》外部表与分区表
　　　　-》外部表：删除时只删除元数据信息，不删除数据文件
　　　　　　　　　　多人使用多个外部表操作同一份数据文件
　　　　-》分区表：hive中的数据库，表，分区来说都是文件夹
　　　　　　　　　　提高了检索效率
　　　　　　-》手动创建
　　　　　　-》动态分区
　　　　-》外部表+分区表

　　-》数据的存储
　　　　-》存储格式：列式存储

　　　　-》压缩

2.SQL的优化
　　　　-》后 join 先 filter

3.mapreduce的优化

　　-》并行处理

　　　　job1&job2 job3
　　　　hive.exec.parallel=true
　　　　hive.exec.parallel.thread.number=8

　　-》JVM重用
　　　　mapreduce.job.jvm.numtasks=$number

　　　　因为每次的jvm开启与关闭都是需要许多的资源

　　-》推测执行
　　　　mapreduce.map.speculative=true
　　　　mapreduce.reduce.speculative=true
　　　　hive.mapred.reduce.tasks.speculative.execution=true

　　-》map和reduce的个数
　　　　-》map个数：不好人为的设置
　　　　-》hdfs块的大小：dfs.blocks.size=128M
　　　　　　分片的大小：minisize/maxsize
　　　　　　mapreduce.input.fileinputformat.split.minisize

　　　　　　-》企业情景
　　　　　　　　-》文件大，少 200M 100个 map默认按块处理
　　　　　　　　-》文件小，多 40M 400个 map按分片

　　-》reudce个数
　　　　0.95-1.75*node*容器的个数

　　-》本地模式local:在当前节点运行整个任务
　　　　<property>
　　　　　　<name>hive.exec.mode.local.auto</name>
　　　　　　<value>true</value>
　　　　　　<description> Let Hive determine whether to run in local mode automatically </description>
　　　　</property>
　　　　条件：
　　　　　　1、job的输入数据的大小不能超过默认参数
　　　　　　　　inputbytes.size=128M
　　　　　　2、job处理的map task的个数
　　　　　　　　至多4个

　　　　　　3.reduce task的个数

　　　　　　　　至多1个。

060 关于Hive的调优（本身，sql，mapreduce）的更多相关文章

11g新特性-自动sql调优(Automatic SQL Tuning)
11g新特性-自动sql调优(Automatic SQL Tuning) 在Oracle 10g中,引进了自动sql调优特性.此外,ADDM也会监控捕获高负载的sql语句. 在Oracle 11g中, ...
《高性能SQL调优精要与案例解析》一书谈主流关系库SQL调优（SQL TUNING或SQL优化）核心机制之——索引（index）
继<高性能SQL调优精要与案例解析>一书谈SQL调优(SQL TUNING或SQL优化),我们今天就谈谈各主流关系库中,占据SQL调优技术和工作半壁江山的.最重要的核心机制之一——索引(i ...
《高性能SQL调优精要与案例解析》一书谈SQL调优（SQL TUNING或SQL优化）学习
<高性能SQL调优精要与案例解析>一书上市发售以来,很多热心读者就该书内容及一些具体问题提出了疑问,因读者众多外加本人日常工作的繁忙 ,在这里就SQL调优学习进行讨论并对热点问题统一作答. ...
十八般武艺玩转GaussDB(DWS)性能调优：SQL改写
摘要:本文将系统介绍在GaussDB(DWS)系统中影响性能的坏味道SQL及SQL模式,帮助大家能够从原理层面尽快识别这些坏味道SQL,在调优过程中及时发现问题,进行整改. 数据库的应用中,充斥着坏味 ...
Hive（十）Hive性能调优总结
一.Fetch抓取 1.理论分析 Fetch抓取是指,Hive中对某些情况的查询可以不必使用MapReduce计算.例如:SELECT * FROM employees;在这种情况下,Hive可以简单 ...
Hive参数调优
调优 Hive提供三种可以改变环境变量的方法,分别是: (1)修改${HIVE_HOME}/conf/hive-site.xml配置文件: 所有的默认配置都在${HIVE_HOME}/conf/hiv ...
hive的调优
调优 1 Fetch抓取(Hive可以避免进行MapReduce) Hive中对某些情况的查询可以不必使用MapReduce计算.例如:SELECT * FROM employees;在这种情况下,H ...
Oracle中SQL调优（SQL TUNING）之最权威获取SQL执行计划大全
该文档为根据相关资料整理.总结而成,主要讲解Oracle数据库中,获取SQL语句执行计划的最权威.最正确的方法.步骤,此外,还详细说明了每种方法中可选项的意义及使用方法,以方便大家和自己日常工作中查阅 ...
AX2012 ERP “系统慢”调优---跟踪SQL执行，优化代码
对于用户来说,系统是:慢的,难用的.你看xxx,多好用,多快,多人性化. 对于AX ERP系统也不例外,调优是必须的,调优一般分为几种: 系统性监测针对瓶劲环节提升,如:用户--应用服务器--DB-- ...

随机推荐

C++ 中 #ifndef, #define, #endif 宏定义
目的:为了保证包含的内容只被程序(include) 和编译了一次.判断预处理器常量是否已被定义. 预编译将所有头文件(#include"XXX.h")用头文件中的内容来替换,头文件 ...
pyqt5 添加属性-类方法用属性形式访问
方法一装饰器法 import sys from PyQt5.QtWidgets import QApplication, QWidget, QPushButton, QHBoxLayout,QLab ...
luogu P2596 [ZJOI2006]书架
传送门感觉要死在$Splay$里了 orz 这题用$Splay$维护这个序列,其中的第$k$大点代表这个序列的第$k$个数第一个操作,先把那个数所在的点旋到根,然后把整个根的左子树 ...
emacs（考场+平时）配置方案
考场配置: ;;在配置后面会对语句逐一解释的 (global-set-key (kbd "C-z") 'undo) (global-set-key (kbd "RET&q ...
Vue项目实践中的功能实现与要点
本贴记录项目实践中,各种功能的实现与技术要点,均有待改进. 路由切换的时候,显示loading动画目前方案是: 在每个页面都手动装载一个loading组件组件的显示依赖vuex里面的一个值 , 在r ...
【SVN】svn使用方法
下载安装TortoiseSVN 下载地方安装成功后 TortoiseSVN清除凭证右击空白处-TortoiseSVN-Settings打开Settings窗口后做如下操作: svn在idea中的使 ...
Android NetworkInterface 的 name
user@android:/$ ls /sys/class/net/ dummy0 lo p2p0 rev_rmnet0 rev_rmnet1 rev_rmnet2 rev_rmnet3 rmnet0 ...
js sort方法根据数组中对象的某一个属性值进行排序
sort方法接收一个函数作为参数,这里嵌套一层函数用来接收对象属性名,其他部分代码与正常使用sort方法相同. var arr = [ {name:'zopp',age:0}, {name:'gpp' ...
swift计算 switch case
var year = var month = var day = ; let daysOfFeb = year % == && year% != || year % == ?: var ...
adb启动和停止android app方法
一.启动app adb shell am start 包名/MainActivity 上面涉及到的包名及mainactivity获取办法方法一: 1.adb shell 2.dumpsys act ...

060 关于Hive的调优（本身，sql，mapreduce）

060 关于Hive的调优（本身，sql，mapreduce）的更多相关文章

随机推荐

热门专题