在安装Hive时，需要在hive-site.xml文件中配置元数据相关信息。与传统关系型数据库不同的是，hive表中的数据都是保存的HDFS上，也就是说hive中的数据库、表、分区等都可以在HDFS找到对应的文件。这里说到的元数据可以理解成hive中用于保存数据库、表、分区或者表字段等基本属性，以及这些属性与HDFS文件对应关系的一个映射。

　　这些映射关系比较常见的一个场景是保存在mysql数据库中。接下来会分析hive安装时的一些配置信息，以及元数据库中主要表的用途。

一、hive配置

　　有关hive的配置都在hive-site.xml文件中。

属性	描述	默认值
hive.metastore.warehouse.dir	指定hive表在hdfs上的存储路径	/user/hive/warehouse
javax.jdo.option.ConnectionURL	配置元数据的连接URL
javax.jdo.option.ConnectionUserName	元数据库连接用户名
javax.jdo.option.ConnectionPassword	元数据库连接密码

比如如下的配置：

<property>

  <name>javax.jdo.option.ConnectionURL</name>

  <value>jdbc:mysql://m000:3306/hive</value>

  <description>JDBC connect string for a JDBC metastore</description>

</property>

<property>

  <name>javax.jdo.option.ConnectionUserName</name>

  <value>hiveuser</value>

  <description>username to use against metastore database</description>

</property>

<property>

  <name>javax.jdo.option.ConnectionPassword</name>

  <value>hiveuser</value>

  <description>password to use against metastore database</description>

</property>

　　在hive中，默认情况下新建的数据库以及表都位于HDFS的hive.metastore.warehouse.dir路径下。如下图分别显示了数据库，表，以及表文件在HDFS上的文件路径

　　

　　根据javax.jdo.option.ConnectionURL中设置的数据库，以及用户名和密码，hive就可以写入和读取其元数据信息。

　　连接元数据库除了配置URL，username，password之外，还有一种间接的方式。可以在hive客户端A上用hive --service metastore启动一个metastore服务，然后在另外一个hive客户端B的hive-site.xml文件中配置hive.metastore.uris=thrift://A:9083也可以访问到元数据信息(9083端口为默认，可使用-p参数手动指定)。

二、元数据库表描述

　　这一节描述hive元数据库中比较重要的一些表的作用，随着后续对hive的使用逐渐补充更多的内容。

mysql元数据库hive中的表：

表名	作用
BUCKETING_COLS	存储bucket字段信息，通过SD_ID与其他表关联
CDS	一个字段CD_ID，与SDS表关联
COLUMNS_V2	存储字段信息，通过CD_ID与其他表关联
DATABASE_PARAMS	空
DBS	存储hive的database信息
DELETEME1410257703262	空
FUNCS	空
FUNC_RU	空
GLOBAL_PRIVS	全局变量，与表无关
IDXS	空
INDEX_PARAMS	空
PARTITIONS	分区记录，SD_ID, TBL_ID关联
PARTITION_KEYS	存储分区字段，TBL_ID关联
PARTITION_KEY_VALS	分区的值，通过PART_ID关联。与PARTITION_KEYS共用同一个字段INTEGER_IDX来标示不同的分区字段。
PARTITION_PARAMS	存储某分区相关信息，包括文件数，文件大小，记录条数等。通过PART_ID关联
PART_COL_PRIVS	空
PART_COL_STATS	空
PART_PRIVS	空
ROLES	角色表，和GLOBAL_PRIVS配合，与表无关
SDS	存储输入输出format等信息，包括表的format和分区的format。关联字段CD_ID,SERDE_ID
SD_PARAMS	空
SEQUENCE_TABLE	存储sqeuence相关信息，与表无关
SERDES	存储序列化反序列化使用的类
SERDE_PARAMS	序列化反序列化相关信息，通过SERDE_ID关联
SKEWED_COL_NAMES	空
SKEWED_COL_VALUE_LOC_MAP	空
SKEWED_STRING_LIST	空
SKEWED_STRING_LIST_VALUES	空
SKEWED_VALUES	空
SORT_COLS	排序字段，通过SD_ID关联
TABLE_PARAMS	表相关信息，是否外部表，通过TBL_ID关联
TAB_COL_STATS	空
TBLS	存储表信息，关联字段DB_ID,SD_ID,
TBL_COL_PRIVS	空
TBL_PRIVS	表赋权限相关信息，通过TBL_ID关联
VERSION	版本
VERSION_copy	版本，通过VER_ID关联

　　这里补充介绍hive的一个工具脚本metatool。如果需要大量修改元数据库中的相关记录，可以具体查看metatool脚本的使用方法。

　　比如说，对一个HDFS做HA的时候，如果之前hdfs完整路径是hdfs://m000，做完HA之后把dfs.nameservices设置为my-cluster之后，hdfs的访问路径就变成了hdfs://my-cluster，此时就需要对hive元数据库中所有记录作更新，这时可以参考下面的操作，

使用metatool脚本，先是新路径，然后是旧路径

/usr/local/bigdata/hive/bin/metatool -updateLocation hdfs://my-cluster hdfs://m000

三、元数据库一些查询

　　有时根据需求，需要对hive中的表批量处理，这时可以到元数据库中进行一些查询操作，操作请慎重！！

　　下面会根据元数据库中的表结构和关联关系，陆续补充一些工作中使用到的查询语句。

1、查询某表的分区

　　在Spark-sql查询hive表时，会由于元数据中文件与hdfs文件不一致而出现TreeNodeException的异常。比如说，在hive中show partitions时有分区pt=20160601，但是对应HDFS路径下并没有这个子文件夹时，在Spark-sql中就会出现该异常。这时如果需要查询某表的分区，就可以使用如下语句

SELECT p.* from PARTITIONS p

JOIN TBLS t

ON t.TBL_ID=p.TBL_ID

WHERE t.TBL_NAME='table'

AND PART_NAME like '%pt=20160601%';

2、查询指定库中stored as textfile类型的所有表名

select

  d.NAME,

  t.TBL_NAME,

  s.INPUT_FORMAT,

  s.OUTPUT_FORMAT

from TBLS t

join DBS d

join SDS s

where t.DB_ID = d.DB_ID

and t.SD_ID = s.SD_ID

and d.NAME='test'

and s.INPUT_FORMAT like '%TextInputFormat%';

3、查询指定库中的分区表

select

  db.NAME,

  tb.TBL_NAME,

  pk.PKEY_NAME

from TBLS tb

join DBS db

join PARTITION_KEYS pk

where tb.DB_ID = db.DB_ID

and tb.TBL_ID=pk.TBL_ID

and db.NAME='test';

4、查询指定库的非分区表

select

  db.NAME,

  tb.TBL_NAME

from TBLS tb

join DBS db

where tb.DB_ID = db.DB_ID

and db.NAME='test'

and tb.TBL_ID not in (

  select distinct TBL_ID from PARTITION_KEYS

) ;

5、查询指定库中某种存储类型的分区表

select

  db.NAME,

  tb.TBL_NAME,

  pk.PKEY_NAME,

  s.INPUT_FORMAT,

  s.OUTPUT_FORMAT

from TBLS tb

join DBS db

join PARTITION_KEYS pk

join SDS s

where tb.DB_ID = db.DB_ID

and tb.TBL_ID=pk.TBL_ID

and tb.SD_ID = s.SD_ID

and db.NAME='test'

and s.INPUT_FORMAT like '%TextInputFormat%';

6、查询指定库中某种存储类型的非分区表

select

  db.NAME,

  tb.TBL_NAME,

  s.INPUT_FORMAT,

  s.OUTPUT_FORMAT

from TBLS tb

join DBS db

join SDS s

where tb.DB_ID = db.DB_ID

and tb.SD_ID = s.SD_ID

and db.NAME='test'

and s.INPUT_FORMAT like '%TextInputFormat%'

and tb.TBL_ID not in (select distinct TBL_ID from PARTITION_KEYS);

hive元数据库表分析及操作的更多相关文章

hive 元数据库表描述
元数据库表描述这一节描述hive元数据库中比较重要的一些表的作用,随着后续对hive的使用逐渐补充更多的内容. mysql元数据库hive中的表: 表名作用 BUCKETING_COLS 存储bu ...
Hive 修改表结构常用操作
添加列 add columns alter table table_name add columns (id int comment '主键ID' ) ; 默认在表所有字段之后,分区字段之前. 替换 ...
Hive 元数据库表信息
Hive 的元数据信息通常存储在关系型数据库中,常用MySQL数据库作为元数据库管理. 1. 版本表 i) VERSION -- 查询版本信息 2. 数据库.文件存储相关 i) DBS -- 存储 ...
Hive中小表与大表关联(join)的性能分析【转】
Hive中小表与大表关联(join)的性能分析 [转自:http://blog.sina.com.cn/s/blog_6ff05a2c01016j7n.html] 经常看到一些Hive优化的建议中说当 ...
Hive命令行经常使用操作（数据库操作，表操作）
数据库操作查看全部的数据库 hive> show databases ; 使用数据库default hive> use default; 查看数据库信息 hive > descri ...
Hive与表操作有关的语句
Hive与表操作有关的语句 1.创建表的语句: Create [EXTERNAL] TABLE [IF NOT EXISTS] table_name [(col_name data_type [COM ...
Hive的基本知识与操作
Hive的基本知识与操作目录 Hive的基本知识与操作 Hive的基本概念为什么使用Hive? Hive的特点: Hive的优缺点: Hive应用场景 Hive架构 Client Metastor ...
数据存入hive数据表之前对.csv（数据集）文件的预处理以及数据的上传
对于数据集文件,在将其中的数据存入hive之前,需要将数据进行预处理. 1.删除文件第一行记录,即字段名称 sed -i '1d' raw_user //1d表示删除第1行,同理,3d表示删除第3行, ...
使用logminer挖掘日志，分析历史操作系列一
===============STARTED==================================== 事件起因: 业务的人mail过来说是有张表记录的10K+的优惠码记录没了,要我们确 ...

随机推荐

[自用]多项式类数学相关（定理&证明&板子）
写在前面由于上一篇总结的版面限制,特开此文来记录 \(OI\) 中多项式类数学相关的问题. 该文启发于Miskcoo的博客,甚至一些地方直接引用,在此特别说明:若文章中出现错误,烦请告知. 感谢你的 ...
[SDOI2010]代码拍卖会
题目描述随着iPig在P++语言上的造诣日益提升,他形成了自己一套完整的代码库.猪王国想参加POI的童鞋们都争先恐后问iPig索要代码库.iPig不想把代码库给所有想要的小猪,只想给其中的一部分既关 ...
LOJ #6119. 「2017 山东二轮集训 Day7」国王
Description 在某个神奇的大陆上,有一个国家,这片大陆的所有城市间的道路网可以看做是一棵树,每个城市要么是工业城市,要么是农业城市,这个国家的人认为一条路径是 exciting 的,当且仅当 ...
[BZOJ]2589: Spoj 10707 Count on a tree II
Time Limit: 20 Sec Memory Limit: 400 MB Description 给定一棵N个节点的树,每个点有一个权值,对于M个询问(u,v),你需要回答u xor last ...
【UOJ UNR #1】争夺圣杯
来自FallDream的博客,未经允许,请勿转载,谢谢. 传送门考虑直接对每个数字,统计它会产生的贡献. 单调栈求出每个数字左边第一个大等于他的数,右边第一个大于他的 (注意只能有一边取等) 假设左 ...
Android技术分享-文字转语音并朗读
Android技术分享-文字转语音并朗读最近在做一个项目,其中有一个功能是需要将文本转换成语音并播放出来.下面我将我的做法分享一下. 非常令人开心的是,Android系统目前已经集成了TTS,提供了 ...
Delphi Inputbox,InputQuery用法
Delphi :InputQuery,InputBox用法及区别 function InputQuery(const ACaption, APrompt: string; var Value: str ...
input type="tel" 数字输入框显示圆点
最近开发中遇到一个这样的需求,要求input输入框在手机端出现数字键盘的同时显示圆点,试过各种方法都不太理想, 最终经过查阅大量资料后,终于实现了需求. ●我们一般的密码输入框是这样的: <in ...
js修改伪类元素样式
<style type="text/css"> .htmlbox_close::before, .htmlbox_close::after { content: ''; ...
java.lang.SecurityException: Prohibited package name:
Prohibited package name:禁止使用的包名! 改个包名即可,全是这种bug多好啊.

hive元数据库表分析及操作