二十五、Hadoop学记笔记———

Hive主要为了简化MapReduce流程，使非编程人员也能进行数据的梳理，即直接使用sql语句代替MapReduce程序

Hive建表的时候元数据（表明，字段信息等）存于关系型数据库中，数据存于HDFS中。

此元数据与HDFS中的元数据需要区分清楚，HDFS中元数据（文件名，文件长度等）存于Namenode中，数据存于Datanode中。

本次使用的是hive1.2.2版本

下载完毕之后解压：

将default文件复制一份成site文件，然后打开site文件，清空其内容，然后配置如下参数：

hive.metastore.local表示元数据存于本地

其中jdbc的hive是mysql中，提供给hive的database的名称，可自行修改，后续是登录的账号和密码，可以使用root，也可以新建一个hive用户，本机采用的是新建一个hive用户。

之后将mysql的jdbc驱动放入hive的lib目录下：

之后安装mysql，并在mysql下create名为hive的数据库，本机使用mysql5.7，数据库安装不做描述：

在hive中新建的表的表结构会在mysql中相应的databse内存储：

之后在例举一个复杂点的数据表，主要包含了数组型字段和map型字段，并且附带partition分区，例子来源于hive官网：

CREATE TABLE user_info(

id INT,
name STRING,
hobby ARRAY < STRING >,
goodatlol MAP < STRING, STRING >
)
PARTITIONED BY(dt STRING)
ROW FORMAT DELIMITED
FIELDS TERMINATED BY '\t'
COLLECTION ITEMS TERMINATED BY ','
MAP KEYS TERMINATED BY ':'
STORED AS TEXTFILE;

先新建一个user_info表：

其中hobby为数组型字段，goodatlol为map型字段。fields的分隔符'\t'表示文件每一行的分隔符，collection的分隔符','表示数组型字段的分隔符，map的分隔符':'表示map字段的分隔符。

这时候在hdfs的该路径下回出现一个文件夹user_info：

由此可见，hive中的数据表，表结构的元数据存在所连接的关系型数据库中，而数据信息存于hdfs。

之后录入信息，新建文件，名字不限，内容如下：

load data local inpath '/home/tyx/temp/userinfo' into table user_info;

可用查询语句得出ttt同学喜欢上单风男：

之后在hdfs的user_info路径下还会出现分区：

前面讲述的是建表和查询，现在说一个插入比较常用的方法，由于Hive是数据仓库，主要作用是用来存放、查询和统计数据，因此插入一般是直接覆盖，而不会像Mysql那样经常一条一条的插入。在Hive中，Insert into默认是关闭的，需要做一些配置才能开启，感兴趣的朋友可以自行查询，此处只介绍insert overwrite方法，标准语法如下（源自官方文档）：

INSERT OVERWRITE TABLE tablename1 [PARTITION (partcol1=val1, partcol2=val2 ...) [IF NOT EXISTS]] select_statement1 FROM from_statement;

意思就是从一个语句中读取所有数据并覆盖原数据。前面也提到Hive一般用来做统计查询，通常情况下统计所需要的字段可能分布在好几张数据表上。就算只存在于一张数据表，那统计所需要的字段也只有2到3个，新建一个表专门用来查询也可以提高查询效率。

新建一个user_test表：

这个表相较于user_info表没有goodatlol字段和partition分区。

然后使用insert overwrite语句，将user_info中的id，name和hobby插入到user_test中来。

可以看到这时user_info中的name为ttt和zzz的数据都已经插入到了表user_info中，这时在该表中进行统计查询效率会比在user_info中快。

该语句在下面场景会非常实用，比如一个表A很很多字段，其中1号程序员需要用到A中的1、2、3字段做统计分析，程序员2号需要用到A中的3、6、8字段做统计分析，那么1号和2号分别都键自己的统计表会更加有效率

二十五、Hadoop学记笔记————Hive复习与深入的更多相关文章

二十、Hadoop学记笔记————Hive On Hbase
Hive架构图: 一般用户接口采用命令行操作, hive与hbase整合之后架构图: 使用场景场景一:通过insert语句,将文件或者table中的内容加入到hive中,由于hive和hbase已经 ...
二十三、Hadoop学记笔记————Spark简介与计算模型
spark优势在于基于内存计算,速度很快,计算的中间结果也缓存在内存,同时spark也支持streaming流运算和sql运算 Mesos是资源管理框架,作为资源管理和任务调度,类似Hadoop中的Y ...
二十一、Hadoop学记笔记————kafka的初识
这些场景的共同点就是数据由上层框架产生,需要由下层框架计算,其中间层就需要有一个消息队列传输系统 Apache flume系统,用于日志收集 Apache storm系统,用于实时数据处理 Spark ...
二十四、Hadoop学记笔记————Spark的架构
master为主节点一个集群中可能运行多个application,因此也可能会有多个driver DAG Scheduler就是讲RDD Graph拆分成一个个stage 一个Task对应一个Spa ...
二十二、Hadoop学记笔记————Kafka 基础实战：消费者和生产者实例
kafka的客户端也支持其他语言,这里主要介绍python和java的实现,这两门语言比较主流和热门图中有四个分区,每个图形对应一个consumer,任意一对一即可获取topic的分区数,每个分区 ...
十九、Hadoop学记笔记————Hbase和MapReduce
概要: hadoop和hbase导入环境变量: 要运行Hbase中自带的MapReduce程序,需要运行如下指令,可在官网中找到: 如果遇到如下问题,则说明Hadoop的MapReduce没有权限访问 ...
十八、Hadoop学记笔记————Hbase架构
Hbase结构图: Client,Zookeeper,Hmaster和HRegionServer相互交互协调,各个组件作用如下: 这几个组件在实际使用过程中操作如下所示: Region定位,先读取zo ...
十七、Hadoop学记笔记————Hbase入门
简而言之,Hbase就是一个建立在Hdfs文件系统上的数据库(mysql,orecle等),不同的是Hbase是针对列的数据库 Hbase和普通的关系型数据库区别如下: Hbase有一些基本的术语,主 ...
python3.4学习笔记(二十五) Python 调用mysql redis实例代码
python3.4学习笔记(二十五) Python 调用mysql redis实例代码 #coding: utf-8 __author__ = 'zdz8207' #python2.7 import ...

随机推荐

C语言设计模式-封装-继承-多态
快过年了,手头的工作慢慢也就少了,所以,研究技术的时间就多了很多时间,前些天在CSDN一博客看到有大牛在讨论C的设计模式,正好看到了,我也有兴趣转发,修改,研究一下. 记得读大学的时候,老师就告诉我们 ...
ITU-R BT.1788建议书对多媒体应用中视频质量的主观评估方法
ITU-R BT.1788建议书对多媒体应用中视频质量的主观评估方法 (ITU‑R 102/6号研究课题) (2007年) 范围数字广播系统允许提供多媒体和数据广播应用,包括视频.音频.静态图像. ...
苹果新的编程语言 Swift 语言进阶（十六）－－泛型
泛型允许你定义一个宽松.可重用的函数或者类型,使用泛型能够避免代码的重复,也能以更清楚和抽象的方式来表达程序的意图. 泛型是Swift语言提供的强大功能之一,Swift提供的许多标准库都使用了泛型来创 ...
LeetCode之“动态规划”：Maximum Subarray
题目链接题目要求: Find the contiguous subarray within an array (containing at least one number) which has t ...
Android Data Binding语法解析（二）
上篇我们知道了Data Binding的最简单的用法,那么Data Binding其中最为重要也是最复杂的其实就是在xml布局文件中给对应的控件进行数据绑定了,接下来就一一说明Data Binding ...
XMPP系列(三）---获取好友列表、添加好友
1.心跳检测.掉线重连功能客户端和服务器端都可以设置多久发送一次心跳包,如果对方没有返回正确的pong信息,则会断开连接,而添加掉线重连功能,则会自动进行连接. 如果自己写聊天功能还得自己做心跳检测 ...
RHEL6.4安装nginx
RHEL6.4安装nginx 下载nginx-1.6.1.tar.gz, 解压进入目录: $ yum install pcre-devel $ ./configure --with-http_ssl_ ...
自定义蜘蛛网图 NetView
概述写论文忙里偷闲写了一个蜘蛛网图的自定义view,支持多重属性有图才能有真相,下面先上图主要支持网格颜色.tag文本.覆盖区域颜色.透明度的属性改变,具体使用可以参见我的githubgithu ...
IOS中的数据存储方式，特点，使用情况
数据存储的核心都是写文件,主要有四种持久化方式:属性列表(Plist),对象序列化,SQLite数据库,CoreData. 存储Plist: 键值进行存储,不能存储对象.对象需要序列化编码才能写入文件 ...
rails关于一个Action的多次或多个Action之间共享数据的思路
举一个实际的例子:一个考试页面,总共有20题,每页一题,通过页面下方的"前一题"和"后一题"的提交按钮来跳转题目.如果到最后一题则再产生一个"交卷&q ...

二十五、Hadoop学记笔记————Hive复习与深入

二十五、Hadoop学记笔记————Hive复习与深入的更多相关文章

随机推荐

热门专题