先解释一下几个名词：

metadata ：hive元数据，即hive定义的表名，字段名，类型，分区，用户这些数据。一般存储关系型书库mysql中，在测试阶段也可以用hive内置Derby数据库。
metastore ：hivestore服务端。主要提供将DDL，DML等语句转换为MapReduce，提交到hdfs中。
hiveserver2：hive服务端。提供hive服务。客户端可以通过beeline，jdbc（即用java代码链接）等多种方式链接到hive。
beeline：hive客户端链接到hive的一个工具。可以理解成mysql的客户端。如：navite cat 等。

其它语言访问hive主要是通过hiveserver2服务，HiveServer2(HS2)是一种能使客户端执行Hive查询的服务。HiveServer2可以支持对 HiveServer2 的嵌入式和远程访问，支持多客户端并发和身份认证。旨在为开放API客户端（如JDBC和ODBC）提供更好的支持。

会启动一个hive服务端默认端口为：10000，可以通过beeline，jdbc，odbc的方式链接到hive。hiveserver2启动的时候会先检查有没有配置hive.metastore.uris，如果没有会先启动一个metastore服务，然后在启动hiveserver2。如果有配置hive.metastore.uris。会连接到远程的metastore服务。这种方式是最常用的。部署在图如下：

Python连接Hive

Python3访问hive需要安装的依赖有：

pip3 install thrift
pip3 install PyHive
pip3 install sasl
pip3 install thrift_sasl

这里有一个Python访问Hive的工具类：

# -*- coding:utf-8 -*-

from pyhive import hive

class HiveClient(object):

	"""docstring for HiveClient"""

	def __init__(self, host='hadoop-master',port=10000,username='hadoop',password='hadoop',database='hadoop',auth='LDAP'):

		"""

		create connection to hive server2

		"""

		self.conn = hive.Connection(host=host,

			port=port,

			username=username,

			password=password,

			database=database,

			auth=auth) 

	def query(self, sql):

		"""

		query

		"""

		with self.conn.cursor() as cursor:

			cursor.execute(sql)

			return cursor.fetchall()

	def insert(self, sql):

		"""

		insert action

		"""

		with self.conn.cursor() as cursor:

			cursor.execute(sql)

			# self.conn.commit()

			# self.conn.rollback()

	def close(self):

		"""

		close connection

		"""

		self.conn.close()

使用的时候，只需要导入，然后创建一个对象实例即可，传入sql调用query方法完成查询。

# 拿一个连接

hclient = hive.HiveClient()

# 执行查询操作

...

# 关闭连接

hclient.close()

注意：在insert插入方法中，我将self.conn.commit()和self.conn.rollback()即回滚注释了，这是传统关系型数据库才有的事务操作，Hive中是不支持的。

Java连接Hive

Java作为大数据的基础语言，连接hive自然是支持的很好的，这里介绍通过jdbc和mybatis两种方法连接hive。

1. Jdbc连接

java通过jdbc连接hiveserver，跟传统的jdbc连接mysql方法一样。

需要hive-jdbc依赖：

<dependency>

    <groupId>org.apache.hive</groupId>

    <artifactId>hive-jdbc</artifactId>

    <version>1.2.1</version>

</dependency>

代码跟连接mysql套路一样，都是使用的DriverManager.getConnection(url, username, password)：

@NoArgsConstructor

@AllArgsConstructor

@Data

@ToString

public class HiveConfigModel {

    private String url = "jdbc:hive2://localhost:10000";

    private String username = "hadoop";

    private String password = "hadoop";

}

@Test

public void test(){

    // 初始化配置

    HiveConfigModel hiveConfigModel = ConfigureContext.getInstance("hive-config.properties")

            .addClass(HiveConfigModel.class)

            .getModelProperties(HiveConfigModel.class);

    try {

        Connection conn = DriverManager.getConnection(hiveConfigModel.getUrl(),

                hiveConfigModel.getUsername(), hiveConfigModel.getPassword());

        String sql = "show tables";

        PreparedStatement preparedStatement = conn.prepareStatement(sql);

        ResultSet rs = preparedStatement.executeQuery();

        List<String> tables = new ArrayList<>();

        while (rs.next()){

            tables.add(rs.getString(1));

        }

        System.out.println(tables);

    } catch (SQLException e) {

        e.printStackTrace();

    }

}

在hive-jdbc-1.2.1.jar的META-INF下有个services目录，里面有个java.sql.Driver文件，内容是：

org.apache.hive.jdbc.HiveDriver

java.sql.DriverManager使用spi实现了服务接口与服务实现分离以达到解耦，在这里jdbc的实现org.apache.hive.jdbc.HiveDriver根据java.sql.Driver提供的统一规范实现逻辑。客户端使用jdbc时不需要去改变代码，直接引入不同的spi接口服务即可。

DriverManager.getConnection(url, username, password)

这样即可拿到连接，前提是具体实现需要遵循相应的spi规范。

2. 整合mybatis

通常都会使用mybatis来做dao层访问数据库，访问hive也是类似的。

配置文件sqlConfig.xml：

<?xml version="1.0" encoding="UTF-8" ?>

<!DOCTYPE configuration PUBLIC "-//mybatis.org//DTD Config 3.0//EN"

        "http://mybatis.org/dtd/mybatis-3-config.dtd">

<configuration>

    <environments default="production">

        <environment id="production">

            <transactionManager type="JDBC"/>

            <dataSource type="POOLED">

                <property name="driver" value="org.apache.hive.jdbc.HiveDriver"/>

                <property name="url" value="jdbc:hive2://master:10000/default"/>

                <property name="username" value="hadoop"/>

                <property name="password" value="hadoop"/>

            </dataSource>

        </environment>

    </environments>

    <mappers>

        <mapper resource="mapper/hive/test/test.xml"/>

    </mappers>

</configuration>

mapper代码省略，实现代码：

public classTestMapperImpl implements TestMapper {

    private static SqlSessionFactory sqlSessionFactory = HiveSqlSessionFactory.getInstance().getSqlSessionFactory();

    @Override

    public int getTestCount(String dateTime) {

        SqlSession sqlSession = sqlSessionFactory.openSession();

        TestMapper testMapper = sqlSession.getMapper(TestMapper.class);

        int count = testMapper.getTestCount(dateTime);

        sqlSession.close();

        return count;

    }

}

其它语言通过HiveServer2访问Hive的更多相关文章

Spark&Hive：如何使用scala开发spark访问hive作业，如何使用yarn resourcemanager。
背景: 接到任务,需要在一个一天数据量在460亿条记录的hive表中,筛选出某些host为特定的值时才解析该条记录的http_content中的经纬度: 解析规则譬如: 需要解析host: api.m ...
Hive基础（2）---（启动HiveServer2）Hive严格模式
启动方式 1, hive 命令行模式,直接输入/hive/bin/hive的执行程序,或者输入 hive –service cli 用于linux平台命令行查询,查询语句基本跟mysql查询语句类似 ...
ODBC database driver for Go：Go语言通过ODBC 访问SQL server
Go语言通过ODBC 访问SQL server,这里需要用到go-odbc库,开源地址::https://github.com/weigj/go-odbc 一.驱动安装在cmd中打开GOPATH: ...
SparkSQL On Yarn with Hive，操作和访问Hive表
转载自:http://lxw1234.com/archives/2015/08/466.htm 本文将介绍以yarn-cluster模式运行SparkSQL应用程序,访问和操作Hive中的表,这个和在 ...
使用spark访问hive错误记录
在spark集群中执行./spark-shell时报以下错误: 18/07/23 10:02:39 WARN DataNucleus.Connection: BoneCP specified but ...
Spark访问Hive表
知识点1:Spark访问HIVE上面的数据配置注意点:. 1.拷贝mysql-connector-java-5.1.38-bin.jar等相关的jar包到你${spark_home}/lib中(sp ...
spark on yarn模式下配置spark-sql访问hive元数据
spark on yarn模式下配置spark-sql访问hive元数据目的:在spark on yarn模式下,执行spark-sql访问hive的元数据.并对比一下spark-sql 和hive ...
pyinstaller打包python源程序访问hive
1.需求使用hvie server一段时间后,业务部门需要自己不定时的查询业务数据,之前这一块都是他们提需求我们来做,后来发现这样重复一样的工作放在我们这边做是在没有效率,遂提出给他们工具或者web ...
访问hive显示原数据报错
访问hive报错如下: FAILED: SemanticException org.apache.hadoop.hive.ql.metadata.HiveException: java.lang.Ru ...

随机推荐

FL Studio通道乐器设置页详讲
上一篇文章我们说到FL Studio通道乐器设置页每个标签页面中几乎都是由包络.低频振荡器和滤波器这三个部分组成.我们之前只对包络进行的简单的介绍,相信很多同学对它还有其他两个的功能的了解还是云里雾里 ...
Mac book系统的垃圾清理如何进行？
当我们看到电脑发出的内存不足的提示,这就意味着: 1.Mac系统的内存即将被占满 2.电脑将运行缓慢 3.开机速度变慢很多人使用Mac book一年以后都会发现,它的运行开始逐渐变慢,爱电脑的人在将 ...
Linux-CentOS7下安装Oracle11g
简述: 本文操作环境采用CentOS7 Linux安装Oracle11g与Windows区别较大,在Linux下需要创建用户以及用户组来供Oracle使用 Windows可以直接图形化界面从第一步到最 ...
我给 Apache 顶级项目提了个 Bug
这篇文章记录了给 Apache 顶级项目 - 分库分表中间件 ShardingSphere 提交 Bug 的历程. 说实话,这是一次比较曲折的 Bug 跟踪之旅.10月28日,我们在 GitHub 上 ...
selenium调用JS实现自动化
webdriver自带的api使用起来有局限性,比如下拉滚动条文本框输入,以及一些弹出框的操作,使用JS直接操作方便又灵活. 一:示例 from selenium import webdriver f ...
浅谈 van Emde Boas 树——从 u 到 log log u 的蜕变
本文参考算法导论完成. 模板题在此 QwQ 优化的过程比较长,还请读者耐心阅读,认真理解. 最初的想法我会暴力! 用一个 $size$ 数组维护每个元素出现的次数. 不细讲,时间复杂度 \(O( ...
编程语言输出“ Hello World ”,你真的都会了吗?
Hello World 中文意思是『你好,世界』.因为<The C Programming Language>中使用它做为第一个演示程序,非常著名,所以后来的程序员在学习编程或进行设备调试 ...
sqli-labs-master less02-04
sql注入0-4关只存在注入方式的区别第一关 ?id=1'--+ ' 第二关 ?id=1--+ 无第三关 ?id=1')--+ ') 第四关 ?id=1")--+ ") 过程同 ...
04_ Broadcast Receiver
Broadcast是广播,和Android内的事件一样,它可以发出一个广播(事件),注册了该广播接收器(事件监听器)的所有组件都会接收到该广播,从而调用自己的响应方法(事件响应处理). 下面将详细的阐 ...
因为一个Docker问题，我顺手整理从安装到常用命令操作手册
今天,自己写了一部分业务代码,是常规代码的另外一种方式,不能在公司的服务器上测试,就自己在PC端搭建了一套和公司集群一样的模板,因为公司的业务模块的测试有单独的服务器(这一块还是我很稀罕的),但是,第 ...