自己写的数据交换工具——从Oracle到Elasticsearch

先说说需求的背景，由于业务数据都在Oracle数据库中，想要对它进行数据的分析会非常非常慢，用传统的数据仓库-->数据集市这种方式，集市层表会非常大，查询的时候如果再做一些group的操作，一个访问需要一分钟甚至更久才能响应。

为了解决这个问题，就想把业务库的数据迁移到Elasticsearch中，然后针对es再去做聚合查询。

问题来了，数据库中的数据量很大，如何导入到ES中呢？

Logstash JDBC

Logstash提供了一款JDBC的插件，可以在里面写sql语句，自动查询然后导入到ES中。这种方式比较简单，需要注意的就是需要用户自己下载jdbc的驱动jar包。

input {

	jdbc {

		jdbc_driver_library => "ojdbc14-10.2.0.3.0.jar"

		jdbc_driver_class => "Java::oracle.jdbc.driver.OracleDriver"

		jdbc_connection_string => "jdbc:oracle:thin:@localhost:1521:test"

		jdbc_user => "test"

		jdbc_password => "test123"

		schedule => "* * * * *"

		statement => "select * from TARGET_TABLE"

		add_field => ["type","a"]

	}

}

output{

	elasticsearch {

		hosts =>["10.10.1.205:9200"]

		index => "product"

		document_type => "%{type}"

	}

}

不过，它的性能实在是太差了！我导了一天，才导了两百多万的数据。

因此，就考虑自己来导。

自己的数据交换工具

思路：

1 采用JDBC的方式，通过分页读取数据库的全部数据。
2 数据库读取的数据存储成bulk形式的数据，关于bulk需要的文件格式，可以参考这里
3 利用bulk命令分批导入到es中

最后使用发现，自己写的导入程序，比Logstash jdbc快5-6倍~~~~~~　嗨皮！！！！

遇到的问题

1 JDBC需要采用分页的方式读取全量数据
2 要模仿bulk文件进行存储
3 由于bulk文件过大，导致curl内存溢出

程序开源

下面的代码需要注意的就是

public class JDBCUtil {

    private static Connection conn = null;

    private static PreparedStatement sta=null;

    static{

        try {

            Class.forName("oracle.jdbc.driver.OracleDriver");

            conn = DriverManager.getConnection("jdbc:oracle:thin:@localhost:1521:test", "test", "test123");

        } catch (ClassNotFoundException e) {

            e.printStackTrace();

        } catch (SQLException e) {

            e.printStackTrace();

        }

        System.out.println("Database connection established");

    }

    /**

    * 把查到的数据格式化写入到文件

    *

    * @param list 需要存储的数据

    * @param index 索引的名称

    * @param type 类型的名称

    * @param path 文件存储的路径

    **/

    public static void writeTable(List<Map> list,String index,String type,String path) throws SQLException, IOException {

        System.out.println("开始写文件");

        File file = new File(path);

        int count = 0;

        int size = list.size();

        for(Map map : list){

            FileUtils.write(file,  "{ \"index\" : { \"_index\" : \""+index+"\", \"_type\" : \""+type+"\" } }\n","UTF-8",true);

            FileUtils.write(file, JSON.toJSONString(map)+"\n","UTF-8",true);

//            System.out.println("写入了" + ((count++)+1) + "[" + size + "]");

        }

        System.out.println("写入完成");

    }

    /**

     * 读取数据

     * @param sql

     * @return

     * @throws SQLException

     */

    public static List<Map> readTable(String tablename,int start,int end) throws SQLException {

        System.out.println("开始读数据库");

        //执行查询

        sta = conn.prepareStatement("select * from(select rownum as rn,t.* from "+tablename+" t )where rn >="+start+" and rn <"+end);

        ResultSet rs = sta.executeQuery();

        //获取数据列表

        List<Map> data = new ArrayList();

        List<String> columnLabels = getColumnLabels(rs);

        Map<String, Object> map = null;

        while(rs.next()){

            map = new HashMap<String, Object>();

            for (String columnLabel : columnLabels) {

                Object value = rs.getObject(columnLabel);

                map.put(columnLabel.toLowerCase(), value);

            }

            data.add(map);

        }

        sta.close();

        System.out.println("数据读取完毕");

        return data;

    }

    /**

     * 获得列名

     * @param resultSet

     * @return

     * @throws SQLException

     */

    private static List<String> getColumnLabels(ResultSet resultSet)

            throws SQLException {

        List<String> labels = new ArrayList<String>();

        ResultSetMetaData rsmd = (ResultSetMetaData) resultSet.getMetaData();

        for (int i = 0; i < rsmd.getColumnCount(); i++) {

            labels.add(rsmd.getColumnLabel(i + 1));

        }

        return labels;

    }

    /**

    * 获得数据库表的总数，方便进行分页

    *

    * @param tablename 表名

    */

    public static int count(String tablename) throws SQLException {

        int count = 0;

        Statement stmt = conn.createStatement(ResultSet.TYPE_SCROLL_INSENSITIVE, ResultSet.CONCUR_UPDATABLE);

        ResultSet rs = stmt.executeQuery("select count(1) from "+tablename);

        while (rs.next()) {

            count = rs.getInt(1);

        }

        System.out.println("Total Size = " + count);

        rs.close();

        stmt.close();

        return count;

    }

    /**

     * 执行查询，并持久化文件

     *

     * @param tablename 导出的表明

     * @param page 分页的大小

     * @param path 文件的路径

     * @param index 索引的名称

     * @param type 类型的名称

     * @return

     * @throws SQLException

     */

    public static void readDataByPage(String tablename,int page,String path,String index,String type) throws SQLException, IOException {

        int count = count(tablename);

        int i =0;

        for(i =0;i<count;){

            List<Map> map = JDBCUtil.readTable(tablename,i,i+page);

            JDBCUtil.writeTable(map,index,type,path);

            i+=page;

        }

    }

}

在main方法中传入必要的参数即可：

public class Main {

    public static void main(String[] args) {

        try {

            JDBCUtil.readDataByPage("TABLE_NAME",1000,"D://data.json","index","type");

        } catch (SQLException e) {

            e.printStackTrace();

        } catch (IOException e) {

            e.printStackTrace();

        }

    }

}

这样得到bulk的数据后，就可以运行脚本分批导入了。

下面脚本的思路，就是每100000行左右的数据导入到一个目标文件，使用bulk命令导入到es中。注意一个细节就是不能随意的切分文件，因为bulk的文件是两行为一条数据的。

#!/bin/bash

count=0

rm target.json

touch target.json

while read line;do

((count++))

{

        echo $line >> target.json

        if [ $count -gt 100000 ] && [ $((count%2)) -eq 0 ];then

                count=0

                curl -XPOST localhost:9200/_bulk --data-binary @target.json > /dev/null

                rm target.json

                touch target.json

        fi

}

done < $1

echo 'last submit'

curl -XPOST localhost:9200/_bulk --data-binary @target.json > /dev/null

最后执行脚本:

sh auto_bulk.sh data.json

自己测试最后要比logstasj jdbc快5-6倍。

自己写的数据交换工具——从Oracle到Elasticsearch的更多相关文章

从Oracle到Elasticsearch
自己写的数据交换工具——从Oracle到Elasticsearch 自己写的数据交换工具——从Oracle到Elasticsearch 先说说需求的背景,由于业务数据都在Oracle数据库中,想要 ...
数据交换工具Kettle
网上搜集了一些关于开源数据交换工具Kattle的文章,特收藏例如以下: 文章一:ETL和Kettle简单介绍 ETL即数据抽取(Extract).转换(Transform).装载(Load)的过程.它 ...
数据导入导出Oracle数据库
临近春节,接到了一个导入数据的任务,在Linux客户端中的数据有50G,大约3亿3千万行: 刚开始很天真,把原始的txt/csv文件用sh脚本转化成了oralce 的insert into 语句,然后 ...
Oracle和Elasticsearch数据同步
Python编写Oracle和Elasticsearch数据同步脚本标签: elasticsearchoraclecx_Oraclepython数据同步 Python知识库一.版本 Pyth ...
Java代码实现excel数据导入到Oracle
1.首先需要两个jar包jxl.jar,ojdbc.jar(注意版本,版本不合适会报版本错误)2.代码: Java代码 import java.io.File; import java.io.Fi ...
SQL SERVER 2000/2005/2008数据库数据迁移到Oracle 10G细述
最近参与的一个系统涉及到把SQL Server 2k的数据迁移到Oracle 10G这一非功能需求.特将涉及到相关步骤列举如下供大家参考: 环境及现有资源: 1.OS: Windows 7 Enter ...
Netty中如何写大型数据
因为网络饱和的可能性,如何在异步框架中高效地写大块的数据是一个特殊的问题.由于写操作是非阻塞的,所以即使没有写出所有的数据,写操作也会在完成时返回并通知ChannelFuture.当这种情况发生时,如 ...
excel文件与txt文件互转，并且把excel里的数据导入到oracle中
一.excel文件转换成txt文件的步骤 a.首先要把excel文件转换成txt文件 1.Excel另存为中已经包含了TXT格式,所以我们可以直接将Excel表格另存为TXT格式,但是最后的效果好像不 ...
通过hive向写elasticsearch的写如数据
通过hive向写elasticsearch的写如数据 hive 和 elasticsearch 的整合可以参考官方的文档: ES-hadoop的hive整合 : https://www.elastic ...

随机推荐

读书笔记：JavaScript DOM 编程艺术（第二版）
读完还是能学到很多的基础知识,这里记录下,方便回顾与及时查阅. 内容也有自己的一些补充. JavaScript DOM 编程艺术(第二版) 1.JavaScript简史 JavaScript由Nets ...
HTML中上传与读取图片或文件（input file）----在路上（25）
input file相关知识简例在此介绍的input file相关知识为: 上传照片及文件,其中包括单次上传.批量上传.删除照片.增加照片.读取图片.对上传的图片或文件的判断,比如限制图片的张数.限 ...
【翻译】MongoDB指南/CRUD操作（四）
[原文地址]https://docs.mongodb.com/manual/ CRUD操作(四) 1 查询方案(Query Plans) MongoDB 查询优化程序处理查询并且针对给定可利用的索引选 ...
解决vs创建或打开C++浏览数据库文件*.sdf时发生错误的问题
VS2012, 创建或打开C++浏览数据库文件*.sdf时发生错误. IntelliSense 和浏览信息将不能用于C++项目. 请确保已安装 Microsoft SQL Server Compac ...
【手记】注意BinaryWriter写string的小坑——会在string前加上长度前缀length-prefixed
之前以为BinaryWriter写string会严格按构造时指定的编码(不指定则是无BOM的UTF8)写入string的二进制,如下面的代码: //将字符串"a"写入流,再拿到流的 ...
jquery中的$(document).ready(function() {});
当文档载入时执行function函数里的代码, 这部分代码主要声明,页面加载后 "监听事件" 的方法.例如: $(document).ready( $("a") ...
数塔问题（DP算法）自底向上计算最大值
Input 输入数据首先包括一个整数C,表示测试实例的个数,每个测试实例的第一行是一个整数N(1 <= N <= 100),表示数塔的高度,接下来用N行数字表示数塔,其中第i行有个i个整数 ...
APP多版本共存，服务端如何兼容？
做过APP产品的技术人员都知道,APP应用属于一种C/S架构的,所以在做多版本兼容,升级等处理则比较麻烦,不像web应用那么容易.下面将带大家分析几种常见的情况和应对方式: 小改动或者新加功能的这种 ...
【干货分享】流程DEMO-付款申请单
流程名: 付款申请单业务描述: 包括每月固定开支.固定资产付款.办公用品付款.工资发放.个人所得税缴纳.营业税缴纳.公积金.社保缴纳和已签订合同的按期付款,最后是出纳付款,出纳核对发票. 流程发起 ...
敏捷软件开发VS传统软件工程
敏捷软件开发:又称敏捷开发,是一种从1990年代开始逐渐引起广泛关注的一些新兴软件开发方法,是一种应对快速变化的需求的一种软件开发能力. 与传统软件工程相比,它们的具体名称.理念.过程.术语都不尽相同 ...