hadoop编程技巧（6）---处理大量的小型数据文件CombineFileInputFormat申请书

代码测试环境：Hadoop2.4

应用场景：当需要处理非常多的小数据文件，这种技术的目的，可以被应用到实现高效的数据处理。

原理：申请书CombineFileInputFormat，能够进行切片合并的时候把多个小的数据文件。因为每个切片将有一个Mapper，当一个Mapper处理的数据比較小的时候，其效率较低。而一般使用Hadoop处理数据时。即默认方式，会把一个输入数据文件当做一个分片。这样当输入文件较小时就会出现效率低下的情况。

实例：

參考前篇blog：hadoop编程小技巧（5）---自己定义输入文件格式类InputFormat。只是这次输入使用两个输入文件，都是小数据量的数据文件。

自己定义输入文件格式：CustomCombineFileInputFormat：

package fz.combineinputformat;

import java.io.IOException;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.InputSplit;

import org.apache.hadoop.mapreduce.RecordReader;

import org.apache.hadoop.mapreduce.TaskAttemptContext;

import org.apache.hadoop.mapreduce.lib.input.CombineFileInputFormat;

import org.apache.hadoop.mapreduce.lib.input.CombineFileRecordReader;

import org.apache.hadoop.mapreduce.lib.input.CombineFileSplit;

/**

 * 定义读取类

 * @author fansy

 *

 */

public class CustomCombineFileInputFormat extends CombineFileInputFormat<Text, Text> {

	@Override

	public RecordReader<Text, Text> createRecordReader(InputSplit split,

			TaskAttemptContext context) throws IOException {

		// TODO Auto-generated method stub

		return new CombineFileRecordReader<Text, Text>((CombineFileSplit)split,context,CustomCombineReader.class);

	}

}

自己定义记录读取类CustomCombineReader：

package fz.combineinputformat;

import java.io.IOException;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.InputSplit;

import org.apache.hadoop.mapreduce.RecordReader;

import org.apache.hadoop.mapreduce.TaskAttemptContext;

import org.apache.hadoop.mapreduce.lib.input.CombineFileSplit;

import org.apache.hadoop.mapreduce.lib.input.FileSplit;

/**

 * 改动初始化函数

 * @author fansy

 *

 */

public class CustomCombineReader extends RecordReader<Text, Text> {

	private int index;

	private CustomReader in;

	public CustomCombineReader(CombineFileSplit split,TaskAttemptContext cxt,Integer index){

			this.index=index;

			this.in= new CustomReader();

	}

	@Override

	public void initialize(InputSplit split, TaskAttemptContext context)

			throws IOException, InterruptedException {

		CombineFileSplit cfsplit= (CombineFileSplit) split;

		FileSplit fileSplit = new FileSplit(cfsplit.getPath(index),cfsplit.getOffset(index),

				cfsplit.getLength(),cfsplit.getLocations());

		in.initialize(fileSplit, context);

	}

	@Override

	public boolean nextKeyValue() throws IOException, InterruptedException {

		return in.nextKeyValue();

	}

	@Override

	public Text getCurrentKey() throws IOException, InterruptedException {

		// TODO Auto-generated method stub

		return in.getCurrentKey();

	}

	@Override

	public Text getCurrentValue() throws IOException, InterruptedException {

		// TODO Auto-generated method stub

		return in.getCurrentValue();

	}

	@Override

	public float getProgress() throws IOException, InterruptedException {

		// TODO Auto-generated method stub

		return in.getProgress();

	}

	@Override

	public void close() throws IOException {

		// TODO Auto-generated method stub

		in.close();

	}

}

能够看到这个类使用了上篇博客的CustomReader类。仅仅是改动了下初始化函数，使得小数据量的文件能够合并到一个分片而已。CustomReader能够參考前篇blog：hadoop编程小技巧（5）---自己定义输入文件格式类InputFormat 。

主类，仅仅需改动（相同參考前篇blog）：

job.setInputFormatClass(CustomCombineFileInputFormat.class);

进行了两次实验。第一次使用CombineFileInputFormat读取，第二次使用TextInputFormat读取。

结果查看：

首先能够从终端看出来：

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvZmFuc3kxOTkw/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/SouthEast" alt="" />

能够看到相同的两个输入文件，任务096仅仅有一个分片。任务097有两个分片；

同一时候在任务监控界面也能够看到Mapper的个数变化：

总结：CombineFileInputFormat具有非常强的应用价值，针对大量小数据具有非常高的处理效率收益。只是。假设是大数据应用，普通情况下可能输入数据都是非常大的，所以。这样的情况也仅仅是针对一些特殊情况的处理。

分享，成长。快乐

转载请注明blog地址：http://blog.csdn.net/fansy1990

hadoop编程技巧（6）---处理大量的小型数据文件CombineFileInputFormat申请书的更多相关文章

hadoop编程技巧（8）---Unit Testing (单元测试)
所需的环境: Hadoop相关jar包裹(下载版本的官方网站上可以): 下载junit包裹(新以及). 下载mockito包裹: 下载mrunit包裹: 下载powermock-mockito包裹: ...
hadoop编程技巧（4）---总体情况key按类别搜索TotalOrderPartitioner
Hadoop代码测试版:Hadoop2.4 原理:携带MR该程序随机抽样提取前的输入数据,样本分类,然后,MR该过程的中间Partition此值用于当样品排序分组数据.这使得可以实现全球排名的目的. ...
hadoop编程技巧（3）---定义自己的区划类别Partitioner
Hadoop代码测试环境:Hadoop2.4 原则:在Hadoop的MapReduce过程.Mapper阅读过程完成后数据.它将数据发送到Partitioner.由Partitioner每个记录应当采 ...
BASH的保护性编程技巧
BASH的保护性编程技巧 shell常用逻辑判断 -b file 若文件存在且是一个块特殊文件,则为真 -c file 若文件存在且是一个字符特殊文件,则为真 -d file 若文件存在且是一个目 ...
js异步编程技巧一
异步回调是js的一大特性,理解好用好这个特性可以写出很高质量的代码.分享一些实际用的一些异步编程技巧. 1.我们有些应用环境是需要等待两个http请求或IO操作返回后进行后续逻辑的处理.而这种情况使用 ...
EF – 2.EF数据查询基础（上）查询数据的实用编程技巧
目录 5.4.1 查询符合条件的单条记录 EF使用SingleOrDefault()和Find()两个方法查询符合条件的单条记录. 5.4.2 Entity Framework中的内部数据缓存 DbS ...
VC多文档编程技巧（取消一开始时打开的空白文档）
VC多文档编程技巧(取消一开始时打开的空白文档) http://blog.csdn.net/crazyvoice/article/details/6185461 VC多文档编程技巧(取消一开始时打开的 ...
java命名规范和编程技巧
一个好的java程序首先命名要规范. 命名规范定义这个规范的目的是让项目中所有的文档都看起来像一个人写的,增加可读性,方便维护等作用 Package 的命名 Package 的名字应该都是由一个小写 ...
无插件Vim编程技巧
无插件Vim编程技巧 http://bbs.byr.cn/#!article/buptAUTA/59钻风 2014-03-24 09:43:46 发表于:vim 相信大家看过<简明Vim教程& ...

随机推荐

Visual studio编译器窗体重置
针对vs2003: 第一种方法在"工具"->"选项"对话框里面: 在"选项"以下的"常规"有个"重置 ...
CentOS 7 virt-manager 无法连接本地的hypervisor
OS : CentOS 7 Gnome Desktop 问题描写叙述: CentOS 7 下使用yum install virt-manager之后.使用virt-manager无法连接本地的hype ...
embed-it_Integrator memory compile工具使用之二
embed-it_Integrator memory compile工具使用之二主要内容使用ish接口自动加载memory的cfg文件运行生成memory 脚本内容打开Integrate &am ...
[Angular2 Form] Check password match
Learn how to create a custom validator to check whether passwords match. <h1>password match< ...
windows2003 IIS6下安装ISAPI_Rewrite3破解版
摘抄的https://jingyan.baidu.com/article/ff42efa931a2c0c19e220298.html 非常感谢,我是怕百度经验有一天消失了,以防万一 iis6 ISAP ...
ng-cli搭建angular项目框架
原文地址 https://www.jianshu.com/p/0a8f4b0f29b3 环境准备以下步骤都不需要事先创建文件夹,只是环境的准备过程,只有到需要搭建项目的时候才需要创建文件夹用来存放项 ...
使用JQuery将前端form表单数据转换为JSON字符串传递到后台处理
一般地,我们在处理表单(form表单哦)数据时,传输对象或字符串到后台,Spring MVC或SpringBoot的Controller接收时使用一个对象作为参数就可以被正常接收并封装到对象中.这种方 ...
从Lua调用C
从Lua调用C: 方式:C函数从栈中获取函数參数(第一个參数总是局部栈的索引1),将结果压入栈中,C函数须要返回结果数量. 每一个函数都有自己的局部私有栈样例: static int l_sin(l ...
Android 从硬件到应用：一步一步向上爬 4 -- 使用 JNI 方法调硬件驱动
Android下,java应用程序通过JNI方法调用硬件抽象层模块,在Android 从硬件到应用:一步一步向上爬 3 -- 硬件抽象层訪问硬件驱动中我们已经编译好了硬件抽象层模块,以下就要開始为H ...
js中ajax连接服务器open函数的另外两个默认参数get请求和默认异步（open的post方式send函数带参数）（post请求和get请求区别：get：快、简单 post：安全，量大，不缓存）（服务器同步和异步区别：同步：等待服务器响应当中浏览器不能做别的事情）（ajax和jquery一起用的）
js中ajax连接服务器open函数的另外两个默认参数get请求和默认异步(open的post方式send函数带参数)(post请求和get请求区别:get:快.简单 post:安全,量大,不缓存)( ...

hadoop编程技巧（6）---处理大量的小型数据文件CombineFileInputFormat申请书

hadoop编程技巧（6）---处理大量的小型数据文件CombineFileInputFormat申请书的更多相关文章

随机推荐

热门专题