hadoop程序MapReduce之DataDeduplication

需求：去掉文件中重复的数据。

样板：data.log

2016-3-1 a

2016-3-2 b

2016-3-2 c

2016-3-2 b

输出结果： 2016-3-1 a

2016-3-2 b

2016-3-2 c

解决思路：取出一行数据，经过mapper处理后，利用MapReduce默认的将相同的key合并后交给reduce处理的原则,这样可以达到数据去重解决问题。

MapReduce分析设计：

Mapper分析设计：

1、<k1,v1>,k1代表：每行数据的行号，v1代表：一行数据。

2、<k2,v2>，k2代表：一行数据，v2代表：就这里可以设置为空值。

Reduce分析设计：

3、<k3,v3>，k3代表：相同的一行数据，v3代表：空值。

4、统计分析输出<k4,v4>，k4代表：相同的一行数据，v4代表:空值。

程序部分：

DataMapper类

package com.cn.DataDeduplication;

import java.io.IOException;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Mapper;

public class DataMapper extends Mapper<Object, Text, Text, Text>{

    Text line = new Text();

    @Override

    protected void map(Object key, Text value, Context context)

            throws IOException, InterruptedException {

        line = value;

        context.write(line, new Text(""));

    }

}

DataReduce类

package com.cn.DataDeduplication;

import java.io.IOException;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Reducer;

public class DataReduce extends Reducer<Text, Text, Text, Text> {

    @Override

    protected void reduce(Text key, Iterable<Text> values, Context context)

            throws IOException, InterruptedException {

        context.write(key, new Text(""));

    }

}

DataDeduplication类：

package com.cn.DataDeduplication;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import org.apache.hadoop.util.GenericOptionsParser;

/**

 * 数据去重

 * @author root

 *

 */

public class DataDeduplication {

    public static void main(String[] args) throws Exception {

        Configuration conf = new Configuration();

        String[] otherArgs = new GenericOptionsParser(conf, args).getRemainingArgs();

        if (otherArgs.length != 2) {

           System.err.println("Usage: wordcount  ");

           System.exit(2);

        }

        //创建一个job

        Job job = new Job(conf, "data deduplication");

        //设置运行的jar

        job.setJarByClass(DataDeduplication.class);

        //设置输入和输出文件路径

        FileInputFormat.addInputPath(job, new Path(otherArgs[0]));

        FileOutputFormat.setOutputPath(job, new Path(otherArgs[1]));

        //设置mapper和reduce处理类

        job.setMapperClass(DataMapper.class);

        job.setReducerClass(DataReduce.class);

        //设置输出key-value数据类型

        job.setOutputKeyClass(Text.class);

        job.setOutputValueClass(Text.class);

        //提交作业并等待它完成

        System.exit(job.waitForCompletion(true) ? 0 : 1);

    }

}

补充一点：一个文件切分的时候按照默认64M的数据块原则，启动一个mapper进程。

举例说明：比如data.log有20M，会启动一个mapper进程，data1.log有80M,会将这个文件拆分成64M+16M，所有要启动2个Mapper进程，

最终这两个文件会启动3个mapper进程。

hadoop程序MapReduce之DataDeduplication的更多相关文章

hadoop程序MapReduce之SingletonTableJoin
需求:单表关联问题.从文件中孩子和父母的关系挖掘出孙子和爷奶关系样板:child-parent.txt xiaoming daxiong daxiong alice daxiong jack 输出: ...
hadoop程序MapReduce之average
需求:求多门课程的平均值. 样板:math.txt zhangsan 90 lisi 88 wanghua 80 china.txt zhangsan 80lisi 90wanghua 88 输出:z ...
hadoop程序MapReduce之DataSort
需求:对文件中的数据进行排序. 样本:sort.log 10 13 10 20 输出:1 10 2 10 3 13 4 20 分析部分: mapper分析: 1.<k1,v1>k1代表:行 ...
hadoop程序MapReduce之MaxTemperature
需求:求每年当中最高的温度样本:temp.log 2016080623 2016072330 2015030420 输出结果:2016 30 2015 20 MapReduce分析设计: Mappe ...
hadoop程序MapReduce之WordCount
需求:统计一个文件中所有单词出现的个数. 样板:word.log文件中有hadoop hive hbase hadoop hive 输出:hadoop 2 hive 2 hbase 1 MapRedu ...
用PHP编写Hadoop的MapReduce程序
用PHP编写Hadoop的MapReduce程序 Hadoop流虽然Hadoop是用Java写的,但是Hadoop提供了Hadoop流,Hadoop流提供一个API, 允许用户使用任何语言编 ...
Hadoop之MapReduce程序应用三
摘要:MapReduce程序进行数据去重. 关键词:MapReduce 数据去重数据源:人工构造日志数据集log-file1.txt和log-file2.txt. log-file1.txt内容 ...
如何在Windows下面运行hadoop的MapReduce程序
在Windows下面运行hadoop的MapReduce程序的方法: 1.下载hadoop的安装包,这里使用的是"hadoop-2.6.4.tar.gz": 2.将安装包直接解压到 ...
Hadoop之Mapreduce 程序
package com.gylhaut.hadoop.senior.mapreduce; import java.io.IOException; import java.util.StringToke ...

随机推荐

ubuntu 12.04下gedit查看txt中文乱码解决办法
http://blog.sina.com.cn/s/blog_6273990801013dwv.html 由于我不能要求别人保存txt文件时必须用utf-8,那我只能自己找解决办法: 打开终端输入: ...
uboot的lds文件分析
OUTPUT_FORMAT("elf32-littlearm", "elf32-littlearm", "elf32-littlearm") ...
Android开发日记（三）
protected void onCreate(Bundle savedInstanceState) { super.onCreate(savedInstanceState); setContentV ...
TensorFlow机器学习框架-学习笔记-001
# TensorFlow机器学习框架-学习笔记-001 ### 测试TensorFlow环境是否安装完成-----------------------------```import tensorflo ...
VC中使用Matlab Engine出现"无法找到libeng.dll"的问题
VC中使用Matlab Engine出现"无法找到libeng.dll"的问题本以为使这个原因 ,其实不是我2了 #include "engine.h" // ...
手风琴式焦点图jQuery特效
手风琴式焦点图jQuery特效是一款鼠标点击人物图像滑动切换案例说明信息代码.效果图如下: 在线预览源码下载实现的代码. html代码: <div class="ag-cont ...
dubbo_远程同步调用原理
Dubbo缺省协议采用单一长连接和NIO异步通讯,适合于小数据量大并发的服务调用,以及服务消费者机器数远大于服务提供者机器数的情况. Dubbo缺省协议,使用基于mina1.1.7+hessian3. ...
openwrt使用list
openwrt中用到双向无头链表,实际应用时应在外部定义实体链表头,后续可直接应用链表函数(宏定义已将链表头排除在外): static struct list_head timeouts = LIST ...
LINQ操作符三：限制操作符
where是限制操作符,它将过滤标准应用在序列上,按照提供的逻辑对序列中的数据进行过滤. where操作符不启动查询的执行.当开始对序列进行遍历时才开始执行,此时过滤条件将被应用到查询中. 示例: / ...
DataGridView使用技巧六：冻结列或行
一.冻结列 DataGridViewColumn.Frozen属性为true时,该列左侧的所有列被固定,横向滚动时固定列不随滚动条滚动而左右移动.这对于重要列固定很有用. 示例:通过程序固定左侧第二列 ...

hadoop程序MapReduce之DataDeduplication

hadoop程序MapReduce之DataDeduplication的更多相关文章

随机推荐

热门专题