十二道MR习题 – 1

题目：

一个文件，大小约为100G。文件的每一行都是一个数字，要求对文件中的所有数字进行排序。

对于这个题目，了解过Hadoop的同学可以笑而不语了。即使用spark实现也是非常简单的事情。

先说下如何用Hadoop实现。实际上也没什么好说的：Map任务逐行读入数字，而后在Reduce中输出就可以了，简单粗暴到令人发指。

看下代码好了：

package com.zhyea.dev;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.Mapper;

import org.apache.hadoop.mapreduce.Reducer;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import java.io.IOException;

public class NumberSort {

    public static class SplitterMapper extends Mapper<Object, Text, IntWritable, IntWritable> {

        private static final IntWritable intWritable = new IntWritable();

        @Override

        public void map(Object key, Text value, Context context) {

            try {

                int num = Integer.valueOf(value.toString());

                intWritable.set(num);

                context.write(intWritable, intWritable);

            } catch (Exception e) {

                e.printStackTrace();

            }

        }

    }

    public static class IntegrateReducer extends Reducer<IntWritable, IntWritable, IntWritable, IntWritable> {

        @Override

        public void reduce(IntWritable key, Iterable<IntWritable> values, Context context) {

            try {

                context.write(key, key);

            } catch (Exception e) {

                e.printStackTrace();

            }

        }

    }

    public static void main(String[] args) throws IOException, ClassNotFoundException, InterruptedException {

        Configuration conf = new Configuration();

        Job job = Job.getInstance(conf, "number-sort");

        job.setJarByClass(NumberSort.class);

        job.setMapperClass(SplitterMapper.class);

        job.setReducerClass(IntegrateReducer.class);

        job.setOutputKeyClass(IntWritable.class);

        job.setOutputValueClass(IntWritable.class);

        FileInputFormat.addInputPath(job, new Path(args[0]));

        FileOutputFormat.setOutputPath(job, new Path(args[1]));

        System.exit(job.waitForCompletion(true) ? 0 : 1);

    }

}

在map方法中，输出值的Value部分我选择了一个IntWritable的值。Value值的类型也是可以设置为NullWritable的。

在我们的程序里没有执行任何排序的动作，但是输出的结果是有序的，这是因为在shuffle阶段已经完成了排序（一次快速排序，一次归并排序）。

再来看看用spark是如何完成的：

object NumSortJob {

  def main(args: Array[String]): Unit = {

    val inputPath = args(0)

    val outputPath = args(1)

    val conf = new SparkConf().setAppName("Num Sort")

    val sc = new SparkContext(conf)

    val data = sc.hadoopFile[LongWritable, Text, TextInputFormat](inputPath)

    data.map(p => p._2.toString.toInt).distinct().sortBy[Int](p => p).coalesce(1, true).saveAsTextFile(outputPath)

  }

}

spark则需要主动进行排序。即使选择了使用sortBasedShuffle，它的排序也仅止于mapper端的排序，结果集不一定是有序的。

#########

十二道MR习题 – 1 – 排序的更多相关文章

十二道MR习题 - 4 - TopN问题
题目: 有一个很大的文件,这文件中的内容全部都是数字,要求尝试从这个文件中找出最大的10个数字. 分析: 看起来像是一个比较简单的问题.不用大数据框架的话,也能比较轻易的实现:就是逐个读取文件中的每个 ...
十二道MR习题 - 2 - 多文件保存
题目: 需要将MR的执行结果保存到3个文件中,该怎么做. 又是一个送分题. 对于Hadoop的MapReduce来说只需要设置一下reduce任务的数量即可.MR的Job默认reduce数量是1,需要 ...
十二道MR习题 - 3 - 交集并集差集
题目有两个文件A和B,两个文件中都有几百万行数字,现在需要找出A文件和B文件中数字集合的交集.并集.以及A对B的差集. 简单说一下思路: 这个问题关键在于key和value的设计.这里我将文件中的数 ...
Java进阶(三十九)Java集合类的排序,查找,替换操作
Java进阶(三十九)Java集合类的排序,查找,替换操作前言在Java方向校招过程中,经常会遇到将输入转换为数组的情况,而我们通常使用ArrayList来表示动态数组.获取到ArrayList对 ...
YTU 2427: C语言习题整数排序
2427: C语言习题整数排序时间限制: 1 Sec 内存限制: 128 MB 提交: 391 解决: 282 题目描述用指向指针的指针的方法对n个整数排序并输出.要求将排序单独写成一个函数 ...
YTU 2426: C语言习题字符串排序
2426: C语言习题字符串排序时间限制: 1 Sec 内存限制: 128 MB 提交: 262 解决: 164 题目描述用指向指针的指针的方法对5个字符串排序并输出.要求将排序单独写成一个 ...
YTU 2414: C语言习题字符串排序
2414: C语言习题字符串排序时间限制: 1 Sec 内存限制: 128 MB 提交: 656 解决: 305 题目描述输入n个字符串,将它们按字母由小到大的顺序排列并输出.编写三个函数实 ...
C primer plus 第五版十二章习题
看完C prime plus(第五版)第十二章,随带完成了后面的习题. 1.不使用全局变量,重写程序清单12.4的程序. 先贴出12.4的程序,方便对照: /* global.c --- 使用外部变量 ...
Python [习题] 字典排序
[习题] 对此字典分别按照value 和key 如何排序? dic1 = {'and':40, 'a':54, 'is':60, 'path':139, 'the':124, 'os':49} In ...

随机推荐

调试SVO_edgelet
感谢白巧克力亦唯心提供的SVO_edgelet代码,作者博客:https://blog.csdn.net/heyijia0327/article/details/61682150 程序地址: http ...
libprotobuf 编译错误处理
1. 编译完链接的时候报错undefined reference to well_known_types_js' 出现这个错误的原因是升级gcc导致的,是程序依赖的include文件和实际链接的文件不 ...
Powershell实现Telnet Port
Telnet Port 脚本 $servers = get-content D:\ps\ServerIPAddress.TXT $portToCheck = '80' for($i=1;$i -le ...
Linux的.a、.so和.o文件 windows下obj,lib,dll,exe的关系
Linux的.a..so和.o文件 - chlele0105的专栏 - CSDN博客 https://blog.csdn.net/chlele0105/article/details/23691147 ...
python中open函数的使用
转自:https://www.cnblogs.com/R-ling/p/8412578.html 一.open()的函数原型open(file, mode=‘r', buffering=-1, enc ...
Java 之继承和 final 关键字
继承的概述继承的特点 super 关键字函数覆盖子类的实例化过程 final 关键字 1. 继承的概述继承是类与类之间的关系. 继承的好处: 提高了代码的复用性让类与类之间产生了关系, 给第 ...
centos7 重启网卡失败
今天在centOS 7 network服务重启不了现把各种解决方法归纳整理,希望能让后面的同学少走点歪路... 首先看问题:执行service network restart命令后出现下面的错误: ...
DateTimeTypeHandler
mysql-timestimp-------model-DateTime(jodatime) public class DataTimeTypeHandler extends BaseTypeHand ...
MariaDB日志
1.查询日志:一般来说不开开启(会产生额外压力,并且不一定有价值),query log 记录查询操作:可以记录到文件(file)中也可记录到表(table)中 general_log=ON|OFF g ...
likely(x)与unlikely(x) __builtin_expect
本文讲的likely()和unlikely()两个宏,在linux内核代码和一些应用中可常见到它们的身影.实质上,这两个宏是关于GCC编译器内置宏__builtin_expect的使用. 顾名思义,l ...

十二道MR习题 – 1 – 排序

十二道MR习题 – 1 – 排序的更多相关文章

随机推荐

热门专题