reduce累加实现

　　与map端的模式类似，map端要重写Mapper方法，reduce端也要重写Reduce方法，这里有一个泛型，我们先看参数类型

分别对应输入keyin,valuein,keyout,valueout.。

　　这里前两个参数：keyin，valueint就是map端处理以后的键值对。map端的逻辑我们已经写完了，在那个阶段，我们设置了以手机号为key，一个bean对象为value的键值对。但是map端还有其他的处理逻辑，设置完键值对以后，map还要把相同key的数据放在一起，打上分区标志（如果有分区的话），然后把相同分区的数据分发（shuffle）一个reduce里面。比如我们的原始数据有这么两个手机号：

13726230503112 00-FD-07-A4-72-B8:CMCC 120.196.100.82 i02.c.aliimg.com 24 27 2481 24681 200

13726230503112 5C-0E-8B-C7-F7-90:CMCC 120.197.40.4 rank.ie.sogou.com 搜索引擎 28 27 3659 3538 200，

　　map端处理完以后，分发到reduce的数据格式是这样一个map集合：

map(

key:13726230503112

value{

　　phoneNumber:13726230503112 ,upFlow:2481 downFlow:24681 ,sumFlow:27162

　　phoneNumber:13726230503112 ,upFlow:3659 downFlow:3538 ,sumFlow:7179

}

)

reduce代码：

package MR.phone;

import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Reducer;

import java.io.IOException;

public class FlowReduce extends Reducer<Text,PhoneBean,Text,PhoneBean> {
    @Override
    protected void reduce(Text key, Iterable<PhoneBean> values, Reducer<Text, PhoneBean, Text, PhoneBean>.Context context) throws IOException, InterruptedException {
        //遍历所有的PnoneBean，将其上下行流量进行累加计算，计算完之后封装数据，写出
        long sum_upflow=0;
        long sum_downflow=0;
        long sum_flow=0;
        for (PhoneBean flow : values) {
            sum_upflow=sum_upflow+flow.getUpFlow();
            sum_downflow=sum_downflow+ flow.getDownFlow();
            sum_flow=sum_flow+flow.getSumFlow();
        }
        //封装数据，写出
        PhoneBean result_flow=new PhoneBean(sum_upflow,sum_downflow,sum_flow);
        context.write(key,result_flow);

    }
}

这里的代码逻辑计较简单，注意我们这里封装valueout的时候，用的有参构造，注意bean里面要有有参构造。但是整个一个map——shuffl——reduce过程基本就是这样了。现在回过头看map-reduce的流程图，会清晰很多。

现在剩下的问题就是搞个Driver（固定套路），测试一下我们的代码逻辑：

package MR.phone;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import java.io.IOException;

public class FlowDriver {
    public static void main(String[] args) throws IOException, InterruptedException, ClassNotFoundException {
        //1,获取配置信息，设置job
        Configuration conf = new Configuration();
        Job job = Job.getInstance(conf);

        //设置job
        job.setJarByClass(FlowDriver.class);

        //设置map
        job.setMapperClass(FlowMapper.class);
        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(PhoneBean.class);

        //设置reduce
        job.setReducerClass(FlowReduce.class);
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(PhoneBean.class);

        //设置路径
        FileInputFormat.setInputPaths(job,new Path("D:\\bigadatapra\\phone_data.txt"));
        FileOutputFormat.setOutputPath(job,new Path("D:\\bigadatapra\\output041801"));

        //提交job
        boolean result = job.waitForCompletion(true);

        System.exit(result?0:1);

    }

}

如果配置好本地Hadoop环境的话，直接运行main函数就能看见结果了。

reduce累加实现的更多相关文章

python 练习用python六剑客实现一个统计数字的个数，六剑客：（map、lambda、reduce、filter、切片、推到列表）
统计一共有几个数字 s="sdfa45ads46723" #lambda >>> filter(lambda x:x.isdigit(),list(s)) ['4 ...
第七十九篇：数组方法(forEach,some,every,reduce)
好家伙,来复习几个数组方法, 1.forEach循环与some循环代码如下: <script> const arr =['奔驰','宝马','GTR','奥迪'] //forEach循环 ...
python test
#!/usr/bin/env python #-*- encoding: utf- -*- ''' def foo(name): print name, '去砍柴' foo('yangshanlei: ...
Python序列函数、高级特性及高阶函数
序列函数: enumerate: for循环时记录索引,逐个返回元组(i, item) sorted:返回新的有序列表 zip:压缩将多个序列的对应位置的元素组成元组 zip(*元组列表): 解压缩 ...
使用javascript模拟常见数据结构（一）
数据结构和算法可算是每个程序员的必备技能,而随着前端工作的深入,对于数据结构的知识真的是越来越需要掌握了.好了,于是乎最近看了<javascript数据结构和算法>,算是对于后面的使用C语 ...
simrank
simrank 背景度量相似度是许多应用的关键问题.传统方法与问题的领域相关,如文本匹配.计算交集.simrank则利用关联关系度量相似性,即"两个节点的相似性和各自邻域节点的相似度有关& ...
ES5拓展
一.JSON拓展 1.JSON.parse(str,fun):将JSON字符串转为js对象两个参数:str表示要处理的字符串:fun处理函数,函数有两个参数,属性名.属性值 // 定义json字符串 ...
numpy_basic3
矩陣矩阵是numpy.matrix类类型的对象,该类继承自numpy.ndarray,任何针对多维数组的操作,对矩阵同样有效,但是作为子类矩阵又结合其自身的特点,做了必要的扩充,比如:乘法计算.求逆 ...
js数组的遍历(API)
1.for 循环普通遍历方法,可优化,存下数组的length,避免每次都去获取数组的length,性能提升 for(var i=0;i<arr.length;i++){ console.log ...

随机推荐

【mq】从零开始实现 mq-10-消费者拉取消息回执 pull message ack
前景回顾 [mq]从零开始实现 mq-01-生产者.消费者启动 [mq]从零开始实现 mq-02-如何实现生产者调用消费者? [mq]从零开始实现 mq-03-引入 broker 中间人 [mq]从零 ...
Swift初探03 字符串操作
字符串操作 01 获取长度 var a = "he l lo" print(a.count) // 计算空格,输出7 02 String.Index类型 String.Index类 ...
一图详解java-class类文件原理
摘要:徒手制作一张超大的类文件解析图,方便通过浏览这个图能马上回忆起class文件的结构以及内部的指令. 本文分享自华为云社区<[读书会第十二期]这可能是全网"最大".&qu ...
基于.NetCore开发博客项目 StarBlog - (6) 页面开发之博客文章列表
系列文章基于.NetCore开发博客项目 StarBlog - (1) 为什么需要自己写一个博客? 基于.NetCore开发博客项目 StarBlog - (2) 环境准备和创建项目基于.NetC ...
iTextSharp 提取签名图像
原文本文使用 iTextSharp 5.5.13.2,记录使用 iTextSharp 提取图片时,获得的知识点. pdf 中的签名并不是单纯的一张图片,它是由一张基础的底色图和一张蒙版图片组成.需要 ...
20212115 实验二《python程序设计》实验报告
实验二计算器设计 #20212115 2021-2022-2 <python程序设计> 实验报告二课程: 课程:<Python程序设计>班级: 2121姓名: 朱时鸿学号: ...
[算法学习] 换根dp
换根dp 一般来说,我们做题的树都是默认 \(1\) 为根的.但是有些题目需要计算以每个节点为根时的内容. 朴素的暴力:以每个点 \(u\) 作为 \(root\) 暴力dfs下去,复杂度\(O(n^ ...
HashMap 中的 hash 函数
1. 什么是 hash 函数 hash 函数,即散列函数,或叫哈希函数.它可以将不定长的输入,通过散列算法转换成一个定长的输出,这个输出就是散列值.需要注意的是,不同的输入通过散列函数,也可能会得到同 ...
Winforms选择文件夹、文件
更新记录: 2022年5月28日初始记录选择文件夹 if (this.folderBrowserDialog1.ShowDialog() == DialogResult.OK) { //获得用户选 ...
React + Typescript领域初学者的常见问题和技巧
React + Typescript领域初学者的常见问题和技巧创建一个联合类型的常量 Key const NAME = { HOGE: "hoge", FUGA: "f ...

reduce累加实现

reduce累加实现的更多相关文章

随机推荐

热门专题