大数据算法设计模式(1)

topN算法，spark实现

package com.kangaroo.studio.algorithms.topn;

import org.apache.spark.api.java.JavaPairRDD;

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.JavaSparkContext;

import org.apache.spark.api.java.function.FlatMapFunction;

import org.apache.spark.api.java.function.Function2;

import org.apache.spark.api.java.function.PairFunction;

import org.apache.spark.broadcast.Broadcast;

import scala.Tuple2;

import java.io.Serializable;

import java.util.*;

public class TopNSpark implements Serializable {

    private JavaSparkContext jsc;

    Broadcast<Integer> topNum;

    private String inputPath;

    /*

    *   构造函数

    *   1. 初始化JavaSparkContext

    *   2. 初始化广播变量topN个数, 可以被所有partition共享

    *   3. 初始化输入路径

    * */

    public TopNSpark(Integer Num, String path) {

        jsc = new JavaSparkContext();

        topNum = jsc.broadcast(Num);

        inputPath = path;

    }

    /*

    *   程序入口函数

    * */

    public void run() {

        /*

        *   读入inputPath中的数据

        * */

        JavaRDD<String> lines = jsc.textFile(inputPath, 1);

        /*

        *   将rdd规约到9个分区

        * */

        JavaRDD<String> rdd = lines.coalesce(9);

        /*

        *   将输入转化为kv格式

        *   key是规约的主键, value是排序参考的个数

        *   注: 这里的key并不唯一, 即相同的key可能有多条记录, 所以下面我们规约key成唯一键

        *   输入:line, 输出:kv

        * */

        JavaPairRDD<String, Integer> kv = rdd.mapToPair(new PairFunction<String, String, Integer>() {

            public Tuple2<String, Integer> call(String s) throws Exception {

                String[] tokens = s.split(",");

                return new Tuple2<String, Integer>(tokens[0], Integer.parseInt(tokens[1]));

            }

        });

        /*

        *   规约主键成为唯一键

        *   输入:kv, 输出:kv

        * */

        JavaPairRDD<String, Integer> uniqueKeys = kv.reduceByKey(new Function2<Integer, Integer, Integer>() {

            public Integer call(Integer i1, Integer i2) throws Exception {

                return i1 + i2;

            }

        });

        /*

        *   计算各个分区的topN

        *   这里通过广播变量拿到了topN具体个数, 每个分区都保留topN, 所有分区总个数: partitionNum * topN

        *   输入:kv, 输出:SortMap, 长度topN

        * */

        JavaRDD<SortedMap<Integer, String>> partitions = uniqueKeys.mapPartitions(new FlatMapFunction<Iterator<Tuple2<String,Integer>>, SortedMap<Integer, String>>() {

            public Iterable<SortedMap<Integer, String>> call(Iterator<Tuple2<String, Integer>> iter) throws Exception {

                final int N = topNum.getValue();

                SortedMap<Integer, String> topN = new TreeMap<Integer, String>();

                while (iter.hasNext()) {

                    Tuple2<String, Integer> tuple = iter.next();

                    topN.put(tuple._2, tuple._1);

                    if (topN.size() > N) {

                        topN.remove(topN.firstKey());

                    }

                }

                return Collections.singletonList(topN);

            }

        });

        /*

        *   规约所有分区的topN SortMap, 得到最终的SortMap, 长度topN

        *   reduce过后, 数据已经到了本地缓存, 这是最后结果

        *   输入: SortMap, 长度topN, 当然有partitionNum个, 输出:SortMap, 长度topN

        * */

        SortedMap<Integer, String> finalTopN = partitions.reduce(new Function2<SortedMap<Integer, String>, SortedMap<Integer, String>, SortedMap<Integer, String>>() {

            public SortedMap<Integer, String> call(SortedMap<Integer, String> m1, SortedMap<Integer, String> m2) throws Exception {

                final int N = topNum.getValue();

                SortedMap<Integer, String> topN = new TreeMap<Integer, String>();

                for (Map.Entry<Integer, String> entry : m1.entrySet()) {

                    topN.put(entry.getKey(), entry.getValue());

                    if (topN.size() > N) {

                        topN.remove(topN.firstKey());

                    }

                }

                for (Map.Entry<Integer, String> entry : m2.entrySet()) {

                    topN.put(entry.getKey(), entry.getValue());

                    if (topN.size() > N) {

                        topN.remove(topN.firstKey());

                    }

                }

                return topN;

            }

        });

        /*

        *   将本地缓存的最终结果打印出来

        * */

        for (Map.Entry<Integer, String> entry : finalTopN.entrySet()) {

            System.out.println(entry.getKey() + " -- " + entry.getValue());

        }

    }

    public static void main(String[] args) {

        /*

        *   topN个数:topN

        *   输入数据路径:inputPath

        * */

        Integer topN = Integer.parseInt(args[0]);

        String inputPath = args[1];

        TopNSpark topNSpark = new TopNSpark(topN, inputPath);

        topNSpark.run();

    }

}

大数据算法设计模式(1) - topN spark实现的更多相关文章

大数据算法设计模式(2) - 左外链接(leftOuterJoin) spark实现
左外链接(leftOuterJoin) spark实现 package com.kangaroo.studio.algorithms.join; import org.apache.spark.api ...
大数据系列之并行计算引擎Spark介绍
相关博文:大数据系列之并行计算引擎Spark部署及应用 Spark: Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎. Spark是UC Berkeley AMP lab ( ...
大数据平台搭建（hadoop+spark）
大数据平台搭建(hadoop+spark) 一.基本信息 1. 服务器基本信息主机名 ip地址安装服务 spark-master 172.16.200.81 jdk.hadoop.spark.sc ...
大数据算法->推荐系统常用算法之基于内容的推荐系统算法
港真,自己一直非常希望做算法工程师,所以自己现在开始对现在常用的大数据算法进行不断地学习,今天了解到的算法,就是我们生活中无处不在的推荐系统算法. 其实,向别人推荐商品是一个很常见的现象,比如我用了一 ...
大数据学习系列之七 ----- Hadoop+Spark+Zookeeper+HBase+Hive集群搭建图文详解
引言在之前的大数据学习系列中,搭建了Hadoop+Spark+HBase+Hive 环境以及一些测试.其实要说的话,我开始学习大数据的时候,搭建的就是集群,并不是单机模式和伪分布式.至于为什么先写单 ...
大数据系列之并行计算引擎Spark部署及应用
相关博文: 大数据系列之并行计算引擎Spark介绍之前介绍过关于Spark的程序运行模式有三种: 1.Local模式: 2.standalone(独立模式) 3.Yarn/mesos模式本文将介绍 ...
CentOS6安装各种大数据软件第十章：Spark集群安装和部署
相关文章链接 CentOS6安装各种大数据软件第一章:各个软件版本介绍 CentOS6安装各种大数据软件第二章:Linux各个软件启动命令 CentOS6安装各种大数据软件第三章:Linux基础 ...
大数据学习（24）—— Spark入门
在学Spark之前,我们再回顾一下MapReduce的知识,这对我们理解Spark大有裨益. 在大数据的技术分层中,Spark和MapReduce同为计算层的批处理技术,但是Spark比MapRedu ...
大数据学习系列之六 ----- Hadoop+Spark环境搭建
引言在上一篇中大数据学习系列之五 ----- Hive整合HBase图文详解 : http://www.panchengming.com/2017/12/18/pancm62/ 中使用Hive整合 ...

随机推荐

Linux修改文件permission属性
列出文件属性 ls -al 修改文件属性为可读.可写 sudo chmod -c 777 <your file name>
算法学习：Pac-Man的简单对抗
Pacman项目是加州大学伯克利分校提供的一个可视化的AI学习平台.其主体利用python完成.该项目提供了丰富的说明文档,以及预先实现了一些简单的算法供参考各接口的使用. http://ai.ber ...
Project 3:N级魔方阵
魔方阵:由n*n个数字所组成的n阶方阵,具有各对角线,各横列与纵行的数字和都相等的性质,称为魔方阵.而这个相等的和称为魔术数字.若填入的数字是从1到n*n,称此种魔方阵为n阶正规魔方阵. 目标:输入一 ...
alert执行顺序
<p><span id="span1">Hello World!</span></p> <script type=" ...
个人作业2 — 英语学习APP的案例分析
一.调研准备: 1.软件:必应词典 2.平台:安卓 3.bug定义:(引用自<构建之法>13.1节) Bug:软件的缺陷 Bug可以分解为:症状(Symptom). ...
【Beta】第二次Daily Scrum Meeting
一.本次会议为第二次meeting会议二.时间:13:30AM-13:55AM 地点:禹州三.会议站立式照片四.今日任务安排成员昨日任务今日任务林晓芳对已完成的功能进行进一步测试,以便 ...
[2017BUAA软工助教]收集个人信息
如题我们要收集三个东西 1.学号 2.Github地址 ① 3.博客园博客地址 ② 请各位同学自行创建,并按照如下的格式评论在这篇博客下 "14061195+https://github. ...
201521123081《java程序设计》第11周学习总结
1. 本周学习总结 1.1 以你喜欢的方式(思维导图或其他)归纳总结多线程相关内容. 参考资料:XMind ============================================== ...
关于APP在小米5s第一次安装启动后，点击home返回桌面，再次进入重进闪屏页问题
现象今天工作中,在对公司产品进行测试的时候,程序员小哥点出了一个问题.问题点出的步骤是这样的: 1.安装APP 2.点击打开 3.经过闪屏页,进入主页后,点击HOME键 4.再次进入程序会重新进入闪 ...
纳税服务系统【异常处理、抽取BaseAction】
前言本博文主要讲解在项目中异常是怎么处理的.一般我们都不会直接把后台异常信息返回给用户,用户是看不懂的.让用户看见一大串的错误代码,这是不合理的.因此我们需要对报错进行处理. 我们在开发的时候是使用 ...

大数据算法设计模式(1) - topN spark实现

大数据算法设计模式(1) - topN spark实现的更多相关文章

随机推荐

热门专题