浅谈mapreduce程序部署

尽管我们在虚拟机client上能非常快通过shell命令，进行运行一些已经封装好实例程序，可是在应用中还是是自己敲代码，然后部署到server中去，以下，我通过程序进行浅谈一个程序的部署过程。

在启动Hadoop之后，然后把程序达成可运行的jar包，并把对应的第三方jar包包括进去。运行hadoop jar XXX. +驱动名称。

package com.mapred;

import java.io.IOException;

import java.io.PrintStream;

import java.util.StringTokenizer;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.Mapper;

import org.apache.hadoop.mapreduce.Mapper.Context;

import org.apache.hadoop.mapreduce.Reducer;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import org.apache.hadoop.util.GenericOptionsParser;

public class WordCount

{

  public static void main(String[] args)

    throws Exception

  {

    Configuration conf = new Configuration();

  /*  String[] otherArgs = new GenericOptionsParser(conf, args).getRemainingArgs();

    if (otherArgs.length != 2) {

      System.err.println("Usage: wordcount <in> <out>");

      System.exit(2);

    }*/

    Job job = new Job(conf, "word count");

    job.setJarByClass(WordCount.class);

    FileInputFormat.addInputPath(job, new Path("hdfs://ubuntu:9000/Input"));

    job.setMapperClass(TokenizerMapper.class);

    job.setCombinerClass(IntSumReducer.class);

    job.setReducerClass(IntSumReducer.class);

    job.setOutputKeyClass(Text.class);

    job.setOutputValueClass(IntWritable.class);

    job.setMapOutputKeyClass(Text.class);

	job.setMapOutputValueClass(IntWritable.class);

    FileOutputFormat.setOutputPath(job, new Path("hdfs://ubuntu:9000/output09"));

    job.waitForCompletion(true);

  }

  public static class IntSumReducer extends Reducer<Text, IntWritable, Text, IntWritable>

  {

    private IntWritable result;

    public IntSumReducer()

    {

      this.result = new IntWritable();

    }

    public void reduce(Text key, Iterable<IntWritable> values, Reducer<Text, IntWritable, Text, IntWritable>.Context context) throws IOException, InterruptedException

    {

      int sum = 0;

      for (IntWritable val : values) {

        sum += val.get();

      }

      this.result.set(sum);

      context.write(key, this.result);

    }

  }

  public static class TokenizerMapper extends Mapper<Object, Text, Text, IntWritable>

  {

    private static final IntWritable one = new IntWritable(1);

    private Text word;

    public TokenizerMapper()

    {

      this.word = new Text();

    }

    public void map(Object key, Text value, Mapper<Object, Text, Text, IntWritable>.Context context) throws IOException, InterruptedException {

      StringTokenizer itr = new StringTokenizer(value.toString());

      while (itr.hasMoreTokens()) {

        this.word.set(itr.nextToken());

        context.write(this.word, one);

      }

    }

  }

}

在运行的过程中要注意下面几个事项：

首先要注意的就是，文件在hdfs上的位置是否正确，记住仅仅须要指定目录名称就可以，里面有多少详细文件，Hadoop都一并给你处理，注意观察在运行过程中所出现的异常。

由于我在运行和调试过程中也出现非常多异常，我觉得这些异常是情况非常多的，希望有兴趣的同学和我一起交流，共同分析和研究它。

1：注意观察虚拟机终端中报的错误，依据错误进行对应改进，由于关联jar较多，所以当提示你少对应的某一个包时，你要注意引进过来。

2：这里我是部署到虚拟机中运行的，只是在网上看过非常多资料说，通过Eclipse也能够直接进行数据的处理，可是我没有调试成功，希望大家谁成功了，告知我一声。我感觉我是版本号和虚拟机可能没有绑定好。

3：用Java命令（Java -jar XXX.jar）也能够执行。并且在这样的情况下不须要安装和部署Hadoop环境。可是由于我的Java虚拟机在执行时，老是提示内存不足。没有成功，我还是在Hadoop环境和总成功的。大家能够尝试并交流着去做一下。这个东西，处理数据有点意思。

浅谈mapreduce程序部署的更多相关文章

[MapReduce_add_1] Windows 下开发 MapReduce 程序部署到集群
0. 说明 Windows 下开发 MapReduce 程序部署到集群 1. 前提在本地开发的时候保证 resource 中包含以下配置文件,从集群的配置文件中拷贝在 resource 中新建 ...
浅谈MapReduce工作机制
1.MapTask工作机制整个map阶段流程大体如上图所示.简单概述:input File通过getSplits被逻辑切分为多个split文件,通通过RecordReader(默认使用lineRec ...
Docker技术浅谈：私有化部署的优势以及在顶象内部的应用实践
顶象全景式业务安全风控体系基于新一代风控体系构建,并采用Docker技术进行私有云和公有云部署.本文主要和大家分享下Docker容器技术和顶象风控系统私有化部署的优势以及Docker容器技术在顶象内部 ...
浅谈 Python 程序和 C 程序的整合
源地址:http://www.ibm.com/developerworks/cn/linux/l-cn-pythonandc/ 概览 Python 是一种用于快速开发软件的编程语言,它的语法比较简单, ...
浅谈iOS程序员的成长和进阶
html,body,div,span,applet,object,iframe,h1,h2,h3,h4,h5,h6,p,blockquote,pre,a,abbr,acronym,address,bi ...
分享大牛开发经验，浅谈java程序员职业规划
在中国有很多人都认为IT行为是吃青春饭的,如果过了30岁就很难有机会再发展下去!其实现实并不是这样子的,在下从事.NET及JAVA方面的开发的也有8年的时间了,在这...... 在中国有很多人都认为I ...
[Hadoop]浅谈MapReduce原理及执行流程
MapReduce MapReduce原理非常重要,hive与spark都是基于MR原理 MapReduce采用多进程,方便对每个任务资源控制和调配,但是进程消耗更多的启动时间,因此MR时效性不高.适 ...
浅谈Excel开发：十一针对64位Excel的插件的开发和部署
自Office 2010版本开始有了32位和64位之分,对Excel来说,32位的Excel和64位的Excel在性能上的主要区别是64位的Excel能够处理2G及2G以上的大数据集. 随着64位操作 ...
谁还没遇上过NoClassDefFoundError咋地——浅谈字节码生成与热部署
谁还没遇上过NoClassDefFoundError咋地--浅谈字节码生成与热部署前言在Java程序员的世界里,NoClassDefFoundError是一类相当令人厌恶的错误,因为这类错误通常非 ...

随机推荐

sencha touch笔记（6）——路由控制（1）
做项目的时候在界面的跳转上遇到了挺大的问题,本来跳转不想通过路由来控制的,没办法,只能再去看一下路由的跳转方式了. 应用程序的界面发生改变后,可以通过路由让应用程序的界面返回到改变之前的状态,例如浏览 ...
SED修改指定行
一个文件:cat aa #如果第三行是5的话将改为8,很明显第三行是5所以结果改变 [root@remote ~]# sed -e '3s/5/8/' aa [root@remote ~]# #如果 ...
使用VS+VisualGDB编译Linux版本RCF（相当于Linux也有COM版本了）
阅读目录通过向导配置项目配置目录结构修改项目配置添加RCF源代码完成配置并进行编译添加测试程序添加测试代码——通过TCP进行通信运行测试程序并查看测试结果 VisualGDB生成的所有 ...
VC2008如何生成及使用DLL(图文并茂，完整版)
博客分类: Dot net VC2008 DLL Dot net 生成.使用DLL看起来简单,但做起来才发现还是有一些地方需要注意的. 1. 打开VS2008,新建一个VC工程,选择Win32类型 ...
CString Format 乱码问题
CString m_buf;CStatic *m_static;char *szName;...m_buf.Format(":%s",szName);m_static->Se ...
设计模式 - 命令模式(command pattern) 宏命令(macro command) 具体解释
命令模式(command pattern) 宏命令(macro command) 具体解释本文地址: http://blog.csdn.net/caroline_wendy 參考: 命名模式(撤销) ...
HDU2571：命运(DP)
Problem Description 穿过幽谷意味着离大魔王lemon已经无限接近了! 可谁能想到,yifenfei在斩杀了一些虾兵蟹将后,却再次面临命运大迷宫的考验,这是魔王lemon设下的又一个 ...
Android 富文本框实现 RichEditText
Android系统自带控件没有富文本框控件,如果想写一封带格式的邮件基本上不可能,EdtiText只有默认一种格式,显示不能滿足要求,!!正好项目需要研究了一下,开发了此控件,现将一些源代码开放一下, ...
Android_Service组件详解
1.Service概述 Service服务是一个没有用户界面的在后台运行执行操作的应用组件,其它组件可以通过Intent意图启动这个Service去完成特定的功能,比如通过Service可以完成播放音 ...
BZOJ 1264: [AHOI2006]基因匹配Match( LCS )
序列最大长度2w * 5 = 10w, O(n²)的LCS会T.. LCS 只有当a[i] == b[j]时, 才能更新答案, 我们可以记录n个数在第一个序列中出现的5个位置, 然后从左往右扫第二个序 ...

浅谈mapreduce程序部署

浅谈mapreduce程序部署的更多相关文章

随机推荐

热门专题