Hadoop入门程序WordCount的执行过程

　　首先编写WordCount.java源文件，分别通过map和reduce方法统计文本中每个单词出现的次数，然后按照字母的顺序排列输出，

　　Map过程首先是多个map并行提取多个句子里面的单词然后分别列出来每个单词，出现次数为1，全部列举出来

　　Reduce过程首先将相同key的数据进行查找分组然后合并，比如对于key为Hello的数据分组为：<Hello, 1>、<Hello,1>、<Hello,1>，合并之后就是<Hello,1+1+1>，分组也可以理解为reduce的操作，合并减少数据时reduce的主要任务，叠加运算之后就是<Hello, 3>所以最后可以输出Hello 3，这样就完成了一轮MapReduce处理

　　WordCount.java代码如下：

 import java.io.IOException;

 import java.util.Iterator;

 import java.util.StringTokenizer;

 import org.apache.hadoop.fs.Path;

 import org.apache.hadoop.io.IntWritable;

 import org.apache.hadoop.io.LongWritable;

 import org.apache.hadoop.io.Text;

 import org.apache.hadoop.mapred.FileInputFormat;

 import org.apache.hadoop.mapred.FileOutputFormat;

 import org.apache.hadoop.mapred.JobClient;

 import org.apache.hadoop.mapred.JobConf;

 import org.apache.hadoop.mapred.MapReduceBase;

 import org.apache.hadoop.mapred.Mapper;

 import org.apache.hadoop.mapred.OutputCollector;

 import org.apache.hadoop.mapred.Reducer;

 import org.apache.hadoop.mapred.Reporter;

 import org.apache.hadoop.mapred.TextInputFormat;

 import org.apache.hadoop.mapred.TextOutputFormat;

 public class WordCount {

     public static class Map extends MapReduceBase implements

             Mapper<LongWritable, Text, Text, IntWritable> {

         private final static IntWritable one = new IntWritable(1);

         private Text word = new Text();

         public void map(LongWritable key, Text value,

                 OutputCollector<Text, IntWritable> output, Reporter reporter)

                 throws IOException {

             String line = value.toString();

             StringTokenizer tokenizer = new StringTokenizer(line);

             while (tokenizer.hasMoreTokens()) {

                 word.set(tokenizer.nextToken());

                 output.collect(word, one);

             }

         }

     }

     public static class Reduce extends MapReduceBase implements

             Reducer<Text, IntWritable, Text, IntWritable> {

         public void reduce(Text key, Iterator<IntWritable> values,

                 OutputCollector<Text, IntWritable> output, Reporter reporter)

                 throws IOException {

             int sum = 0;

             while (values.hasNext()) {

                 sum += values.next().get();

             }

             output.collect(key, new IntWritable(sum));

         }

     }

     public static void main(String[] args) throws Exception {

         JobConf conf = new JobConf(WordCount.class);

         conf.setJobName("wordcount");

         conf.setOutputKeyClass(Text.class);

         conf.setOutputValueClass(IntWritable.class);

         conf.setMapperClass(Map.class);

         conf.setCombinerClass(Reduce.class);

         conf.setReducerClass(Reduce.class);

         conf.setInputFormat(TextInputFormat.class);

         conf.setOutputFormat(TextOutputFormat.class);

         FileInputFormat.setInputPaths(conf, new Path(args[0]));

         FileOutputFormat.setOutputPath(conf, new Path(args[1]));

         JobClient.runJob(conf);

     }

 }

　　将此java文件上传到服务器后，首先要进行编译，如果是eclipse会自动完成，如果没有配置开发环境需要手动对源文件进行编译，命令如下：

javac -classpath /hadoop/hadoop-1.2./hadoop-core-1.2..jar:/hadoop/hadoop-1.2./lib/commons-cli-1.2.jar WordCount.java

　　编译的时候需要制定上面两个jar包，编译完成之后除了生成WordCount.class字节码之外还有WordCount$Map.class和WordCount$Reduce.class，我们知道这两个文件是内部类Map和Reduce生成的

　　然后开始对class文件打包生成wordcount.jar

jar -cvf wordcount.jar *.class

　　现在就打包生成了wordcount.jar文件

　　接下来可以通过传给main方法参数执行参数是两个字符串，分别为args[0]和args[1]，可以把它放到文件中进行输入，那么可以在hdfs文件系统中建立两个文件file01和file02并写入内容，依次执行命令：

$ echo "Hello World Hello Java" > file01

$ echo "Hello World Hello Hadoop" > file02

$ hadoop fs -mkdir input

$ hadoop fs -put file0* input/

　　现在hdfs文件系统中/user/用户名/input下就有两个文件file01和file02，同样我们可以用命令查看文件的存在性和内容

　　接下来就可以提交任务用hadoop来运行jar包中的函数进行数据处理了

hadoop jar wordcount.jar WordCount input output

　　WordCount代码jar包里的主类，input是传入的文件作为参数，output参数就是hadoop作业完毕之后结果存放目录，开始执行会看到map和reduce的处理进度

　　处理完毕后，通过hadoop fs -ls output/ 查看生成的结果文件是否存在

　　通过结果可以看到任务执行正常并输出了结果文件，可以用hadoop fs -get output localdata将文件传到本地查看，也可以执行下面命令查看文件的内容

hadoop fs -cat output/part-

　　可以看到结果按顺序统计出来了，到这里一个简单的WordCount程序就手动开发成功了

Hadoop入门程序WordCount的执行过程的更多相关文章

Hadoop入门经典:WordCount
转:http://blog.csdn.net/jediael_lu/article/details/38705371 以下程序在hadoop1.2.1上测试成功. 本例先将源代码呈现,然后详细说明执行 ...
(转载)Hadoop示例程序WordCount详解
最近在学习云计算,研究Haddop框架,费了一整天时间将Hadoop在Linux下完全运行起来,看到官方的map-reduce的demo程序WordCount,仔细研究了一下,算做入门了. 其实Wor ...
Hadoop入门经典:WordCount 分类： A1_HADOOP 2014-08-20 14:43 2514人阅读评论(0) 收藏
以下程序在hadoop1.2.1上测试成功. 本例先将源代码呈现,然后详细说明执行步骤,最后对源代码及执行过程进行分析. 一.源代码 package org.jediael.hadoopdemo.wo ...
第02讲：Flink 入门程序 WordCount 和 SQL 实现
我们右键运行时相当于在本地启动了一个单机版本.生产中都是集群环境,并且是高可用的,生产上提交任务需要用到flink run 命令,指定必要的参数. 本课时我们主要介绍 Flink 的入门程序以及 SQ ...
Hadoop示例程序WordCount详解及实例（转）
1.图解MapReduce 2.简历过程: Input: Hello World Bye World Hello Hadoop Bye Hadoop Bye Hadoop Hello Hadoop M ...
Hadoop示例程序WordCount编译运行
首先确保Hadoop已正确安装及运行. 将WordCount.java拷贝出来 $ cp ./src/examples/org/apache/hadoop/examples/WordCount.jav ...
MFC程序开始的执行过程详述
1)我们知道在WIN32API程序当中,程序的入口为WinMain函数,在这个函数当中我们完成注册窗口类,创建窗口,进入消息循环,最后由操作系统根据发送到程序窗口的消息调用程序的窗口函数.而在MFC程 ...
Hadoop入门实例——WordCount统计单词
首先要说明的是运行Hadoop需要jdk1.6或以上版本,如果你还没有搭建好Hadoop集群,请参考我的另一篇文章: Linux环境搭建Hadoop伪分布模式马上进入正题. 1.启动Hadoop集群 ...
2、flink入门程序Wordcount和sql实现
一.DataStream Wordcount 代码地址:https://gitee.com/nltxwz_xxd/abc_bigdata 基于scala实现 maven依赖如下: <depend ...

随机推荐

Mysql-函数coalesce-查询为空设置默认值
coalesce(字段,默认值) select coalesce(title,'liu') from a
SQL Server之存储过程基础知识
什么是存储过程呢?存储过程就是作为可执行对象存放在数据库中的一个或多个SQL命令. 通俗来讲:存储过程其实就是能完成一定操作的一组SQL语句. 那为什么要用存储过程呢?1.存储过程只在创造时进行编译, ...
【HDU 2577】How to Type
题意 (我做了这题才知道caps lock 锁定大小写后,按一下shift键可以输入相反的大小写.) 这题就是给你只有大小写字母的字符串,求最少多少次按键盘.最后caps lock 必须是关闭的. 分 ...
德州扑克AI WEB版
继续之前的德州扑克话题,上次的DOS界面确实没法看,我女朋友说这是什么鬼.哈哈,估计只有自己能玩了这两天重构了一下界面,基于web服务器和浏览器来交互. 服务器和客户端之间用websocket通信, ...
NOI题库-小学奥赛QwQ
今天Loli教育我们让我们来看看NOI题库的奥赛部分,不过,为何是小学的( ⊙ o ⊙ )啊!感觉智商被各种侮辱. 余数相同问题: 描述已知三个正整数 a,b,c. 现有一个大于1的整数x,将其作为 ...
Servlet------(声明式)异常处理
Test.java 其他方法不变,重写 protected void service()方法 public void init(ServletConfig config) throws Servlet ...
安装coreseek找不到mysql
1.安装 coreseek-3.2.14 遇到问题:“ERROR: cannot find MySQL include files,随即在网上搜索各种答案说是要找到mysql.h的正确路径加入./co ...
css3应用之自定义选中文字的背景颜色
在看很多的博客主题时候发现大多数都对选中文字的背景颜色做了相应的处理.其实这样是很符合用户体验的.因为有很多的人会用鼠标选择着一行一行的阅读.其中就包括本人... 浏览器中默认的选中的文字颜色为白色, ...
MSF溢出实战教程
1. 进入终端,开启MSF相关服务 2. 连接数据库 3. 主机扫描发现如果有MS08_067漏洞,就可以继续渗透 4. 开始溢出溢出成功的话 sessions -l 查看 ...
SQL Server 2005导入Excel表问题
EXCEL导入到SQL Server经常出现“文本被截断,或者一个或多个字符在目标代码页中没有匹配项” 原因: SQL Server的导入导出为了确定数据表的字段类型,取excel文件的前8行来判别. ...

Hadoop入门程序WordCount的执行过程

Hadoop入门程序WordCount的执行过程的更多相关文章

随机推荐

热门专题