Hadoop 统计文件中某个单词出现的次数

如文件word.txt内容如下：

what is you name?

my name is zhang san。

要求统计word.txt中出现“is”的次数？

代码如下：

PerWordMapper

package com.hadoop.wordcount;

import java.io.IOException;

import java.util.StringTokenizer;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Mapper;

public class PerWordMapper extends Mapper<Object, Text, Text, IntWritable> {

	public Text keyText = new Text();

	public IntWritable intValue = new IntWritable(1);

	@Override

	protected void map(Object key, Text value,

			Context context)

			throws IOException, InterruptedException {

		String str = value.toString();

		StringTokenizer to = new StringTokenizer(str);

		while (to.hasMoreTokens()) {

			String t = to.nextToken();

			//此处为判断统计字符串的地方

			if(t.equals("is")){

				keyText = new Text(t);

				context.write(keyText, intValue);

			}

	     }

	}

}

PerWordReducer

package com.hadoop.wordcount;

import java.io.IOException;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Reducer;

public class PerWordReducer extends Reducer<Text, IntWritable, Text, IntWritable> {

	public IntWritable intValue = new IntWritable(0);

	@Override

	protected void reduce(Text key, Iterable<IntWritable> value,

			Context context)

			throws IOException, InterruptedException {

		int sum = 0;

		while(value.iterator().hasNext()){

			sum += value.iterator().next().get();

		}

		intValue.set(sum);

		context.write(key, intValue);

	}

}

PerWordCount

package com.hadoop.wordcount;

import java.io.IOException;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import org.apache.hadoop.util.GenericOptionsParser;

import com.hadoop.mapreducer.MapperClass;

import com.hadoop.mapreducer.ReducerClass;

import com.hadoop.mapreducer.WordCount;

public class PerWordCount {

	public static void main(String[] args) throws IOException, InterruptedException, ClassNotFoundException {

		Configuration conf = new Configuration();

	    String[] otherArgs = new GenericOptionsParser(conf, args).getRemainingArgs();

	    System.out.println("otherArgs.length:"+otherArgs.length);

	    if (otherArgs.length != 2) {

	      System.err.println("Usage: wordcount <in> <out>");

	      System.exit(2);

	    }

	    Job job = new Job(conf, "word count");

	    job.setJarByClass(PerWordCount.class);

	    job.setMapperClass(PerWordMapper.class);

	    job.setCombinerClass(PerWordReducer.class);

	    job.setReducerClass(PerWordReducer.class);

	    job.setOutputKeyClass(Text.class);

	    job.setOutputValueClass(IntWritable.class);

	    FileInputFormat.addInputPath(job, new Path(otherArgs[0]));

	    FileOutputFormat.setOutputPath(job, new Path(otherArgs[1]));

	    System.exit(job.waitForCompletion(true) ? 0 : 1);

	}

}

Hadoop 统计文件中某个单词出现的次数的更多相关文章

python统计文本中每个单词出现的次数
.python统计文本中每个单词出现的次数: #coding=utf-8 __author__ = 'zcg' import collections import os with open('abc. ...
Java笔记13：统计文件中每个字符出现的次数
一.代码实现 import java.io.*; import java.util.*; /** 功能:统计文件中每个字符出现的次数思路: 1.定义字符读取(缓冲)流 2.循环读取文件里的字符,用一 ...
Scala快速统计文件中特定单词，字符的个数
val fileContent=Source.fromFile("/home/soyo/桌面/ss5.txt").getLines.mkString(",") ...
linux命令统计文件中某个字符串出现的次数
1.使用grep linux grep命令在我的随笔linux分类里有过简单的介绍,这里就只简单的介绍下使用grep命令统计某个文件这某个字符串出现的次数,首先介绍grep命令的几个参数,详细参数请自 ...
Java 中统计文件中出现单词的次数练习
统计英文article.txt文件中出现hello这个单词的次数这个是article.txt文件内容 { hello The Royal Navy is trying hello to play h ...
【面试题总结】1、统计字符串中某个单词出现的次数(1-C++实现)
[解决方法一]C++ map解决一.map中的find函数: 用于查找map中是否包含某个关键字条目,传入的参数是要查找的key,最后返回一个迭代器,如果没有找到,则返回的迭代器等于end()返回的 ...
linux中统计文件中一个字符串出现的次数
要统计一个字符串出现的次数,这里现提供自己常用两种方法: 1. 使用vim统计用vim打开目标文件,在命令模式下,输入 :%s/objStr//gn 2. 使用grep: grep -o objSt ...
软件工程-构建之法 WordCount小程序统计文件中字符串个数，单词个数，词频，行数
一.前言在之前写过一个词频统计的C语言课设,别人说你一个大三的怎么写C语言课程,我只想说我是先学习VB,VB是我编程语言的开始,然后接触到C语言及C++:再后来我是学习C++,然后反过来学习C语言, ...
sort +awk+uniq 统计文件中出现次数最多的前10个单词
实例cat logt.log|sort -s -t '-' -k1n |awk '{print $1;}'|uniq -c|sort -k1nr|head -100 统计文件中出现次数最多的前10个单 ...

随机推荐

经验总结35--IP地址区域匹配
想知道客服端訪问的IP地址是多少,并知道区域. 一般能够去http://www.ip138.com/,输入IP查询,但没提供比較好的接口,程序使用不方便. 另外有些企业提供一些离线的IP数据库,能够进 ...
HTML5新增核心工具——canvas
原文:HTML5新增核心工具--canvas Canvas元素称得上是HTML5的核心所在,它是一个依靠JavaScript绘制华丽图像的元素. Canvas由一个可绘制地区HTML代码中的属性定义决 ...
asp.net读取CSV
原文:asp.net读取CSV 用Excel导了两天数据,各种问题,折磨客户也折磨了自己,以前没发现的问题一下子都暴露出来了特意收集两篇Excel跟CSV读取相关的两篇文章 asp.net读取exc ...
SQL Server 2012的附件失败，与硬链接的问题
1.我在系统上做了硬链接,也就是把C盘的某个目录,映射为D盘. 2.把数据库文件mdf和ldf放入D盘.结果,SQL Server的企业管理器,无法从D盘里加载mdf或ldf文件,并且在目录下无法显示 ...
ubuntu安装nVidia驱动，遇到终端闪砾问题并解决
安装nvidia的官方驱动之后,比起nouvean来说感觉速度快了不少. 安装该驱动很简单,但选择哪个驱动是要注意的.因为今天我试了nvidia的多个驱动后都在ubuntu下用起来并不好. 我现在的环 ...
leetcode 第42题 Multiply Strings
题目:Given two numbers represented as strings, return multiplication of the numbers as a string. Note: ...
使用Windows2003创建FTP服务器 - 进阶者系列 - 学习者系列文章
现在有不少的FTP建设软件,比如Server-U软件.不过本文只介绍使用Windows2003来创建FTP服务器. 1. 打开控制面板的添加删除程序. 2. 打开添加删除Windows组件 3. ...
给Angularjs配上Requirejs
给Angularjs配上Requirejs 需要考虑的事情: 1.js.css.template都按需加载,js主要就controller: * js和css都可以用requirejs和它的插件解决, ...
在线试听功能(前端直接略过吧，适合javaEE后台开发的)
应用场景:录音试听,MP3试听... 比如为客户提供录音功能时.客户希望录音完成试听录音,然后下载等功能.直接上代码:关键是取得录音的在服务器的地址,如:url='http://localhost:8 ...
Visual Studio 2013 IIS Explorer 停止调试继续访问站点
升级到2013后,在做调试的时候默认调试服务器是 IIS Explorer,当终止调试的时候再次访问调试站点时已经无法访问了.此时想预览一下感觉很不方便. 为了能够预览可以参考一下配置: Tools ...

Hadoop 统计文件中某个单词出现的次数

Hadoop 统计文件中某个单词出现的次数的更多相关文章

随机推荐

热门专题