Storm实现单词计数

 package com.mengyao.storm;

 import java.io.File;

 import java.io.IOException;

 import java.util.Collection;

 import java.util.HashMap;

 import java.util.List;

 import java.util.Map;

 import java.util.Map.Entry;

 import org.apache.commons.io.FileUtils;

 import backtype.storm.Config;

 import backtype.storm.LocalCluster;

 import backtype.storm.StormSubmitter;

 import backtype.storm.generated.AlreadyAliveException;

 import backtype.storm.generated.InvalidTopologyException;

 import backtype.storm.spout.SpoutOutputCollector;

 import backtype.storm.task.OutputCollector;

 import backtype.storm.task.TopologyContext;

 import backtype.storm.topology.OutputFieldsDeclarer;

 import backtype.storm.topology.TopologyBuilder;

 import backtype.storm.topology.base.BaseRichBolt;

 import backtype.storm.topology.base.BaseRichSpout;

 import backtype.storm.tuple.Fields;

 import backtype.storm.tuple.Tuple;

 import backtype.storm.tuple.Values;

 import backtype.storm.utils.Utils;

 /**

  * Storm中的单词计数，拓扑结构为InputSpout->SplitBolt->CountBolt = WordCountTopology

  * @author mengyao

  *

  */

 @SuppressWarnings("all")

 public class WordCountTopology {

     public static class InputSpout extends BaseRichSpout{

         private Map conf;

         private TopologyContext context;

         private SpoutOutputCollector collector;

         /**

          * 实例化该Spout时预处理，仅会被调用一次，类似于MapReduce中Mapper/Reducer的setup()方法

          */

         @Override

         public void open(Map conf, TopologyContext context,

                 SpoutOutputCollector collector) {

             this.conf = conf;

             this.context = context;

             this.collector = collector;

         }

         /**

          * 死循环发射每行消息

          */

         @Override

         public void nextTuple() {

             Collection<File> listFiles = FileUtils.listFiles(new File("D:/"), new String[]{"log"}, false);

             for (File file : listFiles) {

                 try {

                     List<String> lines = FileUtils.readLines(file);

                     for (String line : lines) {

                         this.collector.emit(new Values(line));

                         System.err.println("==== InputSpout："+line+" ====");

                     }

                     FileUtils.moveFile(file, new File(file.getAbsoluteFile()+".tmp"));

                 } catch (IOException e) {

                     e.printStackTrace();

                     throw new RuntimeException(e);

                 }

             }

         }

         /**

          * 声明字段“line”提供给下一个Bolt组件订阅

          */

         @Override

         public void declareOutputFields(OutputFieldsDeclarer declarer) {

             declarer.declare(new Fields("line"));

         }

     }

     public static class SplitBolt extends BaseRichBolt{

         private Map stormConf;

         private TopologyContext context;

         private OutputCollector collector;

         /**

          * 实例化该Bolt时预处理，仅会被调用一次，类似于MapReduce中Mapper/Reducer的setup()方法

          */

         @Override

         public void prepare(Map stormConf, TopologyContext context,

                 OutputCollector collector) {

             this.stormConf = stormConf;

             this.context = context;

             this.collector = collector;

         }

         /**

          * 死循环发送每个单词

          */

         @Override

         public void execute(Tuple input) {

             String line = input.getStringByField("line");

             String[] words = line.split("\t");

             for (String word : words) {

                 this.collector.emit(new Values(word));

                 System.err.println("==== SplitBolt:"+word+" ====");

             }

         }

         /**

          * 声明字段“word”提供给下一个Bolt组件订阅

          */

         @Override

         public void declareOutputFields(OutputFieldsDeclarer declarer) {

             declarer.declare(new Fields("word"));

         }

     }

     public static class CountBolt extends BaseRichBolt{

         private Map stormConf;

         private TopologyContext context;

         private OutputCollector collector;

         HashMap<String, Long> map = new HashMap<String, Long>();

         /**

          * 实例化该Bolt时预处理，仅会被调用一次，类似于MapReduce中Mapper/Reducer的setup()方法

          */

         @Override

         public void prepare(Map stormConf, TopologyContext context,

                 OutputCollector collector) {

             this.stormConf = stormConf;

             this.context = context;

             this.collector = collector;

         }

         @Override

         public void execute(Tuple input) {

             String word = input.getStringByField("word");

             Long value = map.get(word);

             if (value==null) {

                 value=0L;

             }

             value++;

             map.put(word, value);

             for (Entry<String, Long> entry : map.entrySet()) {

                 System.err.println("==== CountBolt:"+entry+" ====");

             }

         }

         @Override

         public void declareOutputFields(OutputFieldsDeclarer declarer) {

         }

     }

     public static void main(String[] args) throws AlreadyAliveException, InvalidTopologyException {

         String topologyName = WordCountTopology.class.getSimpleName();

         TopologyBuilder builder = new TopologyBuilder();

         builder.setSpout("input", new InputSpout());

         builder.setBolt("split", new SplitBolt()).shuffleGrouping("input");

         builder.setBolt("count", new CountBolt()).shuffleGrouping("split");

         Config config = new Config();

         config.setDebug(true);

         if (args!=null && args.length>0) {        //如果是生产环境中使用集群模式提交拓扑

             config.setNumWorkers(3);

             StormSubmitter.submitTopology(topologyName, config, builder.createTopology());

         } else {                                　　　　  //否则使用本地模式提交拓扑

             LocalCluster cluster = new LocalCluster();

             cluster.submitTopology(topologyName, config, builder.createTopology());

             Utils.sleep(1000*100);

             cluster.killTopology(topologyName);

             cluster.shutdown();

         }

     }

 }

 依赖的jar包如下图：

Storm实现单词计数的更多相关文章

大数据学习——Storm学习单词计数案例
需求:计算单词在文档中出现的次数,每出现一次就累加一次遇到的问题这个问题是<scope>provided</scope>作用域问题 https://www.cnblogs. ...
storm（5）-分布式单词计数例子
例子需求: spout:向后端发送{"sentence":"my dog has fleas"}.一般要连数据源,此处简化写死了. 语句分割bolt(Split ...
【Storm】storm安装、配置、使用以及Storm单词计数程序的实例分析
前言:阅读笔记 storm和hadoop集群非常像.hadoop执行mr.storm执行topologies. mr和topologies最关键的不同点是:mr执行终于会结束,而topologies永 ...
Storm实现单词统计代码
import java.io.File; import java.io.IOException; import java.util.Collection; import java.util.HashM ...
使用Scala实现Java项目的单词计数：串行及Actor版本
其实我想找一门“具有Python的简洁写法和融合Java平台的优势, 同时又足够有挑战性和灵活性”的编程语言. Scala 就是一个不错的选择. Scala 有很多语言特性, 建议先掌握基础常用的: ...
MapReduce之单词计数
最近在看google那篇经典的MapReduce论文,中文版可以参考孟岩推荐的 mapreduce 中文版中文翻译论文中提到,MapReduce的编程模型就是: 计算利用一个输入key/value ...
自定义实现InputFormat、OutputFormat、输出到多个文件目录中去、hadoop1.x api写单词计数的例子、运行时接收命令行参数，代码例子
一:自定义实现InputFormat *数据源来自于内存 *1.InputFormat是用于处理各种数据源的,下面是实现InputFormat,数据源是来自于内存. *1.1 在程序的job.setI ...
hadoop笔记之MapReduce的应用案例(WordCount单词计数)
MapReduce的应用案例(WordCount单词计数) MapReduce的应用案例(WordCount单词计数) 1. WordCount单词计数作用: 计算文件中出现每个单词的频数输入结果 ...
第一章 flex单词计数程序
学习Flex&Bison目标, 读懂SQLite中SQL解析部分代码 Flex&Bison简介Flex做词法分析Bison做语法分析第一个Flex程序, wc.fl, 单词计数程序 ...

随机推荐

关于CSS选择器的效率问题
最近一段时间接触CSS比较多,所以从网上找了写资料,这里做下总结. 以下是CSS选择器的效率排名: id选择器(#myid) 类选择器(.myclassname) 标签选择器(div,h1,p) 相邻 ...
Chrome调试大全--转载
作为一名前端开发者,打交道最多的可能是和浏览器.市面上各种浏览器多不胜数,主流的有Chrome,Firefox,Safari,IE,Opera,非主流的如360,遨游,QQ浏览器,搜狗浏览器,据说淘宝 ...
黑信 socket即时通讯示例
整个过程首先开启服务器打开一个SDK大于4.4的手机---B 打开一个SDK小于4.4的手机---A 相互发送一条消息,对方就可以收到,当然这些消息都是通过服务器[转发]过来的 MainActiv ...
C#判断网站运行状态是否正常
我使用的是控制台应用程序来监控网站的运行状态,通过判断网站请求头(HEAD)来判断是否运行正常下面列出几种常见的网站状态码 StatusCode 数字表示 OK 200. OK 指示请求成功,且请求 ...
(转)asp.net中Literal与label的区别
asp.net中Literal与label的区别一.Literal Web 服务器控件概述(摘于MSDN) 可以使用 Literal Web 服务器控件作为页面上其他内容的容器.Literal 最常 ...
Windows服务器之间rsync同步文件
两台windows7机器 server:192.168.12.104 client:192.168.12.103 目的:将server上的E盘的目录FYFR里面的内容定时同步到client上的D盘下F ...
PKCS5Padding与PKCS7Padding的区别
工作中,我们常常会遇到跨语言平台的加密解密算法的交互使用,特别是一些标准的加解密算法,都设计到数据块Block与填充算法的问题,例如C#与JAVA中的常见的填充算法如下: .Net中的填充算法: 成员 ...
（五）Angularjs - 依赖注入
如何找到API? AngularJS提供了一些功能的封装,但是当你试图通过全局对象angular去访问这些功能时,却发现与以往遇到的库大不相同. 比如,AngularJS暴露了一个全局对象:angu ...
Oracle数据库简介
Oracle数据库简介一.介绍 Oracle数据库系统是美国Oracle(甲骨文)公司提供的以分布式数据库为核心的一组软件产品,是目前最流行的客户/服务器(Client/Server,C/S)或浏览 ...
Mysql中的DQL查询语句
----------------1.查询所有列 --查询学生表所有记录(行) select *from 学生 --带条件的查询 select *from 学生 where 年龄>19 --- ...

Storm实现单词计数

Storm实现单词计数的更多相关文章

随机推荐

热门专题