MapReduce概述 Google MapReduce的克隆版本 优点:海量数据的离线处理,易开发,易运行 缺点:实时流式计算 Hadoop MapReduce是一个软件框架,用于轻松编写应用程序,以可靠,容错的方式在大型集群(数千个节点)的商用硬件上并行处理大量数据(多TB数据集) MapReduce编程模型 思想:分而治之 MapReduce作业通常将输入数据集拆分为独立的块,这些块由map任务以完全并行的方式处理.框架对map的输出进行排序,然后输入到reduce任务.通常,作业的输入和…