Hadoop: the definitive guide 第三版拾遗第四章

第四章中提到了通过CompressionCodec对streams进行压缩和解压缩，并提供了示例程序：

输入：标准输入流

输出：压缩后的标准输出流

// cc StreamCompressor A program to compress data read from standard input and write it to standard output

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.io.IOUtils;

import org.apache.hadoop.io.compress.CompressionCodec;

import org.apache.hadoop.io.compress.CompressionOutputStream;

import org.apache.hadoop.util.ReflectionUtils;

// vv StreamCompressor

public class StreamCompressor {

  public static void main(String[] args) throws Exception {

    String codecClassname = args[0];

    Class<?> codecClass = Class.forName(codecClassname);

    Configuration conf = new Configuration();

    CompressionCodec codec = (CompressionCodec)

      ReflectionUtils.newInstance(codecClass, conf);

    CompressionOutputStream out = codec.createOutputStream(System.out);

    IOUtils.copyBytes(System.in, out, 4096, false);

    out.finish();

  }

}

// ^^ StreamCompressor

该实例程序通过CompressionCodec的createOutputStream(OutputStream out)方法获得CompressionOutputStream对象。

第12行因参数固定,可以直接写成String codecClassname="org.apache.hadoop.io.compress.GzipCodec";

即从命令行接受一个CompressionCodec实现类的参数，然后通过ReflectionUtils把实例化这个类，调用CompressionCodec的接口方法对标准输出流进行封装，封装成一个压缩流，通过IOUtils类的copyBytes方法把标准输入流拷贝到压缩流中，最后调用CompressionCodec的finish方法，完成压缩。

在hadoop集群的hadoop根目录下使用如下命令验证该程序（通过linux的gunzip完成解压缩）：

echo "Hello world" | hadoop jar xxxx.jar com.tht.hadoopIO.StreamCompressor org.apache.hadoop.io.compress.GzipCodec | gunzip -

下面对改程序做进一步修改：

一、更改输出路径：即标准输入流压缩后的存放位置。

输入：标准输入流

输出：压缩后的文件存放到HDFS上

示例代码如下：

package com.tht.hadoopIO;

import java.net.URI;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IOUtils;

import org.apache.hadoop.io.compress.CompressionCodec;

import org.apache.hadoop.io.compress.CompressionOutputStream;

import org.apache.hadoop.util.ReflectionUtils;

//vv StreamCompressor

public class StreamCompressor {

	public static void main(String[] args) throws Exception {

		String codecClassname = "org.apache.hadoop.io.compress.GzipCodec";

		String outputUri = "hdfs://master:9000/in/test.gz";

		Class<?> codecClass = Class.forName(codecClassname);

		Configuration conf = new Configuration();

		FileSystem fs = FileSystem.get(URI.create(outputUri), conf);

		CompressionCodec codec = (CompressionCodec) ReflectionUtils

				.newInstance(codecClass, conf);

		CompressionOutputStream out = codec.createOutputStream(fs.create(new Path(outputUri)));

		IOUtils.copyBytes(System.in, out, 4096, false);

		out.finish();

	}

}

// ^^ StreamCompressor

当然，在此路径outputUri：,,,/test.gz是指压缩后的文件存放位置和文件名及扩展名，如果改为...../test.txt.gz则指以.txt格式的压缩文件，后缀名是gz。

二、更改输入文件，即将输入文件路径定为HDFS上的文件。

输入：HDFS上存放文件

输出：压缩后的文件存放至HDFS上

示例代码如下：

import java.io.InputStream;

import java.net.URI;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IOUtils;

import org.apache.hadoop.io.compress.CompressionCodec;

import org.apache.hadoop.io.compress.CompressionOutputStream;

import org.apache.hadoop.util.ReflectionUtils;

//vv StreamCompressor

public class StreamCompressor {

	public static void main(String[] args) throws Exception {

		String codecClassname = "org.apache.hadoop.io.compress.GzipCodec";

		String uri = "hdfs://master:9000/in/test.txt";

		String outputUri = "hdfs://master:9000/in/test.txt.gz";

		Class<?> codecClass = Class.forName(codecClassname);

		Configuration conf = new Configuration();

		FileSystem fs1 = FileSystem.get(URI.create(uri), conf);

		FileSystem fs2 = FileSystem.get(URI.create(outputUri), conf);

		CompressionCodec codec = (CompressionCodec) ReflectionUtils

				.newInstance(codecClass, conf);

		InputStream in =fs1.open(new Path(uri));

		CompressionOutputStream out = codec.createOutputStream(fs2.create(new Path(outputUri)));

		IOUtils.copyBytes(in, out, 4096, false);

		in.close();

		out.close();

	}

}

// ^^ StreamCompressor

当然了，输入输出都可以以参数形式存在。即String uri = arg[0];String outputUri =arg[1];则在执行时须加入两个路径参数。

Hadoop: the definitive guide 第三版拾遗第四章的更多相关文章

Hadoop: the definitive guide 第三版拾遗第十三章之HBase起步
指南上这一章的开篇即提出:HBase是一个分布式的.面向列的开源数据库.如果需要实时的随机读/写超大规模数据集,HBase无疑是一个好的选择. 简介 HBase 是一个高可靠性.高性能.面向列.可伸缩 ...
Hadoop: the definitive guide 第三版拾遗第十二章之Hive初步
Hive简介 Hive是建立在 Hadoop 上的数据仓库基础构架.它提供了一系列的工具,可以用来进行数据提取转化加载(ETL),这是一种可以存储.查询和分析存储在 Hadoop 中的大规模数据的机制 ...
Hadoop: the definitive guide 第三版拾遗第十二章之Hive分区表、桶
Hive分区表在Hive Select查询中一般会扫描整个表内容,会消耗很多时间做没必要的工作.有时候只需要扫描表中关心的一部分数据,因此建表时引入了partition概念.分区表指的是在创建表时指 ...
Hadoop: the definitive guide 第三版拾遗第十章之Pig
概述: Pig的安装很简单,注意一下几点: 1.设置系统环境变量: export PIG_HOME=.../pig-x.y.z export PATH=$PATH:$PIG_HOME/bin 设置完成 ...
JavaScript高级程序设计（第三版）第四章变量，作用域和内存问题
JavaScript变量可以用来保存两种类型的值:基本类型值和引用类型值.基本类型值和引用类型值具有以下特点: 基本类型值在内存中占据固定大小的空间,因此被保存在栈内存中: 从一个变量向另一个变量复制 ...
Hadoop – The Definitive Guide Examples,,IntelliJ
IntelliJ Project for Building Hadoop – The Definitive Guide Examples http://vichargrave.com/intellij ...
重读《学习JavaScript数据结构与算法-第三版》- 第5章队列
定场诗马瘦毛长蹄子肥,儿子偷爹不算贼,瞎大爷娶个瞎大奶奶,老两口过了多半辈,谁也没看见谁! 前言本章为重读<学习JavaScript数据结构与算法-第三版>的系列文章,主要讲述队列数据 ...
《利用Python进行数据分析·第2版》第四章 Numpy基础：数组和矢量计算
<利用Python进行数据分析·第2版>第四章 Numpy基础:数组和矢量计算 numpy高效处理大数组的数据原因: numpy是在一个连续的内存块中存储数据,独立于其他python内置对 ...
重读《学习JavaScript数据结构与算法-第三版》-第2章 ECMAScript与TypeScript概述
定场诗八月中秋白露,路上行人凄凉: 小桥流水桂花香,日夜千思万想. 心中不得宁静,清早览罢文章, 十年寒苦在书房,方显才高志广. 前言洛伊安妮·格罗纳女士所著的<学习JavaScript数据 ...

随机推荐

js实现避免浏览器拦截弹出新页面的方法
1 问题描述点击button按钮,提交页面的form表单,后台执行完毕后返回参数,前台页面需要该参数实现跳转,如何实现保留该原来的页面,并在浏览器选项卡新建一个页面,且不被浏览器拦截? 2 方法及问 ...
【API】注册表编程基础-RegCreateKeyEx、RegSetValueEx
1.环境: 操作系统:Windows 10 x64 编译器:VS2015 2.关键函数 LONG WINAPI RegCreateKeyEx( _In_ HKEY hKey, _In_ LPCTSTR ...
记录自己对EventLoop和性能问题处理的一点心得【转】
转自:http://www.cnblogs.com/lanyuliuyun/p/4483384.html 1.EventLoop 这里说的EventLoop不是指某一个具体的库或是框架,而是指一种程序 ...
【Linux高级驱动】input子系统框架【转】
转自:http://www.cnblogs.com/lcw/p/3802617.html [1.input子系统框架(drivers\input)] 如何得出某个驱动所遵循的框架? 1) 通过网 ...
Linux内核源码分析--内核启动之(6)Image内核启动(do_basic_setup函数)（Linux-3.0 ARMv7）【转】
原文地址:Linux内核源码分析--内核启动之(6)Image内核启动(do_basic_setup函数)(Linux-3.0 ARMv7) 作者:tekkamanninja 转自:http://bl ...
vs中如何统计整个项目的代码行数
在一个大工程中有很多的源文件和头文件,如何快速统计总行数? ------解决方案--------------------b*[^:b#/]+.*$^b*[^:b#/]+.*$ ctrl + shift ...
C/C++杂记：深入理解数据成员指针、函数成员指针
1. 数据成员指针对于普通指针变量来说,其值是它所指向的地址,0表示空指针. 而对于数据成员指针变量来说,其值是数据成员所在地址相对于对象起始地址的偏移值,空指针用-1表示.例: 代码示例: str ...
【AtCoder】ARC093
C - Traveling Plan 相当于一个环,每次删掉i点到两边的距离,加上新相邻的两个点的距离代码 #include <bits/stdc++.h> #define fi fir ...
Codeforces Round #380 Div.2 F - Financiers Game
F - Financiers Game 这种两人博弈一般都可以用两个dp写, 一个dp描述第一个人的最优态, 第二个dp描述第二个人的最优态,难点在于优化空间... 我感觉这个空间开得有点玄学.. d ...
Pandas常用命令
一.数据导入和导出 (一)读取csv文件 1.本地读取 import pandas as pd df = pd.read_csv('tips.csv') #根据自己数据文件保存的路径填写(p.s. p ...

Hadoop: the definitive guide 第三版 拾遗 第四章

Hadoop: the definitive guide 第三版 拾遗 第四章的更多相关文章

随机推荐

热门专题

Hadoop: the definitive guide 第三版拾遗第四章

Hadoop: the definitive guide 第三版拾遗第四章的更多相关文章