HDFS-文件读取API

package com.zhen.hdfs;

import java.io.IOException;

import java.io.InputStream;

import java.net.URI;

import java.net.URISyntaxException;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FSDataInputStream;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IOUtils;

/**

 * @author FengZhen

 * @date 2018年8月12日

 *

 */

public class FileSystemReadAPI {

	/**

	 * FileSystem实例有几个静态工厂方法

	 * public static FileSystem get(Configuration conf) throws IOException

	 * 	return get(getDefaultUri(conf), conf);

	 * 	返回的是默认文件系统(在 conf/core-site.xml中指定的，如果没有指定，则使用默认的本地文件系统)

	 * public static FileSystem get(URI uri, Configuration conf) throws IOException

	 * 	通过给定的URI方案和权限来确定要使用的文件系统，如果给定URI中没有指定方案，则返回默认文件系统

	 * public static FileSystem get(final URI uri, final Configuration conf, final String user) throws IOException, InterruptedException

	 * 	作为给定用户来访问文件系统，对安全来说是至关重要的

	 *

	 * 在某些情况下，可能希望获取本地文件系统的运行实例，此时可以使用getLocal()方法

	 */

	public static void main(String[] args) {

		String uri = "hdfs://fz/user/hdfs/MapReduce/data/test.txt";

		String uri1 = "hdfs://fz/user/hdfs/MapReduce/data/test1.txt";

		String user = "hadoop";

		//getByUri(uri);

		//getByUriAndUser(uri, user);

		seekDoubleCat(uri1);

	}

	public static void getByUri(String uri) {

		Configuration conf = new Configuration();

		InputStream inputStream = null;

		try {

			FileSystem fileSystem = FileSystem.get(new URI(uri), conf);

			inputStream = fileSystem.open(new Path(uri));

			IOUtils.copyBytes(inputStream, System.out, 4096, false);

		} catch (IOException e) {

			e.printStackTrace();

		} catch (URISyntaxException e) {

			e.printStackTrace();

		} finally {

			IOUtils.closeStream(inputStream);

		}

	}

	public static void getByUriAndUser(String uri, String user) {

		Configuration conf = new Configuration();

		InputStream inputStream = null;

		try {

			FileSystem fileSystem = FileSystem.get(new URI(uri), conf, user);

			inputStream = fileSystem.open(new Path(uri));

			IOUtils.copyBytes(inputStream, System.out, 4096, false);

		} catch (IOException e) {

			e.printStackTrace();

		} catch (URISyntaxException e) {

			e.printStackTrace();

		} catch (InterruptedException e) {

			e.printStackTrace();

		} finally {

			IOUtils.closeStream(inputStream);

		}

	}

	/**

	 * 实际上，FileSystem对象中的open方法返回的是FSDataInputStream对象，而不是标准的java.io类对象。这个类是继承了java.io.DataInputStream接口的一个特殊类，并支持随机访问，由此可以从流的任意位置读取数据

	 * public class FSDataInputStream extends DataInputStream

    	implements Seekable, PositionedReadable,

      	ByteBufferReadable, HasFileDescriptor, CanSetDropBehind, CanSetReadahead,

      	HasEnhancedByteBufferAccess {}

	 */

	/**

	 * Seekable接口支持在文件中找到指定位置，并提供一个查询当前位置相对于文件其实位置偏移量(getPos())的查询方法

	 * public interface Seekable {

		  void seek(long pos) throws IOException;

		  long getPos() throws IOException;

		  @InterfaceAudience.Private

		  boolean seekToNewSource(long targetPos) throws IOException;

		}

		调用seek方法来定位大于文件长度的位置会引发IOException异常。与java.io.InputStream的skip不同，seek可以移动到文件中任意一个绝对位置，skip则只能相对于当前位置定位到另一个新位置。、

		注意，seek方法是一个相对高开销的操作，需要慎重使用

	 */

	public static void seekDoubleCat(String uri) {

		Configuration conf = new Configuration();

		FSDataInputStream inputStream = null;

		try {

			FileSystem fileSystem = FileSystem.get(new URI(uri), conf);

			inputStream = fileSystem.open(new Path(uri));

			IOUtils.copyBytes(inputStream, System.out, 4096, false);

			System.out.println("-------------------end-----------------");

			inputStream.seek(1);//索引

			IOUtils.copyBytes(inputStream, System.out, 4096, false);

		} catch (IOException e) {

			e.printStackTrace();

		} catch (URISyntaxException e) {

			e.printStackTrace();

		} finally {

			IOUtils.closeStream(inputStream);

		}

	}

}

HDFS-文件读取API的更多相关文章

HDFS文件读取详解
客户端与HDFS文件读取创建HDFS文件系统实例 FileSystem fs = FileSystem.get(new URI("hdfs://ns1"), new Config ...
FileReader文件读取API
:用来把文件读入内存,并且读取文件中的数据.FileReader接口提供了一个异步API,使用该API可以在浏览器主线程中异步访问文件系统,读取文件中的数据. 1.FileReader接口的方法 Fi ...
HDFS 文件读写过程
HDFS 文件读写过程 HDFS 文件读取剖析客户端通过调用FileSystem对象的open()来读取希望打开的文件.对于HDFS来说,这个对象是分布式文件系统的一个实例. Distributed ...
关于php文件读取的一些学习记录
初学PHP的时候使用了一些文件读取API,但是没有真正弄清楚各API的区别以及差异,于是找了一篇学习了一下,贴在这里,引用自IBM社区的一篇文章, 整体整理测试如下 <?php /** * Cr ...
Hadoop基础-HDFS的读取与写入过程
Hadoop基础-HDFS的读取与写入过程作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 为了了解客户端及与之交互的HDFS,NameNode和DataNode之间的数据流是什么样 ...
深度学习_1_Tensorflow_2_数据_文件读取
tensorflow 数据读取队列和线程文件读取, 图片处理问题:大文件读取,读取速度, 在tensorflow中真正的多线程子线程读取数据向队列放数据(如每次100个),主线程学习,不用全 ...
读取hdfs文件之后repartition 避免数据倾斜
场景一: api: textFile("hfds://....").map((key,value)).reduceByKey(...).map(实际的业务计算逻辑) 场景:hdf ...
Spark读取HDFS文件，文件格式为GB2312，转换为UTF-8
package iie.udps.example.operator.spark; import scala.Tuple2; import org.apache.hadoop.conf.Configur ...
【HDFS API编程】查看HDFS文件内容、创建文件并写入内容、更改文件名
首先,重点重复重复再重复: /** * 使用Java API操作HDFS文件系统 * 关键点: * 1)创建 Configuration * 2)获取 FileSystem * 3)...剩下的就是 ...
【HDFS API编程】从本地拷贝文件，从本地拷贝大文件，拷贝HDFS文件到本地
接着之前继续API操作的学习 CopyFromLocalFile: 顾名思义,从本地文件拷贝 /** * 使用Java API操作HDFS文件系统 * 关键点: * 1)create Configur ...

随机推荐

【spring boot logback】spring boot中logback日志乱码问题
在初次使用logback的自定义配置文件完整的控制spring boot日志后,发现了一个无法忍受的问题,就是日志乱码. 控制台看到打印日志乱码如下: 而日志文件打开: 记事本打开 sublime打开 ...
python学习【第八篇】python模块
模块与包模块的概念在python中一个.py文件就是一个模块. 使用模块可以提高代码的可维护性. 模块分为三种: python标准库第三方模块自定义模块模块的导入方法 1.import语句 ...
CSS:text-decoration参数说明
CSS:text-decoration(下划线参数) underline:下划线效果:下划线 overline:上划线效果:上划线 line-through:贯穿线效果:贯穿线 blink:闪烁 ...
Python 新手常犯错误
Python 新手常犯错误(第二部分) 转发自:http://blog.jobbole.com/43826/ 作用域在这篇文章里,我们来关注作用域在Python被误用的地方.通常,当我们定义了一个全 ...
我的Android进阶之旅------>（全解析）屏幕尺寸，分辨率，像素，PPI之间到底什么关系？
作者:马忠信,作者授权早读课发表,转载请联系作者. 原文链接:http://www.jianshu.com/p/c3387bcc4f6e# 互联网早读课:http://zaodula.com/arc ...
attention机制七搞八搞
注意力机制即Attention mechanism在序列学习任务上具有巨大的提升作用,在编解码器框架内,通过在编码段加入A模型,对源数据序列进行数据加权变换,或者在解码端引入A模型,对目标数据进行加权 ...
稀疏表示（Sparse Representations）
1.什么是稀疏表示: 用较少的基本信号的线性组合来表达大部分或者全部的原始信号. 其中,这些基本信号被称作原子,是从过完备字典中选出来的:而过完备字典则是由个数超过信号维数的原子聚集而来的.可见,任一 ...
C#对Excel中指定一列或一行实现隐藏或显示!
C#对Excel中指定一列或一行实现隐藏或显示!不会,求指导!
dataTables的用法
原地址:http://blog.csdn.net/mickey_miki/article/details/8240477 1.DataTables的默认配置 $(document).ready(fun ...
iOS 什么是函数式编程
前言:当前只做理解性的常规背书,根据不断深入学习会不断丰富解读内容,欢迎评论提意见函数式编程:Functional Programming 1 基本解释: 函数式编程是一种思维模式,一种编程思想, ...

HDFS-文件读取API

HDFS-文件读取API的更多相关文章

随机推荐

热门专题