Hadoop点滴-Hadoop的IO

Hadoop自带一套原子操作用于数据的I/O操作。
如果系统中需要处理的数据量达到Hadoop的处理极限时，数据被损害的概率还是很高的
检测数据是否被损害的常见措施是，在数据第一次被引进系统时，计算校验和（checksum），并在数据通过一个不可靠的通道进行传输时，再次计算校验和。
校验和也是可能损坏的，但由于校验和比数据小得多，所以损坏的可能性非常小
HDFS会对写入的所有数据计算校验和，并在读取数据时验证校验和。
默认情况下为512个字节计算校验和，由于CRC-32校验和是4个字节，所以存储校验和的额外开销低于1%
datanode负责在收到数据后存储该数据及其校验和之前对数据进行验证，它在收到客户端的数据或复制其他datanode的数据时执行这个操作。
正在写数据的客户端将数据及其校验和发送到有一些列datanode组成的管线，管线中最后一个datanode负责验证校验和。如果datanode检测到错误，客户端便会厚道一个IOException异常的一个子类。
客户端读取datanode数据时，也会验证校验和。
每个datanode中均持久保存有一个用于验证校验和日志（persistent log of checksum verification)，所有他知道每个数据块的最后一次验证时间。保存这些统计信息对于检测损坏的磁盘很有价值
不只是客户端在读取数据块时，会验证校验和，每个datanode也会在一个后台线程中运行一个DataBlockScanner。该措施是解决物理存储媒体上损坏的有力措施。
由于HDFS存储着每个数据块的副本（replica），因此它可以通过副本来修复损害的数据块，进而得到一个新的、完好无损的副本。基本思路是：客户端读取数据块时，如果检测到错误，首先向namenode报告已损坏的数据块及其正在尝试读操作的这个datanode，在抛出ChecksumException。namenode将这个数据块副本标记为已损坏，这样它不再将客户端处理请求直接发送到这个节点，或者尝试将这个复本复制到另一个datanode，如此一来，数据块的副本以腻子（replication factor）又回到期望的水平。
如果在使用open（）方法读取文件之前，将false值传递给FileSystem对象的setVerfiChecksum()方法，即可禁用校验和验证
可以使用hadoop fs -checksum 来检查一个文件的校验和
校验和的计算代价是相当低的，java中使用的是本地代码实现的
压缩：有两大好处，减少存储文件所需要的磁盘空间，并加速数据在网络和磁盘上的传输。这两大好处在处理大量数据时相当重要。
序列化：用于分布式数据处理的两大领域：进程间通信和永久存储
Hadoop为什么不使用java自带的序列化功能，反而要单独实现一套呢。java自带序列化与编程语言紧密相关，且太负责。hadoop需要一套至精至简、可以精确控制对象读写。
Hadoop为什么不使用RMI，而要使用RPC呢：RPC更高效，且可以精确控制连接、延迟、缓冲。
基于文件的数据结构：SequenceFile、MapFile

Hadoop点滴-Hadoop的IO的更多相关文章

Hadoop点滴-Hadoop分布式文件系统
Hadoop自带HDFS,即 Hadoop Distributed FileSystem(不是HaDoop FileSystem 的简称) 适用范围超大文件:最新的容量达到PB级流式数据访问:H ...
org.apache.hadoop.ipc.RemoteException(java.io.IOException)
昨晚突然之间mr跑步起来了 jps查看进程都在的,但是在reduce任务跑了85%的时候会抛异常异常情况如下: 2016-09-21 21:32:28,538 INFO [org.apache.h ...
运行基准测试hadoop集群中的问题：org.apache.hadoop.ipc.RemoteException: java.io.IOException: File /benchmarks/TestDFSIO/io_data/test_
在master(即:host2)中执行 hadoop jar hadoop-test-1.1.2.jar DFSCIOTest -write -nrFiles 12 -fileSize 10240 - ...
hive运行query语句时提示错误：org.apache.hadoop.ipc.RemoteException: java.io.IOException: java.io.IOException:
hive> select product_id, track_time from trackinfo limit 5; Total MapReduce jobs = 1 Launching Jo ...
HBase中此类异常解决记录org.apache.hadoop.ipc.RemoteException(java.io.IOException):
ERROR: Can't get master address from ZooKeeper; znode data == null 一定注意这只是问题的第一层表象,真的问题是: File /hb ...
hadoop报错java.io.IOException: Bad connect ack with firstBadLink as 192.168.1.218:50010
[root@linuxmain hadoop]# bin/hadoop jar hdfs3.jar com.dragon.test.CopyToHDFS Java HotSpot(TM) Client ...
hadoop报错java.io.IOException: Incorrect configuration: namenode address dfs.namenode.servicerpc-address or dfs.namenode.rpc-address is not configured
不多说,直接上干货! 问题详情问题排查 spark@master:~/app/hadoop$ sbin/start-all.sh This script is Deprecated. Instead ...
Spark- ERROR Shell: Failed to locate the winutils binary in the hadoop binary path java.io.IOException: Could not locate executable null\bin\winutils.exe in the Hadoop binaries.
运行 mport org.apache.log4j.{Level, Logger} import org.apache.spark.rdd.RDD import org.apache.spark.{S ...
idea 提示：ERROR util.Shell: Failed to locate the winutils binary in the hadoop binary path java.io.IOException解决方法
Windows系统中的IDEA链接Linux里面的Hadoop的api时出现的问题提示:ERROR util.Shell: Failed to locate the winutils binary ...

随机推荐

Codeforces 1008C
题意略. 思路: 其实我们没有必要关注每个数字的位置,我们只要把大的数字放在小的数字上就可以了,这样它的位置必然会发生变换. 在变换时,这个替换的序列越长越好,每个序列对答案的贡献就是该序列的长度 - ...
NLP（十）主题识别
主题识别是发现输入文本集合中存在的主题的过程 LDA算法,即狄利克雷分布算法 from nltk.tokenize import RegexpTokenizer from nltk.corpus i ...
通过CMD命令窗口获取django版本号
通过CMD命令窗口获取django版本号方法一: C:\Users\Administrator>python >>> import django >>> d ...
Fiddler 手机爬虫
Fiddler抓包工具配置Fiddler 添加证书信任,Tools - Options - HTTPS,勾选 Decrypt Https Traffic 后弹出窗口,一路确认 ...from bro ...
前后端分离，获取token，验证登陆是否失效
maven依赖 <dependency> <groupId>com.auth0</groupId> <artifactId>java-jwt</a ...
Spring MVC 配置类 WebMvcConfigurerAdapter
WebMvcConfigurerAdapter配置类是spring提供的一种配置方式,采用JavaBean的方式替代传统的基于xml的配置来对spring框架进行自定义的配置.因此,在spring b ...
【Offer】[61] 【扑克牌中的顺子】
题目描述思路分析测试用例 Java代码代码链接题目描述从扑克牌中随机抽5张牌,判断是不是一个顺子,即这5张牌是不是连续的.2~10 为数字本身,A为1, J为11, Q为12,K为13,而大 ...
[币严区块链]USDT钱包节点搭建
USDT是基于BTC发的稳定币,它是比特币的一条侧链,说简单点,就是在比特币区块数据的不可篡改性与区块唯一性的基础上,再封装了一层.具体原理可网上查资料.总之理解一点:USDT的钱包节点就是BTC的钱 ...
手写RPC框架指北另送贴心注释代码一套
Angular8正式发布了,Java13再过几个月也要发布了,技术迭代这么快,框架的复杂度越来越大,但是原理是基本不变的.所以沉下心看清代码本质很重要,这次给大家带来的是手写RPC框架. 完整代码以及 ...
kafka对消费者分配分区规则（Java源码)
在上一篇 kafka topic消息分配partition规则(Java源码) 我们对生产者产生的消息分配partition规则进行了分析,那么本章我们来看看消费者是怎么样分配partition的. ...

Hadoop点滴-Hadoop的IO

Hadoop点滴-Hadoop的IO的更多相关文章

随机推荐

热门专题