HDFS的可靠性

1、冗余副本策略 2、机架策略 3、心跳机制 4、安全模式

5、校验和 6、回收站 7、元数据保护 8、快照机制

1、冗余副本策略

可以在hdfs-site.xml中设置复制因子指定副本数量
所有数据块都有副本
Datanode启动时，遍历本地文件系统，产生一份hdfs数据块和本地文件的对应关系列表（blockreport）汇报给namenode

2、机架策略

集群一般放在不同机架上，机架间带宽要比机架内带宽要小
 HDFS的“机架感知”
 一般在本机架存放一个副本，在其它机架再存放别的副本，这样可以防止机架失效时
丢失数据，也可以提高带宽利用率

3、心跳机制

Namenode周期性从datanode接收心跳信号和块报告
 Namenode根据块报告验证元数据
 没有按时发送心跳的datanode会被标记为宕机，不会再给它任何I/O请求
 如果datanode失效造成副本数量下降，并且低于预先设置的阈值，namenode会检测出这些数据块，并在合适的时机进行重新复制
 引发重新复制的原因还包括数据副本本身损坏、磁盘错误，复制因子被增大等

4、安全模式

Namenode启动时会先经过一个“安全模式”阶段
 安全模式阶段不会产生数据写
 在此阶段Namenode收集各个datanode的报告，当数据块达到最小副本数以上时，
会被认为是“安全”的
 在一定比例（可设置）的数据块被确定为“安全”后，再过若干时间，安全模式结束
 当检测到副本数不足的数据块时，该块会被复制直到达到最小副本数

5、校验和

在文件创立时，每个数据块都产生校验和
 校验和会作为单独一个隐藏文件保存在命名空间下
 客户端获取数据时可以检查校验和是否相同，从而发现数据块是否损坏
 如果正在读取的数据块损坏，则可以继续读取其它副本

6、回收站

删除文件时，其实是放入回收站/trash
 回收站里的文件可以快速恢复
 可以设置一个时间阈值，当回收站里文件的存放时间超过这个阈值，就被彻底删除，并且释放占用的数据块

7、元数据保护

映像文件刚和事务日志是Namenode的核心数据。可以配置为拥有多个副本
 副本会降低Namenode的处理速度，但增加安全性
 Namenode依然是单点，如果发生故障要手工切换

8、快照机制

支持存储某个时间点的映像，需要时可以使数据重返这个时间点的状态
 Hadoop目前还不支持快照，已经列入开发计划

怎样添加新节点？

在新节点安装好hadoop
 把namenode的有关配置文件复制到该节点
 修改masters和slaves文件，增加该节点
 设置ssh免密码进出该节点
 单独启动该节点上的datanode和tasktracker（hadoop-daemon.sh start datanode/tasktracker）
 运行start -balancer.sh进行数据负载均衡

负载均衡：

作用：当节点出现故障，或新增加节点时，数据块分布可能不均匀，负载均衡可以重新平衡各个datanode上数据块的分布

HDFS的可靠性的更多相关文章

HDFS 的可靠性
HDFS 的可靠性主要有一下几点: 冗余副本策略机架策略心跳机制安全模式效验和回收站元数据保护快照机制 1.冗余副本策略可以在hdfs-site.xml中设置复制因子指定副本数量所有 ...
何为HDFS？
该文来自百度百科,自我收藏. Hadoop分布式文件系统(HDFS)被设计成适合运行在通用硬件(commodity hardware)上的分布式文件系统.它和现有的分布式文件系统有很多共同点.但同时, ...
Hadoop学习笔记—2.不怕故障的海量存储：HDFS基础入门
一.HDFS出现的背景随着社会的进步,需要处理数据量越来越多,在一个操作系统管辖的范围存不下了,那么就分配到更多的操作系统管理的磁盘中,但是却不方便管理和维护—>因此,迫切需要一种系统来管理多 ...
Hadoop官方文档翻译——HDFS Architecture 2.7.3
HDFS Architecture HDFS Architecture(HDFS 架构) Introduction(简介) Assumptions and Goals(假设和目标) Hardware ...
hdfs工作原理
一.NameNode和DataNode (1)NameNode NameNode的作用是管理文件目录结构,是管理数据节点的.NameNode维护两套数据:一套是文件目录与数据块之间的关系,另一套是数据 ...
Hadoop第三天---分布式文件系统HDFS(大数据存储实战)
1.开机启动Hadoop,输入命令: 检查相关进程的启动情况: 2.对Hadoop集群做一个测试: 可以看到新建的test1.txt和test2.txt已经成功地拷贝到节点上(伪分布式只有一个节 ...
hadoop笔记之hdfs
1.HDFS设计基础与目标 1.HDFS设计基础与目标 (1)硬件错误是常态,因此需要冗余. (2)流式数据访问.即数据批量读取而非随机读写,Hadoop擅长做的是数据分析而不是事务处理. (3)大规 ...
每天收获一点点------Hadoop之HDFS基础入门
一.HDFS出现的背景随着社会的进步,需要处理数据量越来越多,在一个操作系统管辖的范围存不下了,那么就分配到更多的操作系统管理的磁盘中,但是却不方便管理和维护—>因此,迫切需要一种系统来管理多 ...
HDFS概述（1）————HDFS架构
概述 Hadoop分布式文件系统(HDFS)是一种分布式文件系统,用于在普通商用硬件上运行.它与现有的分布式文件系统有许多相似之处.然而,与其他分布式文件系统的区别很大.HDFS具有高度的容错能力,旨 ...

随机推荐

http协议简述
HTTP协议客户端连上web 服务器后,若想获得 web 服务器中的某个 web 资源,需遵守一定的通讯格式, HTTP 协议用于定义客户端与 web 服务器通迅的格式. WEB浏览器与 WEB 服 ...
ListView 搭配SimpleAdapter
这是SimplerAdapter的构造函数 public SimpleAdapter(Context context, List<? extends Map<String, ?>&g ...
Selenium处理时间控件
Web网页的时间控件往往嵌入到一个iframe里,抓取页面元素时,总是失败? 不要慌,WebDriver已经有相应的处理方法了. driver.switchTo().frame(driver.find ...
ubuntu server nginx 安装与配置
ubuntu server nginx 安装与配置一:关于nginx http://wiki.ubuntu.org.cn/Nginx http://nginx.org/cn http://wiki. ...
windows+tomcat 7配置二级域名访问其他web程序
1.在域名管理中做好二级域名的解析 2.在tomcat的server.xml中增加如下: <Host name="wx.ai77.cn" debug="0" ...
扒一扒JavaScript 预解释
带var关键字预解释让我们先看下这段代码执行的结果: 代码如下: alert(n);//弹出undefinedvar n = 10; 弹出的结果是undefined,为何不是10?让我们再看下面这段 ...
python中的binascii
import binascii as B s = 'abcde' h = B.b2a_hex(s) # 字符串转16进制 '6162636465' h = B.hexlify(s) # 作用同上 s ...
vs2010 ctrl+F5闪退解决方法
设置项目的属性页中的“配置属性”->“链接器”->“系统”->“子系统”->“控制台”(即增加“/SUBSYSTEM:CONSOLE”链接选项)
org.springframework.web.servlet.PageNotFound No mapping found for HTTP request with URI [/AssetRepair/assetRepairController/test.do] in DispatcherServlet with name 'assetrepair'
web.xml文件配置: xxx-servlet.xml 我们可以发现DispatcherServlet会处理"jsp"后缀的请求;而模型视图后缀也是jsp的如果这样配置会报以下 ...
Could not load file or assembly 'System.Web.Mvc' or one of its dependencies. The located assembly's manifest definition does not
因为用了MVC,在本地是没有问题的,但是部署在服务器就出现了这个问题. 出错界面如下图原因分析:上面的出错提示最后一句话翻译过来.找到的程序集清单定义与程序集引用不匹配.也就是程序引用的程序集版本和 ...

HDFS的可靠性

HDFS的可靠性的更多相关文章

随机推荐

热门专题