一、HDFS核心设计

  数据块(block)

    数据块是HDFS上最基本的存储单位

    HDFS块默认大小为128M

          对块进行抽象会带来的好处

      一个小文件的大小可以大于网络中任意一个磁盘的容量

      使用块抽象而不是文件可以简化存储子系统

      块非常适合用于数据备份进而提供数据容错能力和可用性

  数据块复制

    HDFS为了做到可靠性创建多分数据块,MapReduce就可以在他们所在节点上处理这些数据了

    HDFS将每个文件存储成块序列

    每个文件的block大小和复制因子都是可配置的 HDFS-site.xml

  数据副本的存放策略

    数据分块存储和副本的存放,是保证可靠性和高性能的关键

    将每个文件的数据进行分块存储

      每一个数据块又保存有多个副本

      这些数据块副本分布在不同的机器节点上

    在多数情况下,HDFS默认的副本系数是3

    Hadoop默认对3个副本的存放策略

      第一块:在本机器的HDFS目录下存储一个block

      第二块:在不同rack(机架)的某个DataNode上存储一个block

      第三块:在该机器的同一个rack下的某台机器上存储最后一个block

      更多副本:随机节点

    设置集群block的备份数

      方法一:配置文件hdfs-site.xml

      方法二:通过命令修改备份数

        bin/hadoop fs -setrep -R 1 /

    安全模式

      安全模式是Hadoop集群的一种保护模式

      用命令来操作安全模式

        Hadoop dfsadmin -safemode leave //强制NameNode退出安全模式

        Hadoop dfsadmin -safemode enter  //进入安全模式

        Hadoop dfsadmin -safemode get      //查看安全模式状态

        Hadoop dfsadmin -safemode wait     //等待,一直到安全模式结束

    负载均衡

      机器和机器之间磁盘利用率不平衡HDFS集群非常容易出现的情况

        尤其是在DataNode节点出现故障或在现有的集群上增添新的DataNode的时候

      分析数据块分布和重新均衡DataNode上的数据分布的工具

        $HADOOP_HOME/bin/start-balancer.sh -t 10%

      负载均衡程序作为一个与独立的进程namenode进程分开执行

      心跳机制

      机架感知

        大型Hadoop集群是以机架的形式来组织的

          同一个机架上不同节点间的网络状况比不同机架之间的更为理想

        默认情况下,Hadoop的机架感知是没有被启用的

          启用机架感知功能,在namenode所在机器的core-site.xml中配置一个选项

HDFS核心设计的更多相关文章

  1. 1)HDFS分布式文件系统 2)HDFS核心设计 3 )HDFS体系结构

    一.HDFS简介 1.HDFS:Hadoop distributed file system 一个分布式文件系统 基于流数据模式访问和处理超大文件的需要而开发 适合应用在大规模数据集上 2. 优点 处 ...

  2. Hadoop2源码分析-HDFS核心模块分析

    1.概述 这篇博客接着<Hadoop2源码分析-RPC机制初识>来讲述,前面我们对MapReduce.序列化.RPC进行了分析和探索,对Hadoop V2的这些模块都有了大致的了解,通过对 ...

  3. HDFS架构设计

    原文:http://hadoop.apache.org/docs/r2.6.4/hadoop-project-dist/hadoop-hdfs/HdfsDesign.html 介绍 HDFS是个分布式 ...

  4. HDFS 核心原理

    HDFS 核心原理 2016-01-11 杜亦舒 HDFS(Hadoop Distribute File System)是一个分布式文件系统文件系统是操作系统提供的磁盘空间管理服务,只需要我们指定把文 ...

  5. 大数据技术 - 分布式文件系统 HDFS 的设计

    本章内容介绍下 Hadoop 自带的分布式文件系统,HDFS 即 Hadoop Distributed Filesystem.HDFS 能够存储超大文件,可以部署在廉价的服务器上,适合一次写入多次读取 ...

  6. HDFS的设计

    当数据集的大小超过一台独立的物理计算机的存储能力时,就有必要对它进行分区(partition)并存储到若干台单独的计算机上.管理网络中跨多台计算机存储的文件系统成为分布式文件系统(distribute ...

  7. HDFS被设计成能够在一个大集群中跨机器可靠地存储超大文件

    HDFS被设计成能够在一个大集群中跨机器可靠地存储超大文件.它将每个文件存储成一系列的数据块,除了最后一个,所有的数据块都是同样大小的.为了容错,文件的所有数据块都会有副本.每个文件的数据块大小和副本 ...

  8. 2本Hadoop技术内幕电子书百度网盘下载:深入理解MapReduce架构设计与实现原理、深入解析Hadoop Common和HDFS架构设计与实现原理

    这是我收集的两本关于Hadoop的书,高清PDF版,在此和大家分享: 1.<Hadoop技术内幕:深入理解MapReduce架构设计与实现原理>董西成 著  机械工业出版社2013年5月出 ...

  9. 大数据:Hadoop(HDFS 的设计思路、设计目标、架构、副本机制、副本存放策略)

    一.HDFS 的设计思路 1)思路 切分数据,并进行多副本存储: 2)如果文件只以多副本进行存储,而不进行切分,会有什么问题 缺点 不管文件多大,都存储在一个节点上,在进行数据处理的时候很难进行并行处 ...

随机推荐

  1. vue-cli中全局组件的注册使用

    一.全局注册 在install函数中全局注册组件,没毛病,老铁. 二.其它组件调用 直接在其他  .vue组件中直接写 <popup ref="popup">,然后就可 ...

  2. NPM的正确使用方式

    registry配置 npm registry原意为记录.登记.登记处的意思,这里指的也就是node包存放的服务器地址. 查看registry -> npm config get registr ...

  3. [日常] Go语言圣经-错误,函数值习题

    Go语言圣经-错误 1.panic异常.panic是来自被调函数的信号,表示发生了某个已知的bug 2.任何进行I/O操作的函数都会面临出现错误的可能 3.错误是软件包API和应用程序用户界面的一个重 ...

  4. 撩课-Web大前端每天5道面试题-Day36

    1.介绍一下你对浏览器内核的理解? 主要分成两部分:渲染引擎(layout engineer或Rendering Engine)和JS引擎. 渲染引擎:负责取得网页的内容(HTML.XML.图像等等) ...

  5. 随机错乱排序(sort的应用)

    新手上路,大家多多指教哈,,, #include <iostream> #include <algorithm> #include <ctime> using na ...

  6. Java - TreeSet源码解析

    Java提高篇(二八)------TreeSet 与HashSet是基于HashMap实现一样,TreeSet同样是基于TreeMap实现的.在<Java提高篇(二七)-----TreeMap& ...

  7. 【16】命令模式(Command Pattern)

    一.前言 最近项目中发现,对于设计模式的了解是必不可少的,当然对于设计模式的应用那更是重要,可以说是否懂得应用设计模式在项目中是衡量一个程序员的技术水平,因为对于一个功能的实现,高级工程师和初级工程师 ...

  8. Spring Data Redis —— 快速入门

    环境要求:Redis 2.6及以上,javase 8.0及以上: 一.Spring Data Redis 介绍 Spring-data-redis是spring的一部分,提供了在srping应用中通过 ...

  9. django使用小贴士

    问题一: RuntimeError: Model class user.models.UserAccount doesn't declare an explicit app_label 解决方案 方案 ...

  10. js-ES6学习笔记-变量的解构赋值

    1.ES6 允许按照一定模式,从数组和对象中提取值,对变量进行赋值,这被称为解构(Destructuring). 2.ES6允许写成:let [a,b,c] = [1,2,3];上面代码表示,可以从数 ...