hdfs基本思想

QiaoZhi 2024-10-27 00:57:12 原文

1.hdfs的优缺点

　　（1）不适合大量小文件存储；

　　（2）不适合并发写入，不支持文件随机修改；(只能append追加)

　　（3）不支持随机读等低延时的访问方式

2.基本思想

主从结构
　　主节点， namenode
　　从节点，有很多个: datanode
namenode负责：
　　接收用户操作请求
　　维护文件系统的目录结构
　　管理文件与block之间关系，block与datanode之间关系
datanode负责：
　　存储文件
　　文件被分成block存储在磁盘上
　　为保证数据安全，文件会有多个副本

总结:

　　我们启动hdfs的时候只需要知道hadoop的etc目录下core-site.xml的hadoop的存储目录，

        <!-- 指定hadoop运行时产生文件的存储目录 -->

        <property>

            <name>hadoop.tmp.dir</name>

            <value>/opt/hadoop/hadoop-2.4./data/</value>

       </property>

　　当我们存储文件的时候会hadoop会在这个目录下建好多目录存储我们的文件，我们只需要指定相对于hdfs开始的根目录，hdfs相当于给我们提供了好多虚拟目录。hadoop会自动实现分布式存储，分别存在多个datanode节点，并通过namnode建立文件存储位置的表识。

第二种理解:

hdfs写流程:

通过客户端Client写入数据Data的流程：

（1）Client向NameNode发起写入请求；

（2）NameNode查找自身存储的关于三个DataNode的信息，并反馈给Client；

（3）Client根据反馈信息，将Data分为两个数据块1和2；

（4）Client根据反馈信息将数据块1传给DataNode1，进行保存(datanode自动完成副本备份)；

（5）DataNode向NameNode汇报存储完成，NameNode通知客户端。

hdfs读流程:

通过客户端Client读取数据Data的流程，DataNode3存放数据块1与2的备份：

（1）Client向NameNode发起读取请求；

（2）NameNode查找自身存储的关于Data的存储信息，并反馈给Client存储Data各个节点的位置；

（3）Client根据反馈信息，从DataNode1读取数据块1，从DataNode2读取数据块2；

思考:

　　基于hdfs我们可以实现类似于百度网盘的功能，将数据分布式存储，当用户申请账号的时候我们可以在hdfs的根目录给该用户创建一个目录。对于限制文件上传大小，我们可以在数据库记录该用户上传的文件大小并进行限制。

hdfs基本思想的更多相关文章

HDFS设计思想
HDFS设计思想 DataNode:用来在磁盘上存储数据 HDFS 数据存储单元( block ) 1 文件被切分成固定大小的数据block块 •默认数据块大小为 64MB(hadoop1.x版本6 ...
从一般分布式设计看HDFS设计思想与架构
要想深入学习HDFS就要先了解其设计思想和架构,这样才能继续深入使用HDFS或者深入研究源代码.懂得了"所以然"才能在实际使用中灵活运用.快速解决遇到的问题.下面这篇博文我们就先 ...
HDFS设计思想、元数据、简单JAVAAPI操作HDFS
一. 设计思路分布式文件系统在Hadoop中文件系统是一个顶层的抽象. 分布式文件系统相当与对文件系统进行了一个扩展(类似于java中的接口). HDFS是分布式文件系统的一个实现,分布式文件系统 ...
HDFS介绍
一.HDFS概述 1.HDFS设计思想来源于Google的GFS,是GFS的开源实现. 2.HDFS要解决的问题: -存储超大文件,比如TB级别 -防止文件丢失. 3.HDFS的特点 -可以存储超大文 ...
Hadoop学习笔记： HDFS
注:该文内容部分来源于ChinaHadoop.cn上的hadoop视频教程. 一. HDFS概述 HDFS即Hadoop Distributed File System, 源于Google发表于200 ...
Hadoop 3、Hadoop 分布式存储系统 HDFS
HDFS是Hadoop Distribute File System 的简称,也就是Hadoop的一个分布式文件系统. 一.HDFS的优缺点 1.HDFS优点: a.高容错性 .数据保存多个副本 .数 ...
hadoop学习之hdfs文件系统
一.hdfs的概念 Hadoop 实现了一个分布式文件系统(Hadoop Distributed File System),简称HDFS. Hadoop是Apache Lucene创始人Doug Cu ...
【大数据系列】HDFS初识
一.HDFS介绍 HDFS为了做到可靠性(reliability)创建了多分数据块(data blocks)的复制(replicas),并将它们放置在服务集群的计算节点中(compute nodes) ...
HDFS 详解
HDFS 概述基于2.7.3 HDFS 优点: 1.高容错性数据自动保存多个副本,默认是三个副本副本丢失后,会自动恢复 2.适合批处理移动计算而非移动数据,批处理的时候,数据量很大,移动数据是 ...

随机推荐

在js中对日期的加减法
以在某个日期上加减天数来说,其实只要调用Date对象的setDate()函数就可以了,对月份来说,使用setMonth(),具体方法如下: function addDate(date, da ...
【bzoj3297】[USACO2011 Open]forgot STL+dp
题目描述发生了这么多,贝茜已经忘记了她cowtube密码.然而,她记得一些有用的信息. 首先,她记得她的密码(记为变量P)长度为L(1 <= L<=1,000)字符串,并可以被分成一个 ...
[2018集训队作业][UOJ424] count [笛卡尔树+括号序列+折线法+组合数学]
题面请务必不要吐槽我的标签传送门思路一个很重要的结论:原序列的一组同构的解等价于同一棵拥有$n$个节点的笛卡尔树注意笛卡尔树的定义:父亲节点是区间最值,并且分割区间为左右部分所以如果两个序 ...
BZOJ5217：[Lydsy2017省队十连测]航海舰队——题解
https://www.lydsy.com/JudgeOnline/problem.php?id=5217 Byteasar 组建了一支舰队!他们现在正在海洋上航行着.海洋可以抽象成一张n×m 的网格 ...
BZOJ3156: 防御准备【斜率优化dp】
3156: 防御准备 Time Limit: 10 Sec Memory Limit: 512 MB Submit: 2207 Solved: 933 [Submit][Status][Discu ...
HDU.1233 还是畅通工程（Prim）
HDU.1233 还是畅通工程(Prim) 题意分析首先给出n,代表村庄的个数然后出n*(n-1)/2个信息,每个信息包括村庄的起点,终点,距离, 要求求出最小生成树的权值之和. 注意村庄的编号从 ...
Linux用户、用户组权限管理详解 --- 02
2,用户.用户组管理操作详解: 2.1 adduser 添加用户: adduser [-u uid][-g group][-d home][-s shell] -u:直接给出userID ...
软银开放Pepper开发，给机器人写安卓App是怎样一种体验？
日本软银推出的Pepper智能机器人新浪科技讯北京时间5月19日下午消息,谷歌Android移动操作系统的触角正在不断扩大,从今天开始,开发者可以为日本电信公司软银的Pepper人形机器人设计An ...
SpringMVC源码解析-DispatcherServlet启动流程和初始化
在使用springmvc框架,会在web.xml文件配置一个DispatcherServlet,这正是web容器开始初始化,同时会在建立自己的上下文来持有SpringMVC的bean对象. 先从Dis ...
洛谷P4198 楼房重建 (分块)
洛谷P4198 楼房重建题目描述小A的楼房外有一大片施工工地,工地上有N栋待建的楼房.每天,这片工地上的房子拆了又建.建了又拆.他经常无聊地看着窗外发呆,数自己能够看到多少栋房子. 为了简化问题, ...