hadoop入门(3)——hadoop2.0理论基础:安装部署方法
一、hadoop2.0安装部署流程
1、自动安装部署:Ambari、Minos(小米)、Cloudera Manager(收费)
2、使用RPM包安装部署:Apache hadoop不支持、HDP与CDH提供
3、使用jar包安装部署:各版本均提供。(初期为了理解hadoop,建议使用这种方式)
部署流程:
准备硬件(Linux操作系统)
准备软件安装包,并安装基础软件(主要是JDK)
将hadoop安装包分发到各个节点的同一个目录下,并解压
修改配置文件
启动服务
验证是否启动成功
二、hadoop2.0软硬件准备
硬件准备:测试环境仅需要一台Linux机器。生成环境需要多台Linux机器。
建议内存不小于4G(性能)
软件准备:JDK1.6+(CDH5建议JDK7)、hadoop2.0安装包。
1、建议使用非root用户安装hadoop。(hadoop某些功能不允许在root用户下操作)
2、配置SSH免密码登录:为了启动hadoop集群方便。
三、hadoop2.0安装包下载
建议选择商业公司的免费版本:主要是考虑不需要版本的选择。
http://archive.cloudera.com/cdh4/cdh/4
http://archive.cloudera.com/cdh5/cdh/5
hadoop目录结构分析:
bin:最基本的管理脚本和使用脚本所在目录。这些脚本是sbin目录下管理脚本的基础实现。
etc:配置文件所在的目录,包括core-site.xml、hdfs-site.xml、mapred-site.xml等,yarn-site.xml
include:对外提供的编程库头文件。通常用于C++程序访问HDFS。
lib:该目录包含了hadoop对外提供的编程动态库和静态库。
libexec:各个服务对应的shell配置文件所在目录。
sbin:hadoop管理脚本所在目录,主要包含HDFS和YARN中各类服务的启动关闭脚本。
share:hadoop各个模块编译后的jar包所在目录。
四、hadoop2.0测试环境(单机)搭建方法
此处仅为理论说明。
1、首先将安装包存放到某个目录下,并解压。
2、修改解压后的目录中的文件夹etc/hadoop下的xml配置文件:
hadoop-env.sh修改以下配置:export JAVA_HOME=/home/....
Slaves文件修改为以下配置:YARN001
mapred-site.xml中:mapreduce.framework.name=yarn
core-site.xml:fs.default.name=hdfs://YAR001:8020
yarn-site.xml:yarn.nodenamager.aux-services=mapreduce_shuffle
core-site.xml:dfs.replication=1
3、启动服务:
格式化HDFS: bin/hadoop namenode -format
启动HDFS:sbin/start-dfs.sh
启动YART:sbin/start-yarn.sh
4、验证是否成功:
jps查看对应的服务是否已经启动:
NameNode\DataNode\NodeManager\ResourceManager\SecondaryNameNode
访问yarn:http://yarn001:8088
访问hdfs:http://yarn001:50070
常见问题:
虚拟机搭建重启后无法启动成功:原因是/tmp文件夹被清空了,配置一个非/tmp的文件夹即可。
在core-site.xml中添加:dfs.namenode.name.dir=/xxx; dfs.datanode.data.dir=/xxxx;
五、hadoop2.0生产环境(多机)搭建方法
1、将安装包存放到某一目录下,并解压。
2、修改解压目录中的文件夹etc/hadoop下的xml配置文件。
3、格式化并启动HDFS
4、启动YARN
与单机环境的不同之处在于步骤2中修改的配置文件的内容有所不同。以及步骤3 的详细步骤不同。
HDFS HA部署方法:详见后续文章
HDFS HA+Federation的部署方法:详见后续文章
YARN部署方法:详见后续文章
hadoop入门(3)——hadoop2.0理论基础:安装部署方法的更多相关文章
- Storm-0.9.0.1安装部署 指导
可以带着下面问题来阅读本文章: 1.Storm只支持什么传输 2.通过什么配置,可以更改Zookeeper默认端口 3.Storm UI必须和Storm Nimbus部署在同一台机器上,UI无法正常工 ...
- 大数据篇:DolphinScheduler-1.2.0.release安装部署
大数据篇:DolphinScheduler-1.2.0.release安装部署 1 配置jdk #查看命令 rpm -qa | grep java #删除命令 rpm -e --nodeps xxx ...
- 微服务(入门一):netcore安装部署consul
环境准备 vs开发环境:vs2017 consul版本: 1.4.4 netcore版本:2.1 安裝Consul 1.从官网下载consul到本地,选择系统对应的版本进行下载到本地,下载地址:h ...
- kafka_2.11-2.0.0_安装部署
参考博文:kafka 配置文件参数详解 参考博文:Kafka[第一篇]Kafka集群搭建 参考博文:如何为Kafka集群选择合适的Partitions数量 参考博文:Kafka Server.prop ...
- elasticsearch+kibana+metricbeat安装部署方法
elasticsearch+kibana+metricbeat安装部署方法 本文是elasticsearch + kibana + metricbeat,没有涉及到logstash部分.通过beat收 ...
- 【原创 Hadoop&Spark 动手实践 1】Hadoop2.7.3 安装部署实践
目录: 第一部分:操作系统准备工作: 1. 安装部署CentOS7.3 1611 2. CentOS7软件安装(net-tools, wget, vim等) 3. 更新CentOS7的Yum源,更新软 ...
- hadoop2 Ubuntu 下安装部署
搭建Hadoop环境( 我以hadoop 2.7.3 为例, 系统为 64bit Ubuntu14.04 ) hadoop 2.7.3 官网下载 , 选择自己要安装的版本.注意每个版本对应两个下载选项 ...
- hadoop2.5.2安装部署
0x00 说明 此处已经省略基本配置步骤参考Hadoop1.0.3环境搭建流程,省略主要步骤有: 建立一般用户 关闭防火墙和SELinux 网络配置 0x01 配置master免密钥登录slave 生 ...
- Hadoop1.0.3安装部署
0x00 大数据平台相关链接 官网:http://hadoop.apache.org/ 主要参考教程:http://www.cnblogs.com/xia520pi/archive/2012/05/1 ...
随机推荐
- 【Codeforces710F】String Set Queries (强制在线)AC自动机 + 二进制分组
F. String Set Queries time limit per test:3 seconds memory limit per test:768 megabytes input:standa ...
- ubuntu 下简单录音
找了半天录音工具,甚至都在尝试用 pyAudio 自己写了,结果发现,原来有现成命令行工具用! 就是 sox 工具包.这个工具包有 4 个工具:sox, play, rec, soxi.rec 和 p ...
- C#的访问级别
可访问性级别有 public 访问不受限制. protected 访问仅限于包含类或从包含类派生的类型. interna ...
- NGUI Tween动画Scale与Transform冲突
NGUI中我们要同时完成Scale与Transform的效果,会发现动画并不是同我们想的那样运行的. 原因就是Tween Scale与Tween Transform的冲突调用. Tween Scale ...
- BZOJ3168: [Heoi2013]钙铁锌硒维生素
设$A^TC=B^T$,这样$C_{ij}$表示$B_j$的线性表出需要$A_i$,那么$B_j$可以替换$A_i$,根据$C=(A^T)^{-1}B^T$求出$C$.要求字典序最小完美匹配,先求任意 ...
- C#之方法的声明与调用
//params关键字使用 class Program { static void Main(string[] args){ , , , }; Console.WriteLine(AddFunctio ...
- js 获取据当前时间n天前的时间
<script type="text/javascript"> function getLastDate() { var date = new Date(); ; va ...
- WinForm------GridControl添加底部合计框
1.在GridView属性中找到"OptionsView" => "ShowFooter" = true 2.打开编辑器,如图 . 3.获取统计数据(注意 ...
- [Unity] 在协程中等待指定的毫秒
先写一个静态类: /// <summary> /// 公用基础函数库 /// <remarks>作者: YangYxd</remarks> /// </sum ...
- 阿里巴巴分布式服务框架dubbo学习笔记
Dubbo是什么? Dubbo是一个分布式服务框架,致力于提供高性能和透明化的RPC远程服务调用方案,以及SOA服务治理方案.简单的说,dubbo就是个服务框架,如果没有分布式的需求,其实是不需要用的 ...