
目录一.Hadoop1.1简单介绍1.2单点部署hadoop1.2.1下载hadoop软件包1.2.2解压软件包1.2.3配置hadoop用户1.2.4完成相关文件配置1.2.5完成免密配置1.2.6启动节点1.2.7测试1.2.8关闭服务1.3部署伪分布式hadoop集群1.3.1准备工作1.3.2完成nfs共享目录的配对1.3.3启动节点1.3.4扩展集群节点一.Hadoop官方文档Hadoop – Apache Hadoop 3.3.6https://hadoop.apache.org/docs/r3.3.6/1.1简单介绍1.说明Hadoop可以看作一个“数据仓库管理系统”但针对的是超大规模数据。它将数据拆分到多台电脑上HDFS并分发任务并行处理MapReduce。优点是便宜且容错缺点是速度较慢主要用于历史数据分析。1.2单点部署hadoop1.2.1下载hadoop软件包官方网站Apache Archive Distribution Directoryhttps://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/1.2.2解压软件包tar -zxy hadoop-3.3.6.tar.gz jdk-8u181-linux-x64.tar.gz ln -s hadoop-3.3.6 hadoop #创建软链接说明软链接便于访问1.2.3配置hadoop用户useradd hadoop passwd hadoop su - hadoop vim .bash_profile source .bash_profile1.2.4完成相关文件配置cd hadoop vim etc/hadoop/hadoop-env.sh1.2.5完成免密配置说明配置hadoop用户与localhost本机的免密配对ssh-keygen hadoop ssh-copy-id localhost测试1.2.6启动节点1.节点初始化cd hadoop bin/hdfs namenode -format2.编辑etc/hadoop/core-site.xml文件cd hadoop vim etc/hadoop/core-site.xml #编辑配置文件3.编辑etc/hadoop/hdfs-site.xml文件cd hadoop vim etc/hadoop/hdfs-site.xml #编辑配置文件说明本机部署的话只有一个机子只能复制一份4.启动脚本启动hadoopsbin/start-dfs.shnamenodes管理元数据负责指出文件的存储位置datanodes真正存储数据的节点secondary namenodes协助处理日志防止namenodes崩溃说明我们现在是单机部署所以所有节点都在server1上1.2.7测试说明进入hdfs管理系统对数据进行管理1.浏览器访问hdfs的管理界面192.168.7.191:9870 #主机IP:98702.创建用户bin/hdfs dfs -makdir /user bin/hdfs dfs -makdir /user/hadoop3.创建数据输入目录bin/hdfs dfs -makdir /input bin/hdfs dfs -put etc/hadoop/*.xml /input #复制文件到input目录下4.执行文件并将结果输入到output目录下bin/hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar grep input output dfs[a-z.]5.进入管理界面查看文件inputoutput1.2.8关闭服务cd hadoop sbin/stop-dfs.sh1.3部署分布式hadoop集群1.3.1准备工作1.准备三台机子三台机子都是CentOS 72.完成域名间的解析192.168.7.191server1namenode192.168.7.192server2datanode192.168.7.193server3datanode3.配置hadoop用户useradd hadoop passwd hadoop4.三台机子之间相互完成免密配对ssh-copy-id server1 ssh-copy-id server2 ssh-copy-id server3说明记得在hadoop用户下完成免密配对在hadoop用户下配对的是对方的hadoop用户间的免密1.3.2完成nfs共享目录的配对说明将server1的hadoop软件共享给server2和server31.安装nfs软件并启动服务yum install -y nfs-utils systemctl start nfs2.编辑server1的exports文件vim /etc/exports exportfs -rv #刷新说明允许所有外机访问server1的/home/hadoop3.server2server3远程挂载server1的/home/hadoop用户mount 192.168.7.191:/home/hadoop /home/hadoop1.3.3启动节点1.节点初始化cd hadoop bin/hdfs namenode -format2.编辑etc/hadoop/core-site.xml文件cd hadoop vim etc/hadoop/core-site.xml #编辑配置文件3.编辑etc/hadoop/hdfs-site.xml文件cd hadoop vim etc/hadoop/hdfs-site.xml #编辑配置文件说明现在集群中存在两个数据节点可以备两份。当然并不是说所有节点都必须备一份只是你的备份数要小于等于集群中的数据节点的数量4.编辑 etc/hadoop/workers 文件cd hadoop vim etc/hadoop/workers #编辑配置文件说明该节点定义存储数据的节点5.启动节点集群sbin/start-dfs.sh6.查看集群节点1.3.4扩展集群节点1.新准备一台CentOS 7虚拟机2.完成域名解析192.168.7.191server1namenode192.168.7.192server2datanode192.168.7.193server3datanode3.完成nfs配置yum install -y nfs-utils mount server1:/home/hadoop /home/hadoop说明:nfs是热启动挂载时会自动启动4.编辑 etc/hadoop/workers 文件cd hadoop vim etc/hadoop/workers #编辑配置文件5.在server4中启动nodemanager和datanode节点bin/hdfs --daemon start nodemanager bin/hdfs --daemon start datanode jps #查看集群节点