Hadoop1.x安装配置文件及参数说明

本帖最后由 pig2 于 2014-3-2 02:42 编辑
阅读本文可以带着下面问题：
1.hadoop安装配置那些文件?
2.配置文件的配置参数，该如何设置?
3.Core-site.xml配置文件的作用是什么？
4.hdfs-site.xml 配置文件的作用是什么？
5.Mapred-site.xml 配置文件的作用是什么？
6.提供的默认端口是否可以改变？
此配置文件是针对Hadoop伪分布安装过程：Hadoop单机环境搭建指南（ubuntu）的文件说明：
一、常用文件及参数说明
Core-site.xml    配置Common组件的属性

hdfs-site.xml       配置hdfs参数，比如备份数目，镜像存放路径

Mapred-site.xml    配置map-reduce组件的属性

1.conf/core-site.xml

<configuration>
<property>
<name>fs.default.name</name>
<value>hdfs://localhost:9000</value>
</property>

</configuration>
复制代码

fs.default.name:代表配置NN节点地址和端口号

hdfs://localhost:9000:其中localhost替换为ip或则映射主机名

2.conf/hdfs-site.xml:

<configuration>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/home/work/hadoop_tmp</value>
</property>
</configuration>
复制代码

说明：
dfs.replication：hdfs数据块的复制份数，默认3，理论上份数越多跑数速度越快，但是需要的存储空间也更多。有钱人可以调5或者6。
上面alue值为1，代表是一份。因为安装的时候，如果是伪分布，则此值为1

hadoop.tmp.dir:
指定name镜像文件存放目录，如不指定则
默认为core-site中配置的tmp目录

3.conf/mapred-site.xml

<configuration>
<property>
<name>mapred.job.tracker</name>
<value>localhost:9001</value>
</property>
</configuration>
复制代码

说明：
mapred.job.tracker：连接jobtrack服务器的配置项，默认不写，是localhost，map数1，reduce数1

---------------------------------------------------------------------------------------------------------------------------------------------------

看到另外的帖子对此解释的也很好，贴出来给大家欣赏：

1. 在conf/hadoop-env.sh文件中增加：

export JAVA_HOME=/home/Java/jdk1.6
复制代码

2. 在conf/core-site.xml文件中增加如下内容：

<property>
              <name>fs.default.name</name>
              <value>hdfs://localhost:9000</value>
        </property>
复制代码

<!—hadoop.tmp.dir 是hadoop文件系统依赖的基础配置，很多路径都依赖它。如果hdfs-site.xml中不配置namenode和datanode的存放位置，默认就放在这个路径中-->

  <property>
      <name>hadoop.tmp.dir</name>
       <value>/home/hdfs/tmp</value>
   </property>
复制代码

3. 在conf/hdfs-site.xml中增加如下内容：

 <property>
         <name>dfs.replication</name>
         <value>1</value>
     </property>
复制代码

       <property>
             <name>dfs.name.dir</name>
             <value>/home/hdfs/name</value>
        </property>
       <property>
        <name>dfs.data.dir</name>
        <value>/home/hdfs/data</value>
   </property>
复制代码

<!—解决：org.apache.hadoop.security.AccessControlException:Permission denied:user=Administrator,access=WRITE,inode="tmp":root:supergroup:rwxr-xr-x 。
因为Eclipse使用hadoop插件提交作业时，会默认以 DrWho 身份去将作业写入hdfs文件系统中，对应的也就是 HDFS 上的/user/hadoop , 由于 DrWho 用户对hadoop目录并没有写入权限，所以导致异常的发生。解决方法为：放开 hadoop 目录的权限，命令如下：$ hadoop fs -chmod 777 /user/hadoop -->

      <property>
                   <name>dfs.permissions</name>
                   <value>false</value>
<description> If "true", enable permission checking in HDFS. If "false", permission checking is turned off,   but all other behavior is unchanged. Switching from one parameter value to   the other does   not change the mode, owner or group of files or directories
              </description>
        </property>
复制代码

4. 在conf/mapred-site.xml中增加如下内容：

<!-- mapred.job.tracker -JobTracker的主机（或者IP）和端口。-->
      <property>
       <name>mapred.job.tracker</name>
      <value>localhost:9001</value>
</property>
复制代码

---------------------------------------------------------------------------------------------------------------------------------------------------
上面是对常用文件和配置项目的说明，下面详细说一下。
二、详细参数说明

因为我们在配置文件的时候，配置文件都是空的，所以我们该如何从网上获取配置文件可以，

浏览apache官网,三个配置文件链接如下:
http://hadoop.apache.org/common/docs/r0.20.2/core-default.html
http://hadoop.apache.org/common/docs/r0.20.2/hdfs-default.html
http://hadoop.apache.org/common/docs/r0.20.0/mapred-default.html
这里是浏览hadoop当前版本号的默认配置文件，其他版本号，要另外去官网找。
其中第一个方法找到默认的配置是最好的，因为每个属性都有说明，可以直接使用。
另外，core-site.xml是全局配置,hdfs-site.xml和mapred-site.xml分别是hdfs和mapred的局部配置。

常用的端口配置对于下面端口我们是可以只定义的，仅供参考。

HDFS端口

参数	描述	默认	配置文件	例子值
fs.default.name	namenode RPC交互端口	9000	core-site.xml	hdfs://master:8020/
dfs.http.address	NameNode web管理端口	50070	hdfs-site.xml	0.0.0.0:50070
dfs.datanode.address	datanode　控制端口	50010	hdfs-site.xml	0.0.0.0:50010
dfs.datanode.ipc.address	datanode的RPC服务器地址和端口	50020	hdfs-site.xml	0.0.0.0:50020
dfs.datanode.http.address	datanode的HTTP服务器和端口	50075	hdfs-site.xml	0.0.0.0:50075

MR端口

参数	描述	默认	配置文件	例子值
mapred.job.tracker	job tracker交互端口	9001	mapred-site.xml	hdfs://master:8021/
mapred.job.tracker.http.address	job tracker的web管理端口	50030	mapred-site.xml	0.0.0.0:50030
mapred.task.tracker.http.address	task tracker的HTTP端口	50060	mapred-site.xml	0.0.0.0:50060

其他端口

参数	描述	默认	配置文件	例子值
dfs.secondary.http.address	secondary NameNode web管理端口	50090	hdfs-site.xml	0.0.0.0:28680

集群目录配置

参数	描述	默认	配置文件	例子值
dfs.name.dir	name node的元数据,以,号隔开,hdfs会把元数据冗余复制到这些目录，一般这些目录是不同的块设备，不存在的目录会被忽略掉	{hadoop.tmp.dir} /dfs/name	hdfs-site.xm	/hadoop/hdfs/name
dfs.name.edits.dir	node node的事务文件存储的目录,以,号隔开, hdfs会把事务文件冗余复制到这些目录，一般这些目录是不同的块设备，不存在的目录会被忽略掉	${dfs.name.dir}	hdfs-site.xm	${dfs.name.dir}
fs.checkpoint.dir	secondary NameNode的元数据以,号隔开,hdfs 会把元数据冗余复制到这些目录，一般这些目录是不同的块设备，不存在的目录会被忽略掉	${hadoop.tmp.dir} /dfs/namesecondary	core-site.xml	/hadoop/hdfs/namesecondary
fs.checkpoint.edits.dir	secondary NameNode的事务文件存储的目录, 以,号隔开,hdfs会把事务文件冗余复制到这些目录	${fs.checkpoint.dir}	core-site.xml	${fs.checkpoint.dir}
hadoop.tmp.dir	临时目录,其他临时目录的父目录	/tmp/hadoop-${user.name}	core-site.xml	/hadoop/tmp/hadoop-${user.name}
dfs.data.dir	data node的数据目录,以,号隔开,hdfs会把数据存在这些目录下，一般这些目录是不同的块设备，不存在的目录会被忽略掉	${hadoop.tmp.dir} /dfs/data	hdfs-site.xm	/hadoop/hdfs/data1/data, /hadoop/hdfs/data2/data
mapred.local.dir	MapReduce产生的中间数据存放目录,以,号隔开, hdfs会把数据存在这些目录下，一般这些目录是不同的块设备，不存在的目录会被忽略掉	${hadoop.tmp.dir} /mapred/local	mapred-site.xml	/hadoop/hdfs/data1/mapred/local, /hadoop/hdfs/data2/mapred/local
mapred.system.dir	MapReduce的控制文件	${hadoop.tmp.dir} /mapred/system	mapred-site.xml	/hadoop/hdfs/data1/system

其他配置

参数	描述	默认	配置文件	例子值
dfs.support.append	支持文件append，主要是支持hbase	false	hdfs-site.xml	true
dfs.replication	文件复制的副本数，如果创建时不指定这个参数，就使用这个默认值作为复制的副本数	3	hdfs-site.xml	2

-------------------------------------------------------------------------------------------------------------------------------------------------三、hadoop配置文件说明

1、dfs.hosts 记录即将作为datanode加入集群的机器列表
2、mapred.hosts 记录即将作为tasktracker加入集群的机器列表
3、dfs.hosts.exclude mapred.hosts.exclude 分别包含待移除的机器列表
4、master 记录运行辅助namenode的机器列表
5、slave 记录运行datanode和tasktracker的机器列表
6、hadoop-env.sh 记录脚本要用的环境变量，以运行hadoop
7、core-site.xml hadoop core的配置项，例如hdfs和mapreduce常用的i/o设置等
8、hdfs-site.xml hadoop守护进程的配置项，包括namenode、辅助namenode和datanode等
9、mapred-site.xml mapreduce守护进程的配置项，包括jobtracker和tasktracker
10、hadoop-metrics.properties 控制metrics在hadoop上如何发布的属性
11、log4j.properties 系统日志文件、namenode审计日志、tasktracker子进程的任务日志的属性

来自群组: Hadoop技术组

ZWSciscoccie · 发表于 2014-4-5 19:20:23

pig2 · 发表于 2014-4-27 10:58:50

这里在补充一些：
　　Hadoop有很多参数，其默认配置大多数仅适用于standalone模式，虽然大多情况下在完全分布式(Fully distributed)模式中也没有问题，但距最优化的运行模式去相去甚远。在生产环境中通常需要调整的参数有：

　　1. dfs.name.dir —— NameNode节点用于存储HDFS元数据的本地目录，官方建议为/home/hadoop/dfs/name;

　　2. dfs.data.dir —— DataNode节点用于存储HDFS文件数据块的本地目录，官方建议为/home/hadoop/dfs/data;

　　3. mapred.system.dir —— HDFS中用于存储共享的MapReduce系统文件的目录，官方建议为/hadoop/mapred/system;

　　4. mapred.local.dir —— TaskNode节点用于存储临时数据的本地文件目录;

　　5. mapred.tasktracker.{map|reduce}.tarks.maximum —— 在TaskTracker上可同时运行的的map或reduce任务的最大数目;

　　6. hadoop.tmp.dir —— Hadoop临时目录;

　　7. mapred.child.java.opts —— 每个子任务可申请使用的heap大小;官方建议为-Xmx512m;

　　8. mapred.reduce.tasks —— 每任务的reduce数量;

shlmw · 发表于 2014-10-13 15:45:51

3.conf/mapred-site.xml

<configuration>
<property>
<name>mapred.job.tracker</name>
<value>localhost:9001</value>
</property>
</configuration>

复制代码
说明：
mapred.job.tracker：连接jobtrack服务器的配置项，默认不写，是localhost，map数1，reduce数1
----------------------------------------------------------------------------
map 数，reduce数怎么设置的？

pig2 · 发表于 2014-10-13 15:51:31

shlmw 发表于 2014-10-13 15:45
3.conf/mapred-site.xml

mapreduce的个数设置比较复杂的，可参参考：

mapreduce 在elipse 下运行 reduce个数的设置问题

如何确定 Hadoop map和reduce的个数--map和reduce数量之间的关系是什么？

关于mapreduce中，map个数的确认

hive如何设置map和reduce 个数的设定