日志

MR执行流程

已有 1196 次阅读2014-12-8 17:21 |个人分类:笔记

1.执行MR的命令：
   hadoop jar <jar在linux的路径> <main方法所在的类的全类名> <参数>
   例子：
   hadoop jar /root/wc1.jar cn.itcast.d3.hadoop.mr.WordCount hdfs://itcast:9000/words /out2

2.MR执行流程
   (1).客户端提交一个mr的jar包给JobClient(提交方式：hadoop jar ...)
   (2).JobClient通过RPC和JobTracker进行通信，返回一个存放jar包的地址（HDFS）和jobId
   (3).client将jar包写入到HDFS当中(path = hdfs上的地址 + jobId)
   (4).开始提交任务(任务的描述信息，不是jar, 包括jobid，jar存放的位置，配置信息等等)
   (5).JobTracker进行初始化任务
   (6).读取HDFS上的要处理的文件，开始计算输入分片，每一个分片对应一个MapperTask
   (7).TaskTracker通过心跳机制领取任务（任务的描述信息）
   (8).下载所需的jar，配置文件等
   (9).TaskTracker启动一个java child子进程，用来执行具体的任务（MapperTask或ReducerTask）
   (10).将结果写入到HDFS当中

路过

雷人

握手

鲜花

hery的个人空间 https://aboutyun.com/?9169 [收藏] [复制] [分享] [RSS]

日志

MR执行流程

全部作者的其他最新日志

评论 (0 个评论)

hery

推荐 /2