Hadoop大数据批处理 -Map/Reduce
上页
Map/reduce基础
逻辑函数: Mappers and Reducers.
• 开发者编写map和reduce 函数,然后提交Jar给Hadoop集群
• Hadoop 处理分发Map 和
Reduce任务跨集群.
• 批处理
MapReduce的守护者 Daemons
•JobTracker (Master)
- 管理MapReduce 工作, 分配任务到不同节点,管理任务失败。
•TaskTracker (Slave)
- 创建独立的Map 和reduce任务
- 将任务状态报告给JobTracker
下面以计算单词个数为案例看看Map/Reduce如何工作:
假设有如下语句将输入Hadoop处理:
"Hadoop uses MapReduce"
"There is a Map phase"
"There is a Reduce phase"
经过Map处理后,也就是对分割成一个个单词如下:
(hadoop, 1)
(uses, 1)
(mapreduce, 1)
(there, 1)
(is, 1)
(a, 1)
(map, 1)
(phase, 1)
(there, 1)
(is, 1)
(a, 1)
(reduce, 1)
(phase, 1)
经过Sort排序, Shuffle洗牌,打散在一起阶段,送入Reducer进行处理,结果如下:
reducers将分三个数据块(HDFS):
0-9, a-l段包含:
(a, [1,1]),
(hadoop, [1]),
(is, [1,1])
字母m-q段包含:
(map, [1]),
(mapreduce, [1]),
(phase, [1,1])
字母r-z段包含:
(reduce, [1]),
(there, [1,1]),
(uses, 1)
注意,由于输入三段话语句中“there”存在两次 div id="PAGE_AD_1">







