如何在Hadoop中通过Bash文件实现单Mapper多Reduce任务(基于Python)
Hadoop两次Reduce任务的Bash脚本实现问题
我将mapper和reducer设置为同一脚本,以此跳过Map阶段直接执行Reduce操作,当前需要完成两次Reduce任务。Unix管道命令可以正常运行,但希望通过Bash脚本实现该逻辑。
我尝试过两种写法:
- 重复指定reducer参数:
-reducer "python3 reducer.py"\ -reducer "python3 reducer.py" - 在reducer参数中嵌套管道:
-reducer "python3 reducer.py | python3 reducer.py"
其他组合要么导致程序崩溃,要么输出结果错误,我认为存在可行方案但尚未找到,目前使用MobaXterm操作Hadoop。
解决方法
Hadoop的-reducer参数不支持重复指定,也无法直接解析参数内的Shell管道(Hadoop会把整个字符串当作单一命令执行)。正确的做法是用包装Shell脚本封装两次reducer的管道逻辑,再将该脚本指定为Hadoop的reducer。
步骤1:编写包装脚本
创建double_reducer.sh,内容如下:
#!/bin/bash python3 reducer.py | python3 reducer.py
步骤2:赋予执行权限
chmod +x double_reducer.sh
步骤3:修改Hadoop命令
在Streaming命令中指定该脚本作为reducer,同时确保所有依赖脚本都上传到任务节点:
hadoop jar $HADOOP_HOME/share/hadoop/tools/lib/hadoop-streaming-*.jar \ -files mapper.py,reducer.py,double_reducer.sh \ -mapper cat \ # 跳过Map阶段,直接传递输入 -reducer "./double_reducer.sh" \ -input /your/input/path \ -output /your/output/path
关键说明
- 用
cat作为mapper可以完全跳过Map阶段,直接将输入数据传给reducer,符合你的需求。 -files参数必须包含所有需要用到的脚本,否则任务节点会找不到文件导致失败。
内容的提问来源于stack exchange,提问作者Vitaliy Plokhovskyy
相关产品推荐
相关产品推荐

