【发布时间】:2012-10-01 20:49:46
【问题描述】:
我将把要做的工作大致分为两部分:
我有大量数据(大约 1 TB,分为数百个文件),我通过 distcp 从 S3 复制到 HDFS
Hadoop 流式作业(一个简单的映射器和化简器,用 python 编写)将处理此数据
现在,我必须等到所有数据都复制到HDFS,然后才能开始我的实际工作。问题来了:考虑到DISTCP 本身就是一个 map-reduce 工作,有没有办法我可以“简化”这两个工作,即第二个工作是否可以开始处理已经复制的数据(例如distcp 已经复制了一些文件,从技术上讲,第二份工作已经可以开始了)?
我希望我已经说清楚了。
【问题讨论】:
标签: python hadoop hadoop-streaming