【发布时间】:2014-06-02 15:05:38
【问题描述】:
我有一个小型数据集 mysmall,在对大型数据集 mylarge 进行流式处理时需要它。
现在可以
hadoop fs -get mysmall
hadoop jar hadoop-streaming.jar -files mysmall,myscript.py \
-reducer ... -input mylarge -output ... \
-mapper "python myscript.py mysmall"
这似乎不是最理想的 - 我从 hadoop 收集 mysmall 然后
使用-files 选项将其重新分配给所有节点。
似乎应该有一种方法告诉 hadoop 将 mysmall 复制到所有节点,然后使用 myscript.py 访问它
hadoop 路径。
有可能吗?
PS。当我说“小型数据集”时,我的意思是从单个记录(小于 1kB)到 200k 记录(4MB)的范围。
【问题讨论】: