【发布时间】:2016-02-03 08:56:45
【问题描述】:
我使用简单的 pig 脚本来读取输入的 .txt 文件,并为每一行添加新文件。
然后将输出关系存储到 avro 中。
与本地模式相比,在 mapreduce 模式下运行这样的脚本有什么好处吗?
谢谢
【问题讨论】:
标签: hadoop mapreduce apache-pig cloudera
我使用简单的 pig 脚本来读取输入的 .txt 文件,并为每一行添加新文件。
然后将输出关系存储到 avro 中。
与本地模式相比,在 mapreduce 模式下运行这样的脚本有什么好处吗?
谢谢
【问题讨论】:
标签: hadoop mapreduce apache-pig cloudera
在本地模式下,您在本地机器上运行您的作业。使用 mapreduce,您可以在集群中运行您的作业(您的文件将被拆分成多个部分并在多台机器上并行处理)。
因此,理论上,如果您的文件足够大(或者有很多这样的文件需要处理),您将能够使用 mapreduce 模式在更短的时间内完成您的工作。
【讨论】: