【问题标题】:processing file using mapreduce使用 mapreduce 处理文件
【发布时间】:2016-02-03 08:56:45
【问题描述】:

我使用简单的 pig 脚本来读取输入的 .txt 文件,并为每一行添加新文件。

然后将输出关系存储到 avro 中。

与本地模式相比,在 mapreduce 模式下运行这样的脚本有什么好处吗?

谢谢

【问题讨论】:

    标签: hadoop mapreduce apache-pig cloudera


    【解决方案1】:

    在本地模式下,您在本地机器上运行您的作业。使用 mapreduce,您可以在集群中运行您的作业(您的文件将被拆分成多个部分并在多台机器上并行处理)。

    因此,理论上,如果您的文件足够大(或者有很多这样的文件需要处理),您将能够使用 mapreduce 模式在更短的时间内完成您的工作。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-03-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多