【发布时间】:2014-12-01 11:32:52
【问题描述】:
这听起来像是一个愚蠢的问题。 我可能会写一个 MR 代码,可以将输入和输出作为 HDFS 位置,然后我真的不需要担心 hadoop/MR 的并行计算能力。 (如果我在这里错了,请纠正我)。
但是,如果我的输入不是 HDFS 位置,则表示我将 MongoDB 数据作为输入 - mongodb://localhost:27017/mongo_hadoop.messages 并运行我的映射器和缩减器并将数据存储回 mongodb,HDFS 将如何进入画面。我的意思是如何确定 1 GB 或任何大小的大文件首先分布在 HDFS 上,然后在其上进行并行计算? 是这个直接 URI 不会分发数据,我需要取 BSON 文件,将其加载到 HDFS 上,然后将 HDFS 路径作为输入提供给 MR,还是框架足够聪明,可以自己完成?
如果上述问题太愚蠢或根本没有任何意义,我很抱歉。我对大数据真的很陌生,但很高兴能进入这个领域。
谢谢。
【问题讨论】: