【发布时间】:2014-06-03 01:29:11
【问题描述】:
所以我是整个大数据运动的新手,特别是 Hadoop。我想知道 HDFS 中的文件是否已经拆分,如果文件已经拆分,MapReduce 作业如何执行?例如,文本文件上的简单字数 MapReduce 作业。我的理解是,在 HDFS 中,文件将被分割并分布在数据节点上。字数统计作业是否适用于已经拆分的文件,还是它自己拆分文件?作为一名 mapreduce 程序员,不应该担心文件是如何拆分的吗?
作为后续,当 HDFS 进行文件拆分时,它是否使用任何定义的规则进行过滤和拆分?因此,例如,HDFS 是否知道按字母顺序划分块是电话簿,就像一个块中的所有 A 和另一个块中的所有 B 一样,等等?
对于这篇文章中的问题数量以及它们是否离题很抱歉。只是想在我浏览一些在线教程时进行一些澄清:) 感谢任何帮助!
【问题讨论】:
标签: hadoop mapreduce hdfs word-count