【发布时间】:2015-05-09 15:18:43
【问题描述】:
默认情况下 Hadoop 块大小为 64MB。建议 Hadoop 中的每个文件小于 64MB,这样每个文件都在一个块中。当 map 函数启动时,它可以从一个块中读取文件中的所有数据,而无需额外的数据传输。这样就实现了局部优化。
我的问题是,这条规则是否适用于可以拆分的文件?例如。大多数文本文件,csv 文件。
每个map 函数只处理一个文件的分割。并且默认的文本文件拆分器确保每个拆分都属于一个块。所以我认为对于像 CSV 格式这样的文件,即使它超过 1 个块大小,仍然可以保证局部性优化。
【问题讨论】:
标签: hadoop