【发布时间】:2012-03-01 15:02:27
【问题描述】:
我有一个分层目录,每个目录有很多文件,每个文本文件中有很多url字符串。我想下载hadoop中所有文件中的所有url以获得更好的平衡。
例如,如果我有 1+5 个节点的 Hadoop 集群和 5 个 URL。那么,是 5-URLs-in-one 文件还是 1-URL-per-file(然后获取 5 个文件)作为输入更好的平衡?
我认为 Hadoop 会默认将输入集拆分为 64M 块以仅在单个节点上运行,不能运行所有 5 个从属节点。
谢谢你的回答!
【问题讨论】: