【发布时间】:2013-11-28 01:28:44
【问题描述】:
我有一个数据集(约 31GB,扩展名为 .gz 的压缩文件),它位于 Web 位置,我想在其上运行我的 Hadoop 程序。该程序是对 Hadoop 附带的原始 WordCount 示例的轻微修改。就我而言,Hadoop 安装在远程机器上(我通过 ssh 连接到该机器,然后运行我的作业)。问题是我无法将这个大型数据集传输到远程机器上的主目录(由于磁盘使用配额)。因此,我尝试搜索是否有办法使用 wget 获取数据集并将其直接传递到 HDFS(不保存在远程计算机上的本地帐户中),但没有运气。 这样的方式是否存在?还有什么其他建议可以让这个工作正常吗?
我已经尝试过使用 Yahoo!预先配置了 Hadoop 的虚拟机,但它太慢了,而且由于数据集很大,内存不足。
【问题讨论】:
标签: java hadoop mapreduce wget