【问题标题】:Use wget with Hadoop?将 wget 与 Hadoop 一起使用?
【发布时间】:2013-11-28 01:28:44
【问题描述】:

我有一个数据集(约 31GB,扩展名为 .gz 的压缩文件),它位于 Web 位置,我想在其上运行我的 Hadoop 程序。该程序是对 Hadoop 附带的原始 WordCount 示例的轻微修改。就我而言,Hadoop 安装在远程机器上(我通过 ssh 连接到该机器,然后运行我的作业)。问题是我无法将这个大型数据集传输到远程机器上的主目录(由于磁盘使用配额)。因此,我尝试搜索是否有办法使用 wget 获取数据集并将其直接传递到 HDFS(不保存在远程计算机上的本地帐户中),但没有运气。 这样的方式是否存在?还有什么其他建议可以让这个工作正常吗?

我已经尝试过使用 Yahoo!预先配置了 Hadoop 的虚拟机,但它太慢了,而且由于数据集很大,内存不足。

【问题讨论】:

    标签: java hadoop mapreduce wget


    【解决方案1】:

    在这里查看答案:putting a remote file into hadoop without copying it to local disk

    您可以通过管道将数据从 wget 传输到 hdfs。

    但是,您将遇到一个问题 - gz 不可拆分,因此您将无法在其上运行分布式 map/reduce。

    我建议您将文件下载到本地,解压缩,然后将其通过管道输入或拆分为多个文件并加载到 hdfs 中。

    【讨论】:

    • 谢谢。我已经浏览过那个线程,这就是我特别提到 .gz 扩展名的原因。但是由于您提到 .gz 不能以这种方式拆分(这回答了我的问题),我想我别无选择,只能先在本地下载该文件。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-04-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-27
    • 1970-01-01
    相关资源
    最近更新 更多