【问题标题】:Wget - Downloading lots of files recursively is taking a long timeWget - 递归下载大量文件需要很长时间
【发布时间】:2019-09-27 14:28:35
【问题描述】:

目前我正在尝试下载一个大型数据集(200k+ 大图像)它全部存储在谷歌云上。作者提供了一个 wget 脚本来下载它:

wget -r -N -c -np --user username --ask-password https://alpha.physionet.org/files/mimic-cxr/2.0.0/

现在它正在下载等,但它已经 2 天了,它还在继续,我不知道它需要多长时间。 AFAIK 单独下载每个文件。有没有办法让我并行下载?

编辑:我没有对进行下载的机器的 sudo 访问权限。我只有用户访问权限。

【问题讨论】:

    标签: google-cloud-platform download wget


    【解决方案1】:

    wget 是一个很棒的工具,但它并不是为下载 200K 文件而设计的。

    您可以等待它完成,也可以找到另一个进行并行下载的工具,前提是您有一个快速的互联网连接来支持并行下载,这可能会比wget 减少一半的时间。

    由于源是 HTTPS 网络服务器,除了并行下载两到四个文件之外,您确实无法加快速度。根据您的 Internet 速度、与源服务器的距离,您可能无法通过并行下载获得任何改进。

    注意:您没有指定要下载的内容。如果目标是 Compute Engine 虚拟机,并且您选择了一个很小的虚拟机(f1-micro),那么您可能会受到资源限制。对于任何高速数据传输,至少选择 n1 个实例大小。

    【讨论】:

      【解决方案2】:

      如果您不知道网址,请使用旧的httrack 网站复印机并行下载文件:

      httrack -v -w https://user:password@example.com/
      

      默认为 8 个并行连接,但您可以使用 cN 选项来增加它。

      如果文件很大,您可以使用aria2c 这将下载具有多个线程的单个文件:

      aria2c -x 16 url
      

      您可以查看文件是否存储在 GCS 中,如果是,则可以使用

      gsutil -m <src> <destination>
      

      这将以多线程模式下载文件

      【讨论】:

        【解决方案3】:

        看看官方更新的 MIMIC-CXR https://mimic-cxr.mit.edu/about/download/downloads page.

        您可以在此处找到如何通过wget(本地)和gsutil(谷歌云存储)下载的信息

        【讨论】:

        • 您好!鼓励使用链接,但请始终引用重要链接中最相关的部分,以防目标站点无法访问或永久离线。
        猜你喜欢
        • 2014-01-14
        • 1970-01-01
        • 2015-08-24
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多