【问题标题】:Parallel/Async Download of S3 data into EC2 in Python?在 Python 中将 S3 数据并行/异步下载到 EC2 中?
【发布时间】:2010-10-07 00:51:10
【问题描述】:

我在 S3 中存储了需要分析的大型数据文件。每批由约 50 个文件组成,每个文件都可以独立分析。

我想设置将 S3 数据并行下载到 EC2 实例中,并设置触发器以启动每个下载文件的分析过程。

是否有任何库可以处理异步下载、触发完整模型?

如果没有,我正在考虑使用 pyprocessing 设置多个下载进程,每个下载进程都会下载并分析单个文件。这听起来合理还是有更好的选择?

【问题讨论】:

    标签: python amazon-s3 amazon-ec2


    【解决方案1】:

    回答我自己的问题后,我最终对 Amazon S3 python 库进行了简单的修改,让您可以分块下载文件或逐行读取文件。 Available here.

    【讨论】:

      【解决方案2】:

      听起来你在找twisted

      “Twisted 是一个事件驱动的网络引擎,用 Python 编写并获得 MIT 许可。”

      http://twistedmatrix.com/trac/

      我已经在很多异步项目中使用了 twisted python,这些项目既涉及通过 Internet 进行通信,也涉及与子进程进行通信。

      【讨论】:

        【解决方案3】:

        我不知道任何已经存在的东西可以完全满足您的需求,但即使不是,它也应该很容易与 Python 组合在一起。对于线程方法,您可以查看此Python recipe,它执行多线程 HTTP 下载以测试下载镜像。

        编辑:我发现很少有软件包可以为您完成大部分工作并成为您正在寻找的东西

        【讨论】:

          猜你喜欢
          • 2011-09-25
          • 2018-06-13
          • 2023-03-19
          • 1970-01-01
          • 2023-03-27
          • 2013-10-11
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多