【问题标题】:Download project's source-code from Scrapinghub从 Scrapinghub 下载项目的源代码
【发布时间】:2018-01-03 11:55:43
【问题描述】:

我在Scrapinghub 上部署了一个项目,我根本没有该代码的任何副本。

如何从 Scrapinghub 在我的本地主机上下载整个项目的代码?

【问题讨论】:

    标签: python scrapy scrapinghub


    【解决方案1】:

    我能够使用

    下载项目代码
    shub fetch-eggs project_id_here
    

    在打开项目时,可以从浏览器 URL 中获取 project_id_here

    生成的文件将是 *.egg,只需使用 WinRAR 或您使用的任何其他工具将其解压缩为 ZIP 文件即可。

    补充说明:- SHUB没有用户友好的错误,一旦我使用其他帐户登录shub并尝试下载另一个不同帐户的项目,所以请确保您登录到项目所在的同一个scrapinghub帐户正在尝试下载。

    【讨论】:

      【解决方案2】:

      据我所知,目前没有用于在 Scrapy Cloud 上检索项目源代码的公共 API。 (如果错了,请纠正我。)
      但确实可以在没有额外权限的情况下检索您的项目源代码。

      作业运行时,项目相关文件位于/app路径:

      job-<some-job-id>:/app$ ls -la /app                                                                                                                                                                                                                                                                                              
      total 48                                                                                                                                                                                                                                                                                                                      
      drwxr-xr-x  5 root   root     4096 Jul 27 17:13 .                                                                                                                                                                                                                                                                             
      drwxr-xr-x 82 root   root     4096 Jul 28 04:09 ..                                                                                                                                                                                                                                                                            
      -rw-r--r--  1 root   root    26695 Jul 27 17:13 __main__.egg                                                                                                                                                                                                                                                                  
      drwxr-xr-x  2 nobody nogroup  4096 May 23 07:34 addons_eggs                                                                                                                                                                                                                                                                   
      drwxr-xr-x  2 nobody nogroup  4096 Jul 24 14:27 python                                                                                                                                                                                                                                                                        
      -rw-r--r--  1 root   root       14 Jul 24 14:27 requirements.txt
      

      __main__.egg 文件包含您所有的项目源代码。

      因此你可以:

      1. 选择一个当前正在运行的作业,访问它的控制台:https://app.scrapinghub.com/p/[project_id]/[spider_id]/[job_id]/console
      2. .egg 文件发送到您以后可能会检索到的地方,例如curl http://IP-address-of-your-own-server:8888/retrieve-file --data-binary @/app/__main__.egg(假设您已经准备好接收数据的服务)。

      或者,我想你可以随时联系 Scrapinghub 支持寻求帮助。

      【讨论】:

        猜你喜欢
        • 2017-06-06
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2015-03-14
        • 2011-01-21
        • 1970-01-01
        • 1970-01-01
        • 2011-01-30
        相关资源
        最近更新 更多