【问题标题】:error when run scrapy crawl my_scraper -o ehadith.csv运行 scrapy crawl my_scraper -o ehadith.csv 时出错
【发布时间】:2018-10-08 13:12:09
【问题描述】:

我真的需要帮助来解决我的问题。

我有一个错误:

"[scrapy.core.engine] DEBUG: Crawled (200) <GET http://www.islam.gov.my/robots.txt> (referer: None)" 

当我尝试运行scrapy crawl my_scraper -o ehadith.csv

【问题讨论】:

    标签: python web scrapy screen-scraping


    【解决方案1】:

    这不是错误。这是一个调试级别的日志,告诉你蜘蛛成功下载了域的robots.txt 文件。

    您遇到的另一个问题是 403 响应。尝试使用AutoThrottle 扩展来减少请求并发。

    【讨论】:

    • 谢谢,我已经尝试过 AutoThrottle 扩展,但仍然收到错误“ValueError: invalid hostname: 2018-10-09 04:54:13 [scrapy.core.engine] DEBUG: Crawled (200) islam.gov.my/en/e-hadith?start=33>(引用者:无)"
    猜你喜欢
    • 2013-09-01
    • 1970-01-01
    • 1970-01-01
    • 2014-10-28
    • 1970-01-01
    • 2015-04-06
    • 2012-08-12
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多