【问题标题】:Scrapy ROBOTSTXT_OBEY not working in all casesScrapy ROBOTSTXT_OBEY 在所有情况下都不起作用
【发布时间】:2014-11-06 14:06:09
【问题描述】:

所以我设置了一个 Scrapy 项目,并启用了 ROBOTSTXT_OBEY 中间件,该中间件在以下格式的 robots.txt 文件上运行良好:

用户代理:* 禁止:/tools/

但是,当网站上的同一蜘蛛具有以下格式的 robots.txt 文件时,它就不起作用了:

用户代理:* 不允许:*?next

这会导致仍被抓取的页面应该被 robots.txt 阻止,顺便说一下,robots.txt 文件的标记完全有效。

只是想知道是否有人可以解释为什么会这样?

【问题讨论】:

  • 中间件我不熟悉,你确定是robots.txt入口格式吗?可能是中间件在其文档页面上关于多个并发请求的警告吗?
  • 看起来是因为使用了不支持通配符的 Python 标准 robots.txt 解析器:/

标签: python scrapy robots.txt


【解决方案1】:

Scrapy 使用不支持通配符的 Python 标准 robots.txt 解析器。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-12-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多