【发布时间】:2014-11-06 14:06:09
【问题描述】:
所以我设置了一个 Scrapy 项目,并启用了 ROBOTSTXT_OBEY 中间件,该中间件在以下格式的 robots.txt 文件上运行良好:
用户代理:* 禁止:/tools/
但是,当网站上的同一蜘蛛具有以下格式的 robots.txt 文件时,它就不起作用了:
用户代理:* 不允许:*?next
这会导致仍被抓取的页面应该被 robots.txt 阻止,顺便说一下,robots.txt 文件的标记完全有效。
只是想知道是否有人可以解释为什么会这样?
【问题讨论】:
-
中间件我不熟悉,你确定是robots.txt入口格式吗?可能是中间件在其文档页面上关于多个并发请求的警告吗?
-
看起来是因为使用了不支持通配符的 Python 标准 robots.txt 解析器:/
标签: python scrapy robots.txt