【发布时间】:2016-12-25 22:39:36
【问题描述】:
我最近正在研究一个网站蜘蛛,并注意到它正在请求无限数量的页面,因为网站没有将其分页编码为永远停止。
因此,虽然他们只有几页内容,但仍会生成下一个链接和 url ...?page=400、...?page=401 等。
内容没有改变,只是 URL。当内容停止变化时,有没有办法让 Scrapy 停止跟随分页?或者我可以编写自定义代码。
【问题讨论】:
-
您将需要跟踪发生变化的内容并在不再发生变化时停止,即页面标题或显示结果的标题(您显然可以通过 xpath 查询分析文本)。
-
但是我如何将它链接到它即将抓取的 URL 并阻止 LinkExtractor 使用它?将其集成到 CrawlSpider 超出了我的范围。
标签: python pagination scrapy web-crawler