【发布时间】:2015-01-16 12:32:57
【问题描述】:
这个问题在某种程度上是我之前提出的this 问题的后续问题。
我正在尝试抓取一个包含首页链接的网站。类似于this。
现在,因为我想抓取页面上显示的项目的详细信息,所以我提取了它们各自的 URL。
我已将这些 URL 保存在一个列表中。
如何启动蜘蛛来单独抓取页面?
为了更好地理解:
[urlA, urlB, urlC, urlD...]
这是我抓取的 URL 列表。现在我想启动一个蜘蛛来单独抓取链接。
我该怎么做?
【问题讨论】:
-
我认为您应该重新阅读earlier question 中的答案。您不会生成 URL 列表,而是从 start_request 为这些 URL 返回一个新请求对象列表。
标签: python web-scraping scrapy scrapy-spider