【问题标题】:Scraping multiple links by scrapy通过scrapy抓取多个链接
【发布时间】:2018-12-28 18:06:10
【问题描述】:

我抓取了一个网页以及我存储在列表中的所有有用链接,现在我想抓取列表中的那些链接。那我该怎么做呢?

【问题讨论】:

  • 欢迎。最好指出您在描述中使用的语言或框架。还请提供信息,例如到目前为止您尝试过什么。
  • 我正在使用 python 进行网页抓取,而我正在使用 python 的 scrapy 包进行网页抓取。

标签: web scrapy screen-scraping


【解决方案1】:

这是我用来做的:

for link in link_list:
   yield scrapy.Request(link, self.parse, method='GET')

使用 for 循环遍历链接列表。

【讨论】:

    【解决方案2】:

    启动你的蜘蛛:scrapy crawl spidername -O output.csv

    之后你就去你的:

        name = "spidername"
        allowed_domains = ['example.com']
        with open("output.csv","r") as f:
            reader = csv.DictReader(f, delimiter=",")
            start_urls = [items['Link'] for items in reader]
    
    

    'Link' 是您的 output.csv 中的标题

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-01-23
      • 2021-08-09
      • 1970-01-01
      相关资源
      最近更新 更多