【问题标题】:xpath question for scraping the content inside a link用于抓取链接内内容的 xpath 问题
【发布时间】:2021-03-21 02:25:51
【问题描述】:

我开始学习 scrapy,想知道如何在 excel 文件中按州获取每所学校的信息。每个状态都是指向另一个页面的链接,我不确定如何为此编写 xpath 语法。请指教。

https://www.raise.me/high-school

import scrapy
class RaisemeSpider(scrapy.Spider):
    name = 'raiseme'
    allowed_domains = ['raise.me/high-school']
    start_urls = ['http://raise.me/high-school/']
    def parse(self, response):
        h1_tag = response.xpath('//h1/text()').extract_first()
        yield {'H1 Tag': h1_tag }

【问题讨论】:

    标签: web-scraping xpath scrapy


    【解决方案1】:

    您可以使用response.xpath('//*[contains(@class, "links-list-list-item")]/a/@href').get()提取指向不同状态的链接

    SelectorGadget 是提取 xpath 和 css 选择器的有用扩展。 请记住在开发工具中禁用 javascript。对于在 scrapy shell(不带 javascript)和浏览器(带 javascript)中加载的网站,来源会有所不同。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-11-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-06-22
      • 1970-01-01
      • 1970-01-01
      • 2022-08-10
      相关资源
      最近更新 更多