【问题标题】:i want to scrape this part我想刮掉这部分
【发布时间】:2019-03-10 14:41:26
【问题描述】:

我正在尝试抓取屏幕截图中的每个面板,但我没有获得正确的 xpath 来抓取这些部分。任何人都可以帮助我。

https://www.seloger.com/annonces/achat/appartement/paris-15eme-75/saint-lambert/142632059.htm?cp=75&idtt=2,5&idtypebien=2,1&LISTING-LISTpg=2&naturebien=1,2,4&tri=initial&

【问题讨论】:

    标签: python-3.x web-scraping scrapy


    【解决方案1】:

    此数据来自对https://www.seloger.com/detail,json,caracteristique_bien.json?idannonce=142632059 的附加请求。在那里您将获得包含全部信息的 json。

    更新:

    url_id = re.search(r'/(\d+)\.htm', response.url).group(1)
    details_url = 'https://www.seloger.com/detail,json,caracteristique_bien.json?idannonce={}'
    # make request to url
    yield Request(details_url.format(url_id))
    

    【讨论】:

    • 我怎样才能得到它
    • 在哪里可以找到这个 json 并获取其中的信息?
    • 通过这个网址。你提出要求了吗?
    • 是的,但我不知道如何获取每个广告的 url,因为我要抓取很多广告,所以我需要一个可以引导我到这个 url 的 xpath 跨度>
    • 您只需要主网址中的 id。将其应用于详细信息链接并解析结果。就是这样。我已经用代码更新了答案。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-07-21
    • 2010-11-21
    • 2018-08-29
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多