【问题标题】:Web scraping selector for specific element特定元素的网页抓取选择器
【发布时间】:2021-12-16 06:21:08
【问题描述】:

我是网络抓取的新手,我正在尝试使用 Scrapy 抓取以下网站的发布日期:https://m.imdb.com/title/tt0468569/?ref_=adv_li_tt

这是我正在使用的选择器:

//a[contains(@class,'ipc-metadata-list-item__list-content-item ipc-metadata-list-item__list-content-item--link')]/text()

它返回的元素太多,我只想要发布数据字符串。

【问题讨论】:

  • 仅供参考,它是 scraping (以及scrape,scraper,scraped)而不是scraping。报废意味着像垃圾一样扔掉,或者打架。

标签: css web-scraping xpath scrapy


【解决方案1】:

要选择更具体并仅获取发布日期的文本,请调整您的路径,如下所示:

//li[contains(@data-testid,'title-details-releasedate')]//li/a/text()

它将选择包含data-testid 属性值title-details-releasedate<li>。因为这些包含两个<a> 它专注于包含在另一个<li> 中的<a>

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-05-29
    • 1970-01-01
    • 2021-10-26
    • 1970-01-01
    • 2018-12-27
    相关资源
    最近更新 更多