【发布时间】:2019-01-18 09:22:33
【问题描述】:
我正在尝试抓取一堆链接,或者可以附加到根域以从https://www.media.mit.edu/groups 建立链接的东西
html 本身如下所示:
<div class="container-item listing-layout-item selectorgadget_selected" data-href="/groups/viral-communications/overview/" '="">
<div class="container-item listing-layout-item selectorgadget_suggested" data-href="/groups/social-machines/overview/" '="">
<div class="container-item listing-layout-item selectorgadget_suggested" data-href="/groups/space-enabled/overview/" '="">
链接数据存储在data-href 部分中,我一直在尝试使用 CSS 选择器来获取这些数据。
当我使用 Scrapy shell 时,我一直在尝试使用
response.css('.data-href::text').extract() 但它返回一个空列表。
任何建议将不胜感激!
【问题讨论】:
标签: python xpath scrapy css-selectors scrapy-spider