【发布时间】:2018-10-02 16:54:19
【问题描述】:
我正在尝试实现一个超级简单的抓取工具,它可以从网站上抓取公寓价格和平方英尺。我使用 Python + scrapy 来实现它,只有一个问题:似乎该部分是所需的信息,当作为响应返回时显示为空,并且它包含的所有内容(div、spans 等)也无法解决通过 CSS 查询。除了本节中的内容,我可以访问其他所有内容。
这是网站:https://www.251brandon.com/floorplans
这是我的初步蜘蛛的样子(在这个例子中只是寻找类“fp-price”):
import scrapy
class Brandon251Spider(scrapy.Spider):
name = "Brandon251"
def start_requests(self):
urls = [
"https://www.251brandon.com/floorplans"
]
for url in urls:
yield scrapy.Request(url=url, callback=self.parse)
def parse(self, response):
price = response.css('.fp-price').extract()
yield {
'test': price
}
返回的是一个空的 SectorList,而不是所有具有 fp-price 类的元素。
感谢您的帮助。 :)
【问题讨论】:
-
查看页面源代码(而不是检查)。您会看到该页面是通过 javascript 构建的,因此爬虫无法通过蜘蛛中指定的 CSS 选择器提取此数据。
标签: python scrapy css-selectors