【发布时间】:2020-12-15 10:03:40
【问题描述】:
我的目标
使用 Scrapy 框架从这个page 获取基本信息,但问题并不特定于这个框架。我们以h1节点内的p元素为例。
问题
我根据从 Scrapy 请求中获得的响应所做的所有选择都未能返回 h1 节点内的内容。
scrapy shell 'url'
response
>>> 200
response.xpath('//h1/p')
>>> []
获取响应:
在获取响应时,我看到一个我无法真正理解的结构,所有主要的 html 标记都被压缩并放置在一堆 javascript 样式组件之后。 file is here(1725 法分)。
我的过程
从开发工具测试选择器:从开发工具中禁用 Javascript 并测试我的选择器后,我得到了想要的结果。例如,我通过控制台的简单查询 //h1/p 获得了 <h1> 内的 <p> 元素。
不工作,请参阅问题
用 splash 测试选择器:我得到了与问题中显示的完全相同的结果。
【问题讨论】:
标签: javascript web-scraping scrapy styled-components