【发布时间】:2015-04-02 20:06:17
【问题描述】:
我在 Python 中使用 scrapy,并希望检索位于另一个“扩展”元素后面的元素的内容。在检查 DOM 树时,在第一次单击父元素之前,不会加载 div 标签和文本本身。单击父级后,文本可以重新隐藏,但至少会在 DOM 中。
一个示例网站是here。我在哪里寻找摘要文本(在单击“摘要”链接之前不会加载)。
scrapy 命令是:
response.xpath("//div[@class='previewBox abstract hidden']").extract() 但这会返回一堆像这样的空 div:
u'<div id="abs_S0740002015000179" class="previewBox abstract hidden"></div>'
如果我使用这个:response.xpath("//div[@class='previewBox abstract']").extract() 那么它根本不会返回任何东西。
【问题讨论】:
标签: javascript python html web-scraping scrapy